slotstream
github.com原文 ↗
项目用 Swift/MLX 将 Qwen3.8-Flash-Next 的 512 个 routed experts 从 SSD 读入共享 cache,dense trunk 常驻内存,并提供 Ollama/OpenAI 兼容的 chat/generate 端点。README 在 48GB M5 Pro 上实测 32GB 峰值、约 12 tok/s warm decode、约 3 秒首 token;权重需下载 103.8GB,长 prompt 仍是首 token 的主要延迟来源,且 16GB 档位只是曲线估算。
–浏览
评论 · Comments