Qwen3.6-35B-A3B on 16 GB M1 Pro
github.com原文 ↗
ds4 展示在 16 GB M1 Pro 上运行 Qwen3.6-35B-A3B 这类 MoE 模型的路径,重点是通过 SSD-streamed MoE 降低常驻内存需求。具体机制是把不活跃专家权重放在 SSD 上,在推理时按需流式加载,从而用存储带宽换内存容量。它不是追求数据中心吞吐的方案,而是本地低内存设备运行大 MoE 的可行性实验。
–浏览
github.com原文 ↗
评论 · Comments