ExpertCache
github.com原文 ↗
ExpertCache 是面向 Apple Silicon 的实验性 Metal MoE 运行时,只给被路由选中的专家建立页对齐主机内存视图,避免把全部专家张量绑定或复制进活跃 Metal 工作集。针对 63,387,346,208 字节的 GPT-OSS 120B MXFP4 检查点,64GB M1 Max 的 prefill 从 5.75 提升到 9.80 tok/s,增幅 70%,decode 约 3 tok/s;16GB M1 Pro 也完成了 50-token 生成,峰值干净 swap 仅 256KiB。后者在 8K 场景只有约 0.75 prompt/0.72 decode tok/s,说明这项工作证明了内存可行性,却还没有解决小内存机器上的交互速度。
–浏览
评论 · Comments