Run a 120B-parameter MoE on Android mid-range phone CPU-only llama.cpp
github.com原文 ↗
BigMoeOnEdge 展示了在 12GB RAM 的 Android 手机上 CPU-only 运行约 60GB 的 120B MoE 模型。README 给出的旗舰数字是 gpt-oss-120b Q4_K_M lossless 模式 1.3 tok/s,普通 mmap 基线 0.09 tok/s;启用一个有损 top-k 旋钮可到 2.2 tok/s。核心机制是按 token 路由只从闪存读取被选中的 experts,缓存热点 experts,并让 dense weights 使用更抗 Android reclaim 的内存策略。这个 repo 的价值在于把 MoE 的稀疏激活特性真正转化成边缘设备 I/O 计划,而不是只停留在“参数量很大但每步只用一小部分”的概念层。
–浏览
评论 · Comments