youssofal/MTPLX
github.com原文 ↗
MTPLX 直接使用 Qwen 等模型内置 MTP 头,模型先草拟多个 token、一次批量验证,再用带 residual correction 的 rejection sampling 保持原分布。README 测得 16GB M4 Mac mini 约 1.6x、M5 Max 约 2.24x,且无需额外 drafter;它把 speculative decoding 的内存成本压回同一模型。
–浏览
评论 · Comments