Serving Masked Diffusion LLMs
arxiv.org原文 ↗
论文在单张 H200 上以 LLaDA-8B-Instruct 加 D2F LoRA 实测掩码扩散模型的并发服务,刻意不沿用自回归服务的假设。请求所需去噪步数落在 11 个离散等级,生成前最好预测 R² 仅 0.150;少于 320 token 的基准会截掉延迟方差。单请求只有 24% 墙钟时间花在 GPU,批量 16 共享每步 forward 后吞吐提高 16 倍,调度粒度必须围绕去噪步设计。
–浏览
评论 · Comments