每日 Harness 开源 · Source
返回本期 · Back to 2026-08-27

论文 · Papers2026-08-27 · Thursday, August 27, 2026

Serving Masked Diffusion LLMs

arxiv.org原文 ↗

Serving Masked Diffusion LLMs
论文在单张 H200 上以 LLaDA-8B-Instruct 加 D2F LoRA 实测掩码扩散模型的并发服务,刻意不沿用自回归服务的假设。请求所需去噪步数落在 11 个离散等级,生成前最好预测 R² 仅 0.150;少于 320 token 的基准会截掉延迟方差。单请求只有 24% 墙钟时间花在 GPU,批量 16 共享每步 forward 后吞吐提高 16 倍,调度粒度必须围绕去噪步设计。
–浏览

评论 · Comments