每日 Harness 开源 · Source
返回本期 · Back to 2026-06-26

论文 · Papers2026-06-26 · Friday, June 26, 2026

Improved Large Language Diffusion Models

arxiv.org原文 ↗

Improved Large Language Diffusion Models
iLLaDA 是一条非自回归路线的 8B masked diffusion language model,从头训练且使用完全双向注意力。它在 12T tokens 上预训练,并用 25B-token instruction corpus 做 12 个 epoch 的 SFT;相对 LLaDA,Base 版在 BBH 提升 21.6 分、ARC-Challenge 提升 14.9 分,Instruct 版在 MATH 提升 14.5 分、HumanEval 提升 16.5 分。论文最有价值的是给 diffusion LLM 提供了接近同量级自回归模型的训练配方与公开权重路径。
浏览

评论 · Comments