Improved Large Language Diffusion Models
arxiv.org原文 ↗
iLLaDA 是一条非自回归路线的 8B masked diffusion language model,从头训练且使用完全双向注意力。它在 12T tokens 上预训练,并用 25B-token instruction corpus 做 12 个 epoch 的 SFT;相对 LLaDA,Base 版在 BBH 提升 21.6 分、ARC-Challenge 提升 14.9 分,Instruct 版在 MATH 提升 14.5 分、HumanEval 提升 16.5 分。论文最有价值的是给 diffusion LLM 提供了接近同量级自回归模型的训练配方与公开权重路径。
–浏览
评论 · Comments