Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation
arxiv.org原文 ↗
OPDLM 把自回归语言模型转成扩散语言模型时,用 on-policy distillation 避免两个分布偏移:ARLM 目标到 DLM 目标的知识损失,以及随机 mask 训练与 confidence decoding 推理的 mismatch。学生模型在自己的推理轨迹上学习,冻结 ARLM 教师提供 logits;论文称训练 token 需求减少 15x 到 7000x。
–浏览
评论 · Comments