每日 Harness 开源 · Source
返回本期 · Back to 2026-06-09

论文 · Papers2026-06-09 · Tuesday, June 9, 2026

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

arxiv.org原文 ↗

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation
OPDLM 把自回归语言模型转成扩散语言模型时,用 on-policy distillation 避免两个分布偏移:ARLM 目标到 DLM 目标的知识损失,以及随机 mask 训练与 confidence decoding 推理的 mismatch。学生模型在自己的推理轨迹上学习,冻结 ARLM 教师提供 logits;论文称训练 token 需求减少 15x 到 7000x。
浏览

评论 · Comments