每日 Harness 开源 · Source
返回本期 · Back to 2026-06-30

论文 · Papers2026-06-30 · Tuesday, June 30, 2026

ATOD

arxiv.org原文 ↗

ATOD
ATOD 提出 Annealed Turn-aware On-policy Distillation,用于训练多轮自主 agent。摘要指出 on-policy distillation 在早期能靠 teacher guidance 快速改进,但当 student 接近 teacher 后收益会饱和;reward-driven improvement 则提供更高上限但训练更难。它的看点在于把模仿和强化信号按训练阶段、对话轮次组织起来,针对的是小模型 agent 的长程交互能力。
浏览

评论 · Comments