ATOD
arxiv.org原文 ↗
ATOD 提出 Annealed Turn-aware On-policy Distillation,用于训练多轮自主 agent。摘要指出 on-policy distillation 在早期能靠 teacher guidance 快速改进,但当 student 接近 teacher 后收益会饱和;reward-driven improvement 则提供更高上限但训练更难。它的看点在于把模仿和强化信号按训练阶段、对话轮次组织起来,针对的是小模型 agent 的长程交互能力。
–浏览
评论 · Comments