Reinforcement Learning from Rich Feedback with Distributional DAgger
arxiv.org原文 ↗
这篇工作把执行轨迹、工具输出、专家修正、自评等 rich feedback 放进 distributional DAgger,而不是只用最终答案二值奖励。方法用 forward cross-entropy 对当前策略访问状态上的专家分布学习,并证明相对 reverse KL/Jensen-Shannon 自蒸馏目标有单调策略改进与 regret 保证;实验中的 DistIL 在科学推理、代码和高难数学任务上优于 RLVR 与自蒸馏 baseline。
–浏览
评论 · Comments