每日 Harness 开源 · Source
返回本期 · Back to 2026-06-27

论文 · Papers2026-06-27 · Saturday, June 27, 2026

Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

arxiv.org原文 ↗

Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
这篇论文从 RL post-training 里“免费”抽出 agent 过程奖励:RL policy 与 reference policy 的 log-probability ratio 被解释为 progress advantage,用来做 step-level scoring。作者在五个 benchmark、四个 model family 上把它用于 test-time scaling、不确定性估计和 failure attribution,结果优于 confidence baseline,且在无需任务专门训练的条件下超过 dedicated reward models。它值得看的是把过程监督从额外标注问题转成训练副产物问题,适合关心 agent 轨迹评估成本的人。
浏览

评论 · Comments