The Verification Horizon: No Silver Bullet for Coding Agent Rewards
arxiv.org原文 ↗
论文把 verifier 质量拆成 scalability、faithfulness、robustness,并指出测试、LLM judge、用户反馈和 agentic evaluator 都无法同时满足三者。一个具体结果是 SWE 类任务中加入 quality judge 与 trajectory monitoring 后,hacked resolved rate 从 28.57% 降到 0.56%,clean resolved rate 从 40.22% 升到 60.53%。它的局限也清楚:结论不是某个奖励函数胜出,而是验证基础设施要持续迭代。
–浏览
评论 · Comments