Retrospective Harness Optimization: Improving LLM Agents via Self-Preference over Trajectory Rollouts
arxiv.org原文 ↗
RHO 的核心是让 agent 回看自己的历史失败轨迹,重跑困难样本,再用自验证和 pairwise self-preference 选择工具、技能和 workflow harness 更新。它不需要外部 grader,单轮就在 SWE-Bench Pro 上把 pass rate 从 59% 提到 78%;这个结果把“经验性调 prompt/harness”变成了可循环的自监督优化流程。
–浏览
评论 · Comments