每日 Harness 开源 · Source
返回本期 · Back to 2026-06-11

论文 · Papers2026-06-11 · Thursday, June 11, 2026

Retrospective Harness Optimization: Improving LLM Agents via Self-Preference over Trajectory Rollouts

arxiv.org原文 ↗

Retrospective Harness Optimization: Improving LLM Agents via Self-Preference over Trajectory Rollouts
RHO 的核心是让 agent 回看自己的历史失败轨迹,重跑困难样本,再用自验证和 pairwise self-preference 选择工具、技能和 workflow harness 更新。它不需要外部 grader,单轮就在 SWE-Bench Pro 上把 pass rate 从 59% 提到 78%;这个结果把“经验性调 prompt/harness”变成了可循环的自监督优化流程。
浏览

评论 · Comments