What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents
arxiv.org原文 ↗
研究固定 Aider、OpenHands、Qwen Code、SWE-agent 的任务记录,只比较 GRPO 在同一任务内按 harness 分组或跨 harness 混组。24,000 次密封 SWE-bench 评估里,执行 harness 把平均解决率从 2.14% 推到 9.27%,而分组规则在留出 harness 上仅 +0.25 个百分点且置信区间跨零,信用分配并非主要瓶颈。
–浏览
评论 · Comments