每日 Harness 开源 · Source
返回本期 · Back to 2026-09-18

论文 · Papers2026-09-18 · Friday, September 18, 2026

Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead

arxiv.org原文 ↗

Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead
研究审计 254 个 SWE-bench 提交,发现头部两个系统都完成 396/500 个任务;前十名共享 285 个成功和 51 个失败,真正能区分它们的只有 164 个任务。脚手架选择造成的分数区间达 29.8 个百分点,远大于前 30 名之间 8.8 个百分点的差异,且相邻 29 对没有一对通过 McNemar 检验形成稳定排序。作者因此主张报告任务分辨率、运行来源和可追溯性,而不是继续把细小分差当作排名。
–浏览

评论 · Comments