Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead
arxiv.org原文 ↗
研究审计 254 个 SWE-bench 提交,发现头部两个系统都完成 396/500 个任务;前十名共享 285 个成功和 51 个失败,真正能区分它们的只有 164 个任务。脚手架选择造成的分数区间达 29.8 个百分点,远大于前 30 名之间 8.8 个百分点的差异,且相邻 29 对没有一对通过 McNemar 检验形成稳定排序。作者因此主张报告任务分辨率、运行来源和可追溯性,而不是继续把细小分差当作排名。
–浏览
评论 · Comments