SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents
arxiv.org原文 ↗
基准从 75 个 Python 仓库的真实 review 评论抽取约束,构造 303 个带功能测试、约束测试和对照补丁的修复实例。四个后端的 644 个功能通过补丁中,221 个没满足 review 约束;这个 34.3% 的隐藏失败比例揭示“测试绿了”与“可以合并”之间仍有可测差距。
–浏览
评论 · Comments