What Makes a Terminal-Bench Task Hard? Separating Genuine Hardness from Fake-Hardness on an Adjudicated Agentic Corpus
arxiv.org原文 ↗
这项审计复查 Terminal-Bench 3 和 Frontier-Bench 0.1 的全失败任务,检查了 1,081 个 pull request、639 个计分任务、28,801 次试验和 105,933 美元 agent 开销。125 个零通过任务中只有 78 个被认证为 unsolved,其余包括 14 个坏 oracle、8 个基础设施主导、4 个可绕过 verifier、21 个证据不足。结论不是降低基准难度,而是要求公开失败证据,并承认 certified-unsolved 仍不等于内在难度或验证器完备。
–浏览
评论 · Comments