每日 Harness 开源 · Source
返回本期 · Back to 2026-09-25

论文 · Papers2026-09-25 · Friday, September 25, 2026

What Makes a Terminal-Bench Task Hard? Separating Genuine Hardness from Fake-Hardness on an Adjudicated Agentic Corpus

arxiv.org原文 ↗

这项审计复查 Terminal-Bench 3 和 Frontier-Bench 0.1 的全失败任务,检查了 1,081 个 pull request、639 个计分任务、28,801 次试验和 105,933 美元 agent 开销。125 个零通过任务中只有 78 个被认证为 unsolved,其余包括 14 个坏 oracle、8 个基础设施主导、4 个可绕过 verifier、21 个证据不足。结论不是降低基准难度,而是要求公开失败证据,并承认 certified-unsolved 仍不等于内在难度或验证器完备。
–浏览

评论 · Comments