作者审计 5 个 terminal-agent benchmarks 的 1,968 个任务,发现 323 个任务可被前沿模型仅凭任务描述 hack verifier,占 16%。hacker-fixer loop 让 hacker 找到不解题也能过 verifier 的路径,fixer 修补 verifier,solver 再确认合法解仍能通过;在 KernelBench 上,held-out 公开 exploit 的攻击成功率从 62% 降到 0%。这篇把 benchmark hardening 从人工事后修补推进到可迭代的对抗流程。
–浏览
评论 · Comments