每日 Harness 开源 · Source
返回本期 · Back to 2026-06-10

论文 · Papers2026-06-10 · Wednesday, June 10, 2026

Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops

arxiv.org原文 ↗

Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops
作者审计 5 个 terminal-agent benchmarks 的 1,968 个任务,发现 323 个任务可被前沿模型仅凭任务描述 hack verifier,占 16%。hacker-fixer loop 让 hacker 找到不解题也能过 verifier 的路径,fixer 修补 verifier,solver 再确认合法解仍能通过;在 KernelBench 上,held-out 公开 exploit 的攻击成功率从 62% 降到 0%。这篇把 benchmark hardening 从人工事后修补推进到可迭代的对抗流程。
浏览

评论 · Comments