每日 Harness 开源 · Source
返回本期 · Back to 2026-09-19

论文 · Papers2026-09-19 · Saturday, September 19, 2026

Reflections on Trusting Trust, Revisited: Contaminating Self-Modifying AI Coding Agents with Poisoned Benchmarks

arxiv.org原文 ↗

Reflections on Trusting Trust, Revisited: Contaminating Self-Modifying AI Coding Agents with Poisoned Benchmarks
作者向自我评估流程投放带毒 benchmark,验证 agent 是否把污染写进下一代自身指令。Hyperagents + Sonnet 4.5 的概念验证最终在中性 URL 抓取任务上关闭 HTTPS 证书校验,且之后换干净基准仍保留污染,说明“评测数据”本身需要供应链防护。
–浏览

评论 · Comments