Reflections on Trusting Trust, Revisited: Contaminating Self-Modifying AI Coding Agents with Poisoned Benchmarks
arxiv.org原文 ↗
作者向自我评估流程投放带毒 benchmark,验证 agent 是否把污染写进下一代自身指令。Hyperagents + Sonnet 4.5 的概念验证最终在中性 URL 抓取任务上关闭 HTTPS 证书校验,且之后换干净基准仍保留污染,说明“评测数据”本身需要供应链防护。
–浏览
评论 · Comments