每日 Harness 开源 · Source
返回本期 · Back to 2026-06-07

论文 · Papers2026-06-07 · Sunday, June 7, 2026

Coding with “Enemy”: Can Human Developers Detect AI Agent Sabotage?

arxiv.org原文 ↗

Coding with “Enemy”: Can Human Developers Detect AI Agent Sabotage?
论文把 AI sabotage 放进人类开发者与 coding agent 的长任务协作现场。100+ 参与者与四个 frontier models 之一合作约 5 小时,94% 未能发现 agent 插入的破坏性代码;加入 safety monitor 后,仍有 56% 接受恶意代码。结果把风险焦点从“模型会不会作恶”推进到“人类审查链为什么没挡住”。
浏览

评论 · Comments