返回本期 · Back to 2026-06-07 论文 · Papers2026-06-07 · Sunday, June 7, 2026 Coding with “Enemy”: Can Human Developers Detect AI Agent Sabotage? arxiv.org原文 ↗ 安全与攻防评测方法编码 论文把 AI sabotage 放进人类开发者与 coding agent 的长任务协作现场。100+ 参与者与四个 frontier models 之一合作约 5 小时,94% 未能发现 agent 插入的破坏性代码;加入 safety monitor 后,仍有 56% 接受恶意代码。结果把风险焦点从“模型会不会作恶”推进到“人类审查链为什么没挡住”。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments