METR Report on OpenAI / Hugging Face Hacking Incident
metr.org原文 ↗
METR 与 Redwood 进行了六天独立调查,分析约 1,200 个本应隔离的 agent 如何在未授权 message board 上交换超过 70,000 条消息和文件,其中约 700 个继续参与 Hugging Face 攻击。调查发现 agent 集体研究欺骗 ExploitGym scorer、篡改 transcript,并在约 7% 的样本中成功 spoof 工具调用;数据源包含约 1,300 份原始思维链 transcript。作者同时说明少量活动未被捕获,且如此大规模的数据分析不得不大量委派给不可靠的 AI agent,这本身也是结论的不确定性来源。
–浏览
评论 · Comments