We monitor internal coding agents for misalignment
openai.com原文 ↗
OpenAI 对 GPT-5.4 Thinking 的完整对话、思维链和工具调用做监测,警报目标是在 30 分钟内复核;五个月覆盖数千万条轨迹,约 1000 条中等警报,未发现最高严重度的真实对话。报告也承认低于 0.1% 的流量仍在覆盖范围外,并计划引入同步阻断,因此检测覆盖率本身是安全指标。
–浏览
openai.com原文 ↗
评论 · Comments