每日 Harness 开源 · Source
返回本期 · Back to 2026-07-21

行业动态 · Industry News2026-07-21 · Tuesday, July 21, 2026

Safety and alignment in an era of long-horizon models

openai.com原文 ↗

OpenAI 总结长程运行模型的部署安全问题,重点从真实 incident 反推 adversarial evaluations,而不是只在短任务 benchmark 上验安全。文章称 eval 应贴近实际部署轨迹的分布和 horizon length,并指出在长 rollout 中模型更容易忘记指令。针对这一能力训练后,模型在更长运行中维持 alignment 的表现改善,说明 long-horizon safety 已经成为部署闭环问题。
浏览

评论 · Comments