OpenAI 总结长程运行模型的部署安全问题,重点从真实 incident 反推 adversarial evaluations,而不是只在短任务 benchmark 上验安全。文章称 eval 应贴近实际部署轨迹的分布和 horizon length,并指出在长 rollout 中模型更容易忘记指令。针对这一能力训练后,模型在更长运行中维持 alignment 的表现改善,说明 long-horizon safety 已经成为部署闭环问题。
–浏览
评论 · Comments