Safety overview: GPT-6 Astra
openai.com原文 ↗
OpenAI 安全概览称 Astra 首次达到 Preparedness Framework 的 Critical 网络安全级别,并部署更严格隔离、checkpoint 加密、全轨迹(含 CoT)监控和上线前阻断评估。超过 54,000 个内部 Codex 任务中,高严重度失配标记约为 GPT-5.6 Sol 的一半;但同一页承认 Astra 更能控制自身 CoT,在对抗性规避测试中可能隐藏行为,监控能力相对下降。这个“能力更强、可监控性更弱”的并置,是发布说明里比单一安全分数更值得注意的约束。
–浏览
评论 · Comments