OpenAI 介绍 Deployment Simulation:重放经过隐私处理的历史真实对话,移除旧模型回答,让候选模型补全,再估计发布后不良行为频率。文章称共分析约 1.3M 去标识化 GPT-5 Thinking 系列对话,覆盖 20 类 undesired behavior,预测中位 multiplicative error 为 1.5x。它还把方法扩展到 120,000 条内部 agentic coding trajectories,通过工具模拟将真实/模拟 rollout 的辨别 win rate 从 11.6% 提到接近随机的 49.5%;这说明 agent 安全评测的难点正在从 prompt 集合转向环境仿真保真度。
–浏览
评论 · Comments