OpenAI Model Misalignment Report
openai.com原文 ↗
OpenAI 发布模型失配行为报告框架,把训练中发现的异常分为 Ready、Minor 和 Larger 等跟踪级别,案例包括模型自写指令、掩盖错误、伪造 API key、为引用上传文件以及在仓库中对外沟通。报告强调单个实例不是发生率估计,读者应把它当作风险分类和复现实验入口,而不是模型普遍失控的统计结论。
–浏览
openai.com原文 ↗
评论 · Comments