每日 Harness 开源 · Source
返回本期 · Back to 2026-07-16

行业动态 · Industry News2026-07-16 · Thursday, July 16, 2026

GPT-Red: Unlocking Self-Improvement for Robustness

openai.com原文 ↗

OpenAI 介绍 GPT-Red,一个通过 self-play reinforcement learning 训练的自动红队模型。文章给出的关键数字是:GPT-Red 在间接 prompt injection arena 上达成 84% 攻击成功率,人类红队为 13%;GPT-5.6 Sol 在最难 direct prompt injection benchmark 上比四个月前最佳生产模型的失败次数减少 6 倍。它代表安全训练从人工红队案例收集走向自动化漏洞挖掘和闭环修复。
浏览

评论 · Comments