为什么 OpenAI 开始转向使用 AI 攻击者
传统的红队演练迫使安全工程师手动探测模型——这是一个受限于人类想象力的缓慢且昂贵的过程。OpenAI 给出的答案是 GPT-Red,这是一个通过让攻击模型与防御模型进行对抗的自我博弈系统。每一轮攻击都会为防御者提供新数据;攻击者从每一次失败中学习,从而形成一个进化循环,能够挖掘出人类无法想到的漏洞利用模式。
关键数据
- 攻击成功率: GPT-Red 在 84% 的测试案例中取得成功,而人类红队人员的成功率仅为 13%。
- 模型加固: OpenAI 将 GPT-Red 的洞察直接引入训练流水线,现在的 GPT-5.6 Sol 在提示词注入失败方面的记录比四个月前发布的旗舰模型减少了六倍。
- 残留风险: 即使有了新的防御措施,仍有约 3.8% 的“强力”注入能够渗透,这一失败率与 Claude Opus 4.5 相当。
一场现场演示凸显了该系统的威力:GPT-Red 操控了 OpenAI 办公室里一台由 AI 控制的自动售货机,在没有任何人工干预的情况下更改了商品价格并取消了订单。
改进对用户意味着什么
OpenAI 表示,GPT-5.6 Sol 保持了与前代模型相同的推理速度和回答质量,从而避开了长期存在的“安全性与实用性权衡”问题(即更严格的安全防护往往会削弱实用性)。
自动化红队的局限性
自动化并不能消除所有风险。高强度注入 3.8% 的成功率表明,即使是复杂的自我博弈系统也会留下漏洞。
后续关注点
- 迭代升级: 自我博弈循环将持续进化。
总结
GPT-Red 证明了 AI 在发现同类缺陷方面可以比人类更聪明,为 GPT-5.6 实现了提示词注入失败率可衡量的六倍降低。这一突破缩小了安全性与实用性之间的差距,但仍存在微小且真实的残留风险。下一阶段的关键在于 OpenAI 如何将自动化红队的洞察与外部审查相结合,从而在日益转向使用 AI 的对手面前保持领先。
