OpenAI 今日推出了 GPT-Red,这是一款充当自动化红队黑客的大语言模型。该系统已经在强化公司最新的 GPT-5.6 模型,将模拟攻击的成功率从 90% 以上大幅降低至 23% 以下。

GPT-Red 如何实现红队工作的自动化

红队测试——即故意尝试破坏或劫持系统——传统上依赖于安全专家。随着 LLM 学会浏览网页、运行代码和调用第三方服务,它们被滥用的方式增长速度超过了人类团队的探索速度。

OpenAI 通过一种“自我博弈循环”(self-play loop)来应对这一挑战,在研究人员称之为“道场”(dojo)的模拟环境中,让一个模型的副本与另一个副本进行对抗。在这个沙盒中,GPT-Red 扮演攻击者角色,而一个或多个防御模型则试图进行抵抗。双方进行无数轮次的对抗;每一次迭代都迫使攻击者发现更细微的缺陷,并迫使防御者学习新的防御手段。OpenAI 将这一过程融入了生产 GPT-5.6 的训练流水线中,该公司称其为迄今为止最稳健的版本。

一种新型攻击:虚假思维链

自我博弈运行揭示了一种引人注目的“虚假思维链”(fake chain of thought)攻击。LLM 通常会生成逐步的推理轨迹——即“思维链”——来引导最终答案。GPT-Red 学会了在该轨迹中插入伪造条目,使模型误以为自己已经验证了错误的假设。例如,攻击者可以使模型相信“1 + 1 = 3”已经过检查,从而促使系统基于编造的结果生成输出。

这种攻击并不局限于纯文本生成器。在针对外部实验室构建的自动售货机式智能体“Vendy”的测试中,GPT-Red 操纵了价格字段并取消了订单,证明了该技术对根据用户指令执行任务的专用智能体同样有效。

可衡量的安全性提升

OpenAI 发布的数据显示了针对 GPT-Red 进行训练的影响。当使用新模型生成的强度最高的攻击针对 8 月发布的 GPT-5 进行测试时,成功率超过 90%。而同样的攻击针对 GPT-5.6 时,成功率不足 23%。

在一项 2025 年将 GPT-Red 与人类红队人员进行对比的实验中,AI 发现并改进攻击变体比人类更高效,这表明对抗模型可以在更短的时间内探索更广泛的漏洞空间。

局限性以及对人类专业知识的持续需求

GPT-Red 并不能取代人类安全分析师。它在处理多轮对话攻击(攻击者通过多次交流构建叙事)以及将恶意文本隐藏在图像中的视觉提示注入(visual prompt injections)时仍然会遇到困难。OpenAI 计划将该模型作为第一线探测工具,提出有潜力的攻击思路,供人类专家进行调查和扩展。

该工具仍属于专有技术,因此外部研究人员无法直接测试其能力或验证报告中所述的提升。