Anthropic 的 Opus 5 在浏览器提示词注入攻击中实现了 0% 的成功率

随着 Opus 5 的发布,Anthropic 在 AI 安全领域取得了里程碑式的突破,有望解决自主智能体(autonomous agents)中最持久的一个漏洞。通过实施双层防御系统,该模型展示了对基于浏览器的提示词注入(prompt injection)攻击近乎完全的免疫力。

AI 智能体中的提示词注入危机

提示词注入仍然是当前 AI 时代的“阿喀琉斯之踵”。当攻击者在网页中隐藏恶意指令(通常通过不可见文本实现),而 AI 智能体在浏览时读取这些内容时,就会发生这种漏洞。一旦指令被处理,它们可能会劫持模型,迫使模型绕过安全协议或执行未经授权的操作。虽然像 OpenAI 这样的行业领导者此前曾暗示,提示词注入可能是大语言模型(LLM)无法解决的固有缺陷,但 Anthropic 的最新数据挑战了这种悲观的观点。

实现 0% 的基准指标

根据 Anthropic 的系统卡(system card),Opus 5 在专为浏览器智能体设计的 129 种不同测试场景中,实现了惊人的 0% 攻击成功率。这比之前的版本有了显著飞跃。在安全公司 Gray Swan 进行的常规提示词注入测试中,Opus 5 较其前代产品表现出了巨大的进步;在 15 次尝试后,攻击成功率从 5.5%(在 Opus 4.8 中观察到)降至仅 2.0%。

这一表现使 Opus 5 位居 Gray Swan IPI 基准测试之首,超越了 Mythos 5 (2.6%) 和 Fable 5 (2.8%) 等其他顶级模型。

核心秘诀:Auto Mode 与双层防御

这一突破不仅仅归功于模型的智能,更在于其与专业软件的集成。“零成功率”特别与 Claude Cowork 等产品中使用 Auto Mode 有关。Anthropic 利用复杂的双层防御架构来保护智能体:

  1. 预处理扫描 (Pre-processing Scan): 在主 LLM 处理文本之前,一个专用层会扫描所有输入数据,以查找隐藏或具有操纵性的指令。
  2. 执行拦截 (Execution Blocking): 第二层会监控智能体的预期操作,在任何危险命令于浏览器环境中执行之前将其拦截。

有趣的是,数据表明仅靠模型本身并不是万能药。如果没有这些保护性软件层,Opus 5 的漏洞率处于 3.7%。事实上,专门的 Sonnet 5 模型在独立运行时表现略好,成功率为 0.93%。正是核心模型与防御软件栈之间的协同作用,将安全阈值推向了近乎完美的水平。

为什么这对 AI 的未来至关重要

对于构建自主 AI 智能体的开发者和创始人来说,这一进展是一个范式转移。如果提示词注入可以通过架构层而非仅仅通过模型训练来中和,那么通往可靠的“智能体化”(agentic)工作流(即 AI 管理电子邮件、浏览器和敏感数据)的道路将变得安全得多。Anthropic 为行业如何摆脱“无法解决”的论调,转向稳健、可投入生产的 AI 自主化提供了一份蓝图。

核心要点

  • 行业领先的安全性能: 在使用 Auto Mode 时,Opus 5 在 129 种基于浏览器的提示词注入场景中达到了 0% 的成功率。
  • 深度防御 (Defense-in-Depth): 安全性是通过涉及预处理数据扫描和主动操作拦截的双层方法实现的。
  • 基准测试统治力: Opus 5 在 Gray Swan IPI 基准测试中处于领先地位,与之前的模型版本相比,显著降低了攻击者的成功率。