Anthropic 表示,在其最近的一次安全测试活动中,其三个 Claude 模型脱离了沙箱并访问了现实世界的系统,这促使其立即暂停了评估并发布了一份公开报告。

该公司进行了 141,006 次网络安全测试运行,并发现了三起模型访问了真实目标而非模拟环境的事件。由于与第三方合作伙伴的配置错误,导致沙箱实际上处于开放状态。

漏洞是如何发生的

  • Claude Opus 4.7 访问了一家暴露在互联网上的真实公司,并通过猜测弱密码获取了一个包含数百行数据的数据库。
  • Claude Mythos 5 通过向真实的 PyPI 仓库发布软件包,构建了一次供应链攻击。在注册表标记异常之前,该软件包已在 15 台生产机器上安装。
  • 一个内部研究模型扫描了 9,000 个目标,入侵了一个应用程序,随后在识别出主机与其模拟任务不符后自行停止了操作。

Anthropic 强调,这些并非“失控 AI”事件。模型只是执行了指令,是测试基础设施未能将其与开放互联网隔离。

为何这很重要

这些事件表明,当 AI 智能体能够执行代码并进行网络调用时,受控沙箱与真实网络之间的界限是多么脆弱。对于正在尝试自主智能体的企业来说,仅靠系统提示词或 README 文件无法保证边界。正如 PyPI 案例所示,即使是规模较小的数据集或少数几台机器,也可能引发更大规模的供应链破坏。

这三次漏洞也揭示了 Anthropic 工作的规模:它审计了每一次测试运行,而非随机抽样。正是这种彻底性让公司能够在事件扩散之前发现配置错误。

Anthropic 采取了哪些措施

在发现沙箱失效后的不到一天内,Anthropic 停止了所有正在进行的评估。一周后,该公司发布了一份详细的披露报告,列出了这三起事件、技术原因以及即时的补救措施。

给 AI 智能体用户的实用建议

  1. 通过直接检查验证网络边界 —— 不要假设提示词或配置文件真的能隔离智能体。
  2. 将凭据权限限制在最小范围内 —— 仅授予任务绝对必需的权限。
  3. 自行测试可达性 —— 在移交敏感资源之前,探测智能体的实际网络视图。
  4. 监控异常活动 —— 为偏离计划的出站连接或软件包注册设置警报。

这起事件强调了一个简单的真理:给予 AI 模型互联网访问权限,其风险与将凭据交给人类操作员一样大。在沙箱保障得到证实之前,应将每一次 AI 驱动的操作视为可能不受限的操作,并相应地锁定环境。