研究人员表明,加密的推理轨迹(encrypted reasoning traces)——即提供商发送到用户设备的小型数据包,以便对话可以在不同模型之间跳转——可以被同一服务的较弱模型解密,从而泄露数百个凭据和私人细节。这项研究详述于论文 Stealing Reasoning Traces from Proprietary LLM APIs 中,它威胁到了 Anthropic、OpenAI 和 Google 为保持 AI 对话流畅而依赖的一项便捷功能。

为什么存在加密数据块

当你与大语言模型 (LLM) 对话时,服务会构建一个“推理轨迹”:即导致答案生成的内部提示词、工具调用和思维链 (chain-of-thought) 步骤的链条。为了让你在不丢失该链条的情况下从大型模型切换到廉价模型,提供商会对轨迹进行加密,将其发送到你的设备,并期望你在下一次请求时将其发回。加密旨在保持轨迹私密性的同时,仍能实现跨会话、跨模型的连续性。

攻击是如何运作的

研究人员演示了一种无需破解强模型本身的“三步走”漏洞利用方式:

  1. 捕获 在正常对话期间由强大模型生成的加密推理块。
  2. 喂给 同一提供商的较弱模型,并要求其“读取”该块。
  3. 由于较弱模型共享相同的解密密钥,它会以明文形式输出解密后的内容。

较弱模型充当了“解密预言机” (decryption oracle)。攻击者从未触及强模型的内部;他们只是利用提供商自身的 API 来攻击其自身。

研究人员找回了什么

  • 182 个凭据 – 嵌入在轨迹中的 API 密钥、令牌和其他秘密。
  • 367 条私人信息 – 用户在聊天过程中提供的姓名、电子邮件、地址等。
  • 提示词注入载荷 (Prompt-injection payloads) – 隐藏在加密块中的恶意指令,在稍后重放轨迹时可能会被执行。
  • 安全过滤器绕过 – 解密后的轨迹揭示了如果以明文检查则会被拦截的步骤,从而允许危险内容溜过。

论文强调,这种弱点并非加密算法本身的缺陷;加密本身是稳固的。漏洞源于为了用户体验而允许提供商集群中的任何模型都能解密该块的设计选择。

问题核心的权衡

提供商在 API 中构建这种“模型切换”功能,是因为开发者和最终用户非常看重连续性。如果加密与单个模型实例或会话绑定,平滑的交接就会中断,迫使开发者必须自行构建状态管理。论文认为,安全性为了灵活性而被刻意牺牲了。

开发者现在应该怎么做

  • 将加密轨迹视为明文。假设任何存储它们的日志、缓存或监控系统都可能被攻击者读取。
  • 避免将轨迹提交到公共仓库。即使是一个零散的加密块也可能暴露数十个秘密。
  • 为更严格的控制做好准备。提供商可能会加强安全措施,这可能会改变构建多模型智能体 (agents) 的方式。
  • 转向显式状态交接。与其依赖隐藏的推理,不如设计智能体输出结构化数据(JSON、XML 等),以便在模型之间安全传递,而无需加密。
  • 审计你的提示词。查找任何最终进入推理链的敏感数据,并在发送请求前将其剔除。

值得关注的大型提供商动向

该论文的发布将促使 Anthropic、OpenAI 和 Google 重新评估其 API 中内置的解密策略。

更广泛的影响

这一发现凸显了一个经典的安全性困境:便利往往会打开后门。通过允许任何模型解密用户拥有的数据块,提供商为攻击者提供了一条获取敏感数据的低成本路径。修复方案可能会使 AI 集成变得稍微繁琐一些,但它也将恢复“加密数据应保持加密”的预期。

核心结论: 加密推理轨迹并非安全边界;它们是一种可能反过来对付你的便利捷径。请将其视为明文,从日志中清除它们,并重新设计你的智能体,以应对未来只有原始模型才能读取其自身思维的局面。