Anthropic 和 OpenAI 分别开设了新的研究渠道,允许经过审核的安全团队使用剥离了大部分安全过滤器的 AI 模型。Anthropic 的 “Cyber Verification Program” 和 OpenAI 的 “Trusted Access for Cyber” 为获批的研究人员提供了直接使用强大语言模型的途径,这些模型可以生成不受限制的代码、提示词和指令。此举意义重大,因为它在 AI 供应链中创造了一个清晰的分叉:少数内部人员可以探测最脆弱的版本,而世界其他地方则留在更强大的防护栏之后。

计划出现的原因

两家公司都表示,这些计划旨在加速发现可能被用于针对其服务进行武器化的漏洞。通过向受控的专家小组提供一个限制较少的沙盒,他们希望在恶意行为者发现这些漏洞之前将其暴露出来。这种方法模仿了传统的软件安全模式,即开发人员向特定受众发布“漏洞赏金”版本。

防御者面临的新风险评估

另一方面,这种两层访问模型迫使每个组织必须在“研究人员”和“黑客”之间划清界限。这条界限现在本身就成为了一个潜在的攻击面。如果攻击者窃取了凭据、利用了内部人员的访问权限或欺骗了审核流程,他们就可以绕过保护大多数用户的防护栏。一旦进入,不受限制的模型可能会被诱导进行以下操作:

  • 生成可规避检测的钓鱼脚本
  • 编写带有详细代码片段的零日漏洞利用程序
  • 制作针对特定目标的、具有说服力的社会工程学提示词

那些基于“AI 输出始终经过过滤”这一假设来构建防御的安全团队必须重新审视这一前提。

防御者可以如何应对

  • 将这些计划视为威胁向量。 假设对手会试图渗透审核流程,并监控 AI 平台上异常的登录模式。
  • 将检测范围扩展到云端之外。 在出站流量中寻找 AI 生成的代码或文本,特别是来自特权账户的流量。
  • 硬性实施策略控制。 对任何内部使用外部 AI 服务的行为实施严格的“最小权限”规则,并对可能被受损凭据访问的环境进行隔离。
  • 与供应商协作。 与 Anthropic 和 OpenAI 的安全联络渠道保持沟通,以接收有关访问标准变更或发现滥用行为的警报。

反方观点

支持者认为,如果没有用于深度探测的安全渠道,漏洞将一直隐藏,直到在实际环境中被利用。因此,这些计划可以通过及早发现缺陷来减少整体攻击面。权衡之处在于,“防护较少”的层级会招致投机性的滥用。

值得关注的动向

  • 两家公司对审核流程的更新
  • 源自这些计划的滥用报告
  • 行业范围内关于如何编目 AI 相关攻击面的转变

核心结论是:新的研究渠道为安全研究人员提供了强大的工具,但也把同样的工具交给了任何能够绕过关卡的人。防御团队必须将这些计划既视为洞察力的来源,也视为新的攻击途径。