Google DeepMind 推出了一个试点项目,利用加密双盲基准测试来评估其 Gemini Flash Lite 模型,而无需暴露测试提示词或模型权重。评估在 Google Cloud 的 Confidential Space 中运行,因此评估者永远看不到模型,模型也永远看不到问题——这种方法有望恢复 AI 性能报告的可信度。
为什么基准测试污染至关重要
如果模型在随后出现在基准测试中的数据上进行训练,其得分将不再衡量推理能力,而是变成了记忆能力。因此,在受污染的测试中获得完美结果并不能说明真实的水平。研究人员长期面临一个悖论:他们必须将测试数据交给模型提供商以验证基准测试,这面临着过早泄露的风险;或者他们必须拒绝外部访问以保护专有权重,从而导致审计无法得到验证。最近在评估 Anthropic 的 Fable 5 在 ARC-AGI 基准测试上的表现时出现的延迟,说明了严格的数据保留政策如何阻碍独立评估。
加密解决方案
该试点项目用技术保障取代了法律合同和“零日志”承诺。Confidential Space 创建了一个硬件隔离的飞地(enclave),用于运行 Gemini Flash Lite 模型。评估者上传测试套件,飞地将其封装在一个模型无法打开的加密“盒子”中。与此同时,模型的权重在飞地内部保持加密状态,对评估者不可见。飞地会生成一个数学证明,证明模型在推理过程中从未访问过提示词。其结果是一个真正的双盲运行:双方都保留了自己的秘密,而第三方则获得了可验证的性能指标。
谁将从中受益
- 监管机构和审计员现在可以要求提供能力证明,而无需强迫提供商泄露商业机密。
- 网络安全、国防或处理任何机密数据的领域的企业可以在不承担数据泄露风险的情况下测试 AI 工具。
- 模型开发商可以保持其竞争优势;他们不再需要在开放性与保护性之间做出选择。
如果这种方法能够规模化应用,它可能会成为认证前沿模型的默认方法,推动行业从基于信任的安排转向基于数学的保证。
潜在的摩擦点
该系统依赖于 Google Cloud 的机密计算栈,因此更倾向于使用其他云服务商的组织可能会遇到集成障碍。在飞地中运行模型会增加延迟并限制可用的硬件加速器,这可能会影响基准测试得分。此外,虽然加密证明保证了模型没有看到提示词,但它无法防止其他操纵行为,例如在测试开始后进行微调。批评者可能会认为,该解决方案仅解决了更广泛的可复现性问题中很小的一部分。
下一步值得关注的方向
- 试点之外的推广应用 —— 其他 AI 实验室和云厂商可能会构建兼容的飞地,测试模型是否可以在不同平台之间进行审计。
- 标准制定机构 —— AI 安全组织可能会将加密双盲审计编入认证框架。
- 性能权衡 —— 现实世界的基准测试运行将揭示机密执行带来的开销对于大规模模型是否可以接受。
总结
通过将测试数据和模型都锁定在一个相互不透明的加密环境中,Google DeepMind 的试点项目为实现值得信赖的 AI 基准测试提供了一条具体的路径。该方法并不能消除所有的审计挑战,但它在不迫使任何一方放弃其最核心资产的情况下,消除了最明显的偏差来源——基准测试污染。如果业界接受这一技术,未来的 AI 进展报告终于可以被视为真实可靠。
