Satya Nadella 刚刚公开向那些由他公司参与构建的实验室发起了挑战。微软首席执行官就最大的 AI 公司如何重写数据所有权规则发出了严厉警告,这一消息引起了巨大的反响。在最近的一篇博文中,Nadella 指责包括 OpenAI 和 Anthropic 在内的前沿实验室正在构建一个被操纵的市场。他们收割公共数据来训练庞大的模型,然后利用其服务条款阻止任何人从这些模型产生的输出中学习。他认为,其结果是一种单向的价值转移,让企业在支付账单的同时,也交出了自己的专有知识。

蒸馏技术的双重标准

要理解这一投诉,首先需要了解这些实验室极力阻止的技术。蒸馏(Distillation)是一种常见的训练方法,即较小的专门模型通过学习大型模型的输出,而不是从头开始摄取原始互联网文本。初创公司或研究团队可能会向前沿模型输入数百万个提示词(prompts),捕获其响应,并利用这些丰富的信号来训练一个可以在本地运行或满足特定需求的紧凑型模型。与从头开始构建基础模型相比,这种方法成本更低,且能耗也低得多。

OpenAI 和 Anthropic 都在其服务条款中禁止这种做法。当他们检测到系统性的蒸馏行为时,会将其视为违规。执法行动通常针对竞争对手,特别是那些被指控利用该方法来缩小能力差距,却未投入数十亿美元进行原始训练运行的中国 AI 公司。

Nadella 强调了这一政策核心的紧张关系。这些实验室通过爬取开放网络、抓取书籍、论坛、代码库和文章来构建其旗舰模型,其法律依据是:在公开可获取的数据上进行训练构成了“合理使用”(fair use)。他们挖掘了公共资源。然而,他们现在却部署了法律围栏,以防止他人将他们的模型输出作为公共教学材料。他们似乎在说:你可以从世界的开放知识中学习,但谁也不能从我们这里学习。

这种不对称性不仅限于学术辩论。它建立了一种层级结构,由少数基础设施提供商控制着谁能获取什么知识。如果“合理使用”证明了他们摄取人类已发表智能的正当性,那么这些模型的输出就开始看起来像是一种私有化的公共资源。竞争对手和客户都被禁止将这些信号循环利用到新工具中。财富流向始终只朝着最大的实验室倾斜。

为自己的智能支付两次费用

Nadella 为他所看到的经济陷阱创造了一个词:“反向信息悖论”(reverse information paradox)。在他看来,企业目前正在为人工智能支付两次费用,而其中只有一笔费用会出现在账单上。

第一项成本显而易见。公司购买 API 额度、订阅 Copilot 或租用聊天机器人服务。第二项成本则是隐藏的。每当员工纠正一个幻觉事实、将响应评为“有用”或完善一份生成的报告时,这一行为都会产生 Nadella 所称的“废料”(exhaust)。这是在实际工作中产生的纠错记录、偏好数据和交互日志。

这些“废料”并非数字垃圾。它们通常包含辛苦获得的业务逻辑。物流团队可能会提示模型使用公司多年开发的内部约束条件来优化运输路线。法律部门可能会反复修改合同语言,直到输出符合公司风格。制药研究小组可能会以揭示战略重点的方式查询临床数据。当这些交互通过第三方 API 进行时,提供商可以看到完整的交换过程。模型由此学习到在特定领域内什么是“好的答案”。

随着时间的推移,这种反馈使得提供商的通用模型在客户雇佣其执行的具体任务上变得更加敏锐。随后,提供商可以转身将这种改进后的能力卖给客户的竞争对手,或者推出模仿该专业工作流的相邻产品。最初的企业支付了订阅费,捐献了自己的专有专业知识,并实际上训练了自己的竞争对手。

为什么主权 AI 正在从流行语转变为战略

应对这种流失的逻辑反应是重新夺回对学习闭环的控制权。Nadella 的论点显然旨在将 Microsoft 定位为一种不同类型的“房东”。他并不是坚持要求客户将他们的智能输入到一个中心化的黑盒中,而是在为那些由客户掌握钥匙的环境进行辩护。

这正是围绕“主权 AI”的讨论产生实际意义的地方。在私有云、本地数据中心或受严格控制的虚拟网络中运行模型,意味着交互数据永远不会离开组织的边界。企业仍然可以从现代基座模型中获益,但权重、提示词和偏好数据都保留在公司管理的边界之内。

Microsoft 正是围绕这种私有化部署和区域数据驻留的承诺来构建其 Azure 云业务的。在帖子中,Nadella 释放了一个信号:Microsoft 希望成为一个平台,让企业可以在其中托管自己的训练和推理,而不会在无意中将知识产权传输给远端的模型提供商。其核心卖点非常直接:使用强大的 AI,但保留你的数据产出。

其他供应商也在表达类似的观点,但由于 Microsoft 与 OpenAI 的深度合作伙伴关系,Nadella 的发声具有额外的分量。对于一位其