一位联邦法官已批准 Anthropic 与一组作者之间达成的 15 亿美元和解协议,结束了这场关于人工智能公司如何对待受版权保护书籍的激烈且备受关注的斗争。法官 Araceli Martínez-Olguín 签署了该协议,巩固了法律专家所称的历史上规模最大的版权追偿案。这笔赔偿源于 2024 年发起的一场集体诉讼,由包括 Andrea Bartz、Charles Graeber 和 Kirk Wallace Johnson 在内的作家领导,他们指控该公司通过“吸取”数百万部受版权保护的作品来训练其大语言模型。对于长期以来将开放网络视为“免费自助餐”的行业来说,现在的信号非常明确:那个时代已经结束了。

创纪录赔偿金的剖析

根据批准的协议,作者每本被 Anthropic 指控侵权的图书可获得约 3,000 美元。诉状描绘了一幅严峻的画面,将该公司的行为比作大规模的“Napster 式下载”。丢失版税是一回事;但得知整部手稿被摄入到一个现在正与人类作家争夺关注度和商业利益的模型中,则是另一回事。

Anthropic 总法律顾问 Aparna Sridhar 表示,公司希望尽快结束这场纠纷。她指出,超过 91% 的符合条件的作者和出版商已经领取了属于他们的资金。这种参与率至关重要。集体诉讼往往难以覆盖半数以上的受影响方,因此如此高的参与率表明,个人赔偿金额足以产生影响,或者至少足以吸引作家,让他们认为等待单独审判并无益处。

15 亿美元的头条数字非常吸睛,但单本书籍的金额则讲述了另一个故事。对于一本被纳入训练语料库的中层作家来说,3,000 美元可能相当于数年的数字版税。而对于一个畅销系列丛书来说,这可能仅够覆盖一周的销售额。这种影响力的差异,正是出版业在“该协议是行业蓝图还是天花板”这一问题上产生分歧的原因。

从局部胜利到高风险和解

这项和解并非凭空出现。退休法官 William Alsup 此前在相关程序中曾给予 Anthropic 部分胜利,暗示并非所有指控都能经受住严格审查。然而,这项集体诉讼协议的批准确立了一个关键先例:在不支付补偿的情况下大规模摄取受版权保护的材料会带来严重的财务后果,开发者不能再假设可以从开放网络或数字图书馆中无偿获取大规模数据集而无需承担法律风险。

发生了什么变化?规模和清晰度。当单个作者抱怨某个片段时,法院可能会在“公平使用”上进行细枝末节的争论。但当数百万本书被指控被完整复制以构建商业产品时,计算逻辑就发生了变化。这项和解证实了一个观点:训练数据并非可以被忽视的外部性,而是一种有价格的投入,就像计算集群和服务器农场一样。

对于那些仍在利用抓取的档案训练模型的开发者来说,风险不再是理论上的,而是一项预算支出。

前路漫漫:许可、诉讼与不安的休战

Anthropic 尚未脱离险境。包括 Chicken Soup for the Soul 出版商在内的多个实体正在对该公司提起各自的诉讼。他们的论点直指 3,000 美元这一数字的核心。他们认为,固定的单书赔偿忽略了知识产权的长期市场价值,也忽略了商业 AI 产品如何将从这些作品中衍生出的风格、结构和专业知识变现。

这些拒绝和解的案件可能比集体诉讼的和解成本更高。如果陪审团认为固定费用低估了作品持续的商业用途,那么损害赔偿模式可能会从一次性赔付转变为类似版税的结构,或者与模型收入挂钩的巨额总额。这种可能性足以让每个 AI 财务团队彻夜难眠。

我们应该预见到第二波诉讼浪潮。Anthropic 的协议为作者们提供了一个模板。它确立了一个数字——每本书 3,000 美元——作家和出版商可以在谈判或法庭上引用这一数字。对于那些从未加入最初集体诉讼的小型工作室和独立作者来说,这项和解协议无异于一份起诉邀请函。对于更广泛的 AI 领域而言,高质量、符合法律规范的训练数据的成本可能会成为主要的运营支出,而不再是事后才考虑的问题。

一些公司将通过与出版商达成许可协议来应对,类似于平台与媒体机构之间达成的安排。其他公司可能会在合成数据生成方面投入巨资,或者选择仅在明确属于公有领域的语料库上进行训练的模型。这些都无法