Anthropic 15 亿美元盗版和解案:创纪录的损失与战略性胜利
在被指控利用盗版数据库训练其模型后,Anthropic 已与一组图书作者达成了一项具有历史意义的 15 亿美元和解协议。虽然巨额赔付款在财务上是一次沉重打击,但该案件在法律细节上的处理,实际上可能为更广泛的 AI 行业在“合理使用”(fair use)方面带来重大胜利。
创纪录和解案的细节
旧金山一家联邦法院批准了一项具有里程碑意义的和解协议。此前有证据显示,Anthropic 在 2021 年至 2022 年期间从臭名昭著的盗版数据库(特别是 LibGen 和 PiLiMi)下载了书籍。该和解规模在集体诉讼历史上是前所未有的,涵盖了约 482,460 部列出的作品。
在涉及的所有作品中,91.3% 已由作者成功索赔。每位索赔者预计将获得约 3,000 美元,这一数字是法定最低金额的四倍。作为法律解决的一部分,Anthropic 被要求销毁在此期间使用的盗版文件。至关重要的是,该和解协议并未给予该公司“免死金牌”;如果 AI 输出内容复制了原著,或者 Anthropic 未来的数据获取行为违反了版权法,作者仍保留提起诉讼的权利。
有利于 AI 发展的法律细节
尽管面临高达 15 亿美元的惊人代价,但该案创下的法律先例对 AI 实验室而言却出人意料地有利。该和解协议针对的是使用盗版来源这一特定行为,但并未对 AI 训练本身的合法性做出裁决。
Alsup 法官此前曾确立了一个关键区别:使用合法获取的书籍来训练 AI 是“具有转化性的——而且是极具转化性的”——这完全属于“合理使用”原则的范畴。这一区别对于 OpenAI、Google 和 Meta 等公司至关重要。它表明,虽然数据的来源(盗版 vs. 合法获取)存在法律责任,但训练模型以理解语言和模式的过程在法律上是站得住脚的。
大规模抓取数据的未决领域
虽然这一裁决为使用大规模数据集进行训练的实验室提供了救生索,但关于“合法获取”的法律斗争远未结束。核心问题仍然存在:在未经网站所有者明确同意的情况下,大规模抓取互联网内容究竟属于合法获取,还是侵犯版权?
这项和解协议凸显了 AI 行业面临的双重法律现实。公司可以通过确保其数据流水线中剔除已知的盗版库来避免巨额罚款,但在涉及网络出版商和内容创作者的权利方面,他们仍面临着充满不确定性的局面。随着 AI 实验室规模的不断扩大,技术进步的转化性与知识产权之间的紧张关系,仍将是该行业面临的最重大法律障碍。
核心要点
- 创纪录的赔付款: Anthropic 在使用 LibGen 等盗版数据库后将向作者支付 15 亿美元,这标志着集体诉讼史上规模最大的版权和解案。
- 合理使用先例: 法院确认,使用合法获取的数据训练 AI 具有“极强的转化性”,这为合法的 AI 训练提供了重要的法律护盾。
- 数据完整性至关重要: 该裁决强调,AI 训练的合法性往往取决于训练数据的来源,而非训练过程本身。
