Google 的 Gemini AI 在纽约联邦法院面临一项集体诉讼,指控该公司在未经许可的情况下,使用受版权保护的书籍和文章来训练其模型。该诉讼由包括主要出版商和作家 Scott Turow 在内的联盟提起,指控 Google 故意剥离版权信息,以掩盖其生成式 AI 系统中使用了“被盗材料”。
诉讼及其核心指控
在纽约南区联邦地区法院提交的文件中,Hachette、Cencage、Elsevier、S.C.R.I.B.E. 集体和 Turow 被列为原告。他们指控 Google 超出了此前管理 Google Books 的“仅限片段”协议,利用该档案中的全文作品以及上传到 Google Play 的作品来训练 Gemini。根据诉状,Google 不仅抓取了内容,还修改或删除了版权元数据,原告称此举旨在掩盖侵权行为。
诉讼中提到的一份 Google 内部备忘录警告称,利用受版权保护的书籍进行 AI 训练可能会“产生严重问题”,并使公司面临 100 亿至 1000 亿美元的罚款。原告指出,近期另一家 AI 公司因未经授权使用数据而被处以 15 亿美元的罚款,以此作为衡量潜在责任规模的基准。
事件背景
Google 与图书出版商的关系始于 Google Books,这是一个可搜索的索引,在显示简短摘录和书目详情的同时,将全文保留在付费墙之后。该模式依赖于许可协议,限制 Google 仅能显示片段。多年来,Google 通过 Google Play 商店扩大了其业务范围,出版商和作者可以在该商店上传全文电子书进行销售。
原告认为,Google 从“范围受限”的索引服务转变为训练大语言模型 (LLMs) 的数据源,违反了原始协议。他们表示,该公司从未获得将完整作品摄入 Gemini 训练流程所需的广泛许可。
对 Google 及 AI 行业的潜在影响
如果法院认定未经许可使用受版权保护的材料违反了版权法,该裁决可能会重塑 AI 开发人员收集训练数据的方式。
可能的辩护与反驳
Google 可能会依赖“合理使用”原则,该原则允许出于评论、批评或转换目的有限度地使用受版权保护的材料。加利福尼亚州最近的裁决已将 AI 训练视为一种转换性活动,并赋予其合理使用保护。纽约的原告在上述管辖区之外提起诉讼,以规避这些先例。
原告反驳称,删除版权元数据表明了掩盖来源的意图,这削弱了任何关于“善意转换”的主张。他们还引用了那份内部备忘录,作为 Google 已意识到法律风险的证据。
后续关注点
该案件将进入庭前动议阶段,这可能会影响双方提出的论点,包括法院是否会采用加利福尼亚州使用的合理使用分析方法,还是采用不同的标准。关于管辖权的裁决可能会决定纽约法院是否会成为 AI 相关版权纠纷的主要审理地。
核心结论: 针对 Google Gemini 的纽约诉讼可能会重新划定允许的数据使用与版权侵权之间的界限,迫使 AI 开发人员重新思考获取驱动其模型原材料的方式,并重塑整个行业的经济模式。
