A IA Gemini do Google enfrenta uma ação coletiva movida em um tribunal federal de Nova York que acusa a empresa de treinar seus modelos com livros e artigos protegidos por direitos autorais sem permissão. A queixa, apresentada por uma coalizão que inclui grandes editoras e o autor Scott Turow, afirma que o Google removeu deliberadamente informações de direitos autorais para ocultar o uso de "materiais roubados" em seu sistema de IA generativa.

O processo e suas principais alegações

O processo no Tribunal Distrital dos EUA para o Distrito Sul de Nova York lista Hachette, Cencage, Elsevier, o coletivo S.C.R.I.B.E. e Turow como autores. Eles alegam que o Google foi além do acordo de "apenas trechos" (snippet-only) que regia o Google Books, utilizando obras de texto completo daquele arquivo e de títulos carregados no Google Play para treinar o Gemini. De acordo com a queixa, o Google não apenas extraiu o conteúdo, mas também alterou ou removeu metadados de direitos autorais, um passo que os autores afirmam ter tido a intenção de ocultar a infração.

Um memorando interno do Google mencionado no processo alerta que o emprego de livros protegidos por direitos autorais para o treinamento de IA pode ser "altamente problemático" e expor a empresa a multas que variam de US$ 10 bilhões a US$ 100 bilhões. Os autores apontam para uma penalidade recente de US$ 1,5 bilhão contra outra empresa de IA por uso não autorizado de dados como um parâmetro para a escala da responsabilidade potencial.

Como chegamos aqui

O relacionamento do Google com editoras de livros começou com o Google Books, um índice pesquisável que exibia pequenos trechos e detalhes bibliográficos, enquanto deixava o texto completo atrás de um paywall. Esse modelo dependia de acordos de licenciamento que limitavam o Google à exibição de trechos (snippets). Ao longo dos anos, o Google expandiu seus ativos por meio da loja Google Play, onde editoras e autores carregam e-books de texto completo para venda.

Os autores argumentam que a mudança do Google de um serviço de indexação de "escopo limitado" para uma fonte de dados para o treinamento de grandes modelos de linguagem (LLMs) viola os acordos originais. Eles afirmam que a empresa nunca obteve as permissões amplas necessárias para ingerir obras inteiras no pipeline de treinamento do Gemini.

O que está em jogo para o Google e para a indústria de IA

Se um tribunal decidir que o uso de material protegido por direitos autorais sem uma licença viola a lei de direitos autorais, a decisão poderá remodelar a forma como os desenvolvedores de IA reúnem dados de treinamento.

Possíveis defesas e contrapontos

O Google provavelmente se apoiará na doutrina de "fair use", que permite o uso limitado de material protegido por direitos autorais para comentários, críticas ou transformação. Decisões recentes na Califórnia trataram o treinamento de IA como uma atividade transformadora, concedendo-lhe proteção de fair use. Os autores de Nova York entraram com a ação fora dessa jurisdição para evitar esses precedentes.

Os autores contra-argumentam que a remoção de metadados de direitos autorais demonstra a intenção de ocultar a fonte, minando qualquer alegação de transformação de boa-fé. Eles também citam o memorando interno como prova de que o Google reconheceu o risco jurídico.

O que observar a seguir

O caso passará por petições pré-julgamento que podem moldar os argumentos disponíveis para ambos os lados, incluindo se o tribunal aplicará a análise de fair use usada na Califórnia ou adotará um padrão diferente. Uma decisão sobre a jurisdição poderá determinar se os tribunais de Nova York se tornarão o principal foro para disputas de direitos autorais relacionadas à IA.

Resumo: O processo de Nova York contra o Gemini do Google pode redefinir os limites entre o uso de dados permitido e a infração de direitos autorais, forçando os desenvolvedores de IA a repensar como adquirem a matéria-prima que alimenta seus modelos e remodelando a economia de toda a indústria.