L'IA Gemini de Google fait l'objet d'un recours collectif déposé devant un tribunal fédéral de New York, accusant l'entreprise d'avoir entraîné ses modèles sur des livres et des articles protégés par le droit d'auteur sans autorisation. La plainte, déposée par une coalition comprenant de grands éditeurs et l'auteur Scott Turow, affirme que Google a délibérément supprimé les informations relatives au droit d'auteur pour dissimuler l'utilisation de « contenus volés » dans son système d'IA générative.
Le procès et ses principales revendications
Le dépôt auprès du tribunal de district des États-Unis pour le district sud de New York cite Hachette, Cencage, Elsevier, le collectif S.C.R.I.B.E. et Turow comme plaignants. Ils allèguent que Google est allé au-delà de l'accord de « simples extraits » qui régissait Google Books, en utilisant des œuvres intégrales issues de cette archive et de titres téléchargés sur Google Play pour entraîner Gemini. Selon la plainte, Google n'a pas seulement extrait le contenu (scraping), mais a également modifié ou supprimé les métadonnées de droit d'auteur, une étape qui, selon les plaignants, visait à dissimuler la violation.
Une note interne de Google mentionnée dans la plainte avertit que l'utilisation de livres protégés par le droit d'auteur pour l'entraînement de l'IA pourrait être « hautement problématique » et exposer l'entreprise à des amendes allant de 10 à 100 milliards de dollars. Les plaignants citent une récente amende de 1,5 milliard de dollars infligée à une autre entreprise d'IA pour utilisation non autorisée de données comme référence pour l'ampleur de la responsabilité potentielle.
Comment en est-on arrivé là
La relation de Google avec les éditeurs de livres a commencé avec Google Books, un index de recherche qui affichait de courts extraits et des détails bibliographiques tout en laissant le texte intégral derrière un mur de paiement. Ce modèle reposait sur des accords de licence qui limitaient Google à l'affichage d'extraits. Au fil des ans, Google a étendu ses activités via le Google Play Store, où les éditeurs et les auteurs téléchargent des e-books complets pour la vente.
Les plaignants soutiennent que le passage de Google d'un service d'indexation à « portée limitée » à une source de données pour l'entraînement de grands modèles de langage (LLM) constitue une violation des accords originaux. Ils affirment que l'entreprise n'a jamais obtenu les autorisations étendues nécessaires pour intégrer des œuvres entières dans le pipeline d'entraînement de Gemini.
Ce qui est en jeu pour Google et l'industrie de l'IA
Si un tribunal conclut que l'utilisation de matériel protégé par le droit d'auteur sans licence viole la loi sur le droit d'auteur, la décision pourrait remodeler la manière dont les développeurs d'IA assemblent leurs données d'entraînement.
Défenses possibles et contre-arguments
Google s'appuiera probablement sur la doctrine du « fair use » (usage loyal), qui autorise l'utilisation limitée de matériel protégé par le droit d'auteur à des fins de commentaire, de critique ou de transformation. Des décisions récentes en Californie ont considéré l'entraînement de l'IA comme une activité transformative, lui accordant la protection du fair use. Les plaignants de New York ont déposé leur plainte en dehors de cette juridiction pour éviter ces précédents.
Les plaignants répliquent que la suppression des métadonnées de droit d'auteur démontre une intention de dissimuler la source, ce qui invalide toute prétention à une transformation de bonne foi. Ils citent également la note interne comme preuve que Google avait reconnu le risque juridique.
Ce qu'il faut surveiller ensuite
L'affaire passera par des motions pré-procès qui pourraient façonner les arguments des deux parties, notamment pour savoir si le tribunal appliquera l'analyse du fair use utilisée en Californie ou s'il adoptera une norme différente. Une décision sur la compétence juridictionnelle pourrait déterminer si les tribunaux de New York deviennent le principal lieu de règlement des litiges de droit d'auteur liés à l'IA.
L'essentiel : Le procès intenté à New York contre Gemini de Google pourrait redéfinir la frontière entre l'utilisation autorisée des données et la violation du droit d'auteur, obligeant les développeurs d'IA à repenser la manière dont ils acquièrent la matière première qui alimente leurs modèles et remodelant l'économie de toute l'industrie.
