Le NYT accuse OpenAI de dissimuler des preuves dans un procès majeur sur le droit d'auteur

La bataille juridique en cours entre The New York Times et OpenAI a pris un tournant dramatique, avec des allégations selon lesquelles le géant de l'IA aurait intentionnellement occulté des preuves concernant ses ensembles de données d'entraînement. Cette escalade menace de déplacer l'objet du procès de la violation du droit d'auteur vers l'intégrité du processus de communication des pièces (discovery process).

Allégations de pratiques de données trompeuses

The New York Times et The Daily News affirment qu'OpenAI a manqué de sincérité concernant sa capacité technique à effectuer des recherches à la fois dans son corpus d'entraînement et dans les journaux de discussion (chat logs) de ses clients. Tout au long de ce litige de deux ans, OpenAI a soutenu que la recherche dans ses ensembles de données massifs serait techniquement contraignante et compromettrait la vie privée des utilisateurs.

Cependant, une récente déposition de l'ingénieur en confidentialité des données d'OpenAI, Vinnie Monaco, a remis en question ce récit. Monaco aurait révélé qu'OpenAI avait déjà effectué des recherches internes dans son corpus d'entraînement spécifiquement pour identifier des œuvres journalistiques protégées par le droit d'auteur. De plus, la déposition suggère qu'OpenAI avait constitué une base de données d'environ 78 millions de conversations ChatGPT anonymisées afin d'évaluer en interne l'étendue de la violation potentielle du droit d'auteur.

Le « Project Giraffe » et le filtre « Bloom »

La révélation technique la plus significative concerne peut-être le « Project Giraffe », un ensemble d'outils mis en œuvre par OpenAI. Selon les plaignants, peu après le dépôt de la plainte, OpenAI a utilisé un filtre « Bloom » dans le cadre de ce projet pour détecter et enregistrer les cas de « régurgitation » — lorsque le modèle reproduit du contenu protégé par le droit d'auteur mot pour mot dans ses réponses.

L'existence du Project Giraffe contredit la position précédente d'OpenAI, selon laquelle l'identification d'instances spécifiques de reproduction de contenu dans ses journaux était une tâche prohibitive. Les plaignants soutiennent que ces outils prouvent qu'OpenAI était non seulement capable de surveiller la violation du droit d'auteur, mais qu'elle construisait activement une infrastructure pour la suivre.

Litiges sur l'intégrité des données et la communication des pièces

Le conflit s'est également concentré sur la qualité des données fournies à la cour. Alors que les plaignants avaient initialement demandé un échantillon de 120 millions de journaux de discussion, OpenAI a négocié ce chiffre à la baisse pour le ramener à 20 millions. Lorsque l'échantillon a finalement été soumis en décembre, le tribunal l'aurait jugé « inutilisable » en raison de l'excès de caviardage (redactions).

Le NYT est allé plus loin, alléguant qu'OpenAI a supprimé des milliards de réponses de ChatGPT en violation d'une ordonnance de conservation ordonnée par le tribunal et a substitué des millions de journaux dans l'échantillon fourni. En réponse, le porte-parole d'OpenAI, Drew Pusateri, a nié toutes les allégations, accusant le Times de tenter d'envahir la vie privée des utilisateurs à mesure que leur dossier juridique s'affaiblit.

Pourquoi cela est important pour l'industrie de l'IA

Cette affaire est un indicateur clé pour l'avenir du développement de l'IA générative et les limites juridiques de l'« usage équitable » (fair use). Si le tribunal conclut qu'OpenAI a retenu des preuves ou manipulé la communication des pièces, cela pourrait créer un précédent sur la manière dont les entreprises d'IA sont tenues de divulguer leurs méthodologies d'entraînement et la provenance de leurs données. Pour les développeurs et les fondateurs d'entreprises d'IA, l'issue clarifiera le niveau de transparence requis lors de la navigation à l'intersection de l'ingestion massive de données et des droits de propriété intellectuelle.

Points clés à retenir

  • Outils de surveillance interne : Les allégations suggèrent qu'OpenAI a utilisé le « Project Giraffe » et un filtre « Bloom » pour suivre activement la régurgitation de contenus protégés par le droit d'auteur.
  • Témoignages contradictoires : Les preuves issues des dépositions suggèrent qu'OpenAI possédait la capacité technique de rechercher dans ses données d'entraînement, contredisant ses affirmations précédentes concernant la charge technique.
  • Intégrité de la communication des pièces en jeu : Le procès repose désormais sur la question de savoir si OpenAI a violé les ordonnances de conservation en supprimant des réponses et en fournissant des échantillons de données caviardés « inutilisables ».