NYT beschuldigt OpenAI van het achterhouden van bewijsmateriaal in groot auteursrechtproces

De lopende juridische strijd tussen The New York Times en OpenAI heeft een dramatische wending genomen, met beschuldigingen dat de AI-gigant opzettelijk bewijsmateriaal met betrekking tot zijn trainingsdatasets heeft verborgen. Deze escalatie dreigt de focus van de rechtszaak te verleggen van auteursrechtinbreuk naar de integriteit van het gerechtelijke discovery-proces.

Beschuldigingen van misleidende datapraktijken

The New York Times en The Daily News beweren dat OpenAI onwaarheden heeft verteld over de technische capaciteit om zowel de trainingscorpus als de chatlogs van klanten te doorzoeken. Gedurende de twee jaar durende rechtszaak heeft OpenAI volgehouden dat het doorzoeken van de enorme datasets technisch belastend zou zijn en de privacy van gebruikers in gevaar zou brengen.

Een recente getuigenverklaring (deposition) van OpenAI-data privacy engineer Vinnie Monaco heeft dit narratief echter uitgedaagd. Monaco zou hebben onthuld dat OpenAI al interne zoekopdrachten in de trainingscorpus had uitgevoerd, specifiek om auteursrechtelijk beschermde journalistieke werken te identificeren. Bovendien suggereert de verklaring dat OpenAI een database heeft opgebouwd van ongeveer 78 miljoen gede-identificeerde ChatGPT-gesprekken om intern de omvang van mogelijke auteursrechtinbreuk te beoordelen.

Project Giraffe en het "Bloom"-filter

Misschien wel de meest significante technische onthulling betreft "Project Giraffe", een set tools die door OpenAI is geïmplementeerd. Volgens de eisers maakte OpenAI kort na het indienen van de rechtszaak gebruik van een "Bloom"-filter als onderdeel van dit project om gevallen van "regurgitatie" (waarbij het model auteursrechtelijk beschermde inhoud letterlijk reproduceert in de output) te detecteren en vast te leggen.

Het bestaan van Project Giraffe spreekt de eerdere standpunten van OpenAI tegen dat het identificeren van specifieke gevallen van inhoudelijke reproductie in de logs een onmogelijke taak was. De eisers stellen dat deze tools bewijzen dat OpenAI niet alleen in staat was om auteursrechtinbreuk te monitoren, maar ook actief infrastructuur aan het bouwen was om dit te volgen.

Geschillen over dataintegriteit en discovery

Het conflict heeft zich ook gericht op de kwaliteit van de aan de rechtbank verstrekte gegevens. Hoewel de eisers oorspronkelijk een steekproef van 120 miljoen chatlogs aanvraagden, heeft OpenAI dit aantal naar beneden onderhandeld naar 20 miljoen. Toen de steekproef in december eindelijk werd ingediend, zou de rechtbank deze "onbruikbaar" hebben gevonden vanwege buitensporige redacties.

De NYT gaat nog een stap verder en beweert dat OpenAI miljarden ChatGPT-outputs heeft verwijderd in strijd met een door de rechtbank opgelegde bewaarplicht, en miljoenen logs in de verstrekte steekproef heeft vervangen. Als reactie heeft OpenAI-woordvoerder Drew Pusateri alle beschuldigingen ontkend en de Times ervan beschuldigd de privacy van gebruikers te proberen te schenden nu hun juridische zaak verzwakt.

Waarom dit belangrijk is voor de AI-industrie

Deze zaak is een graadmeter voor de toekomst van de ontwikkeling van generatieve AI en de juridische grenzen van "fair use". Als de rechtbank oordeelt dat OpenAI bewijsmateriaal heeft achtergehouden of de discovery heeft gemanipuleerd, kan dit een precedent scheppen voor de manier waarop AI-bedrijven verplicht zijn hun trainingsmethodologieën en datalijnage (data lineage) openbaar te maken. Voor ontwikkelaars en AI-oprichters zal de uitkomst verduidelijken welk niveau van transparantie vereist is bij het navigeren op het snijvlak van massale data-inname en intellectuele eigendomsrechten.

Belangrijkste punten

  • Interne monitoringsinstrumenten: Beschuldigingen suggereren dat OpenAI "Project Giraffe" en een "Bloom"-filter gebruikte om de regurgitatie van auteursrechtelijk beschermde inhoud actief te volgen.
  • Tegenstrijdige getuigenissen: Bewijs uit getuigenverklaringen suggereert dat OpenAI over de technische capaciteit beschikte om de trainingsdata te doorzoeken, wat in strijd is met de eerdere beweringen over technische belemmeringen.
  • Integriteit van de discovery staat op het spel: De rechtszaak draait nu om de vraag of OpenAI de bewaarplichten heeft geschonden door outputs te verwijderen en "onbruikbare", geredacteerde datasteekproeven te verstrekken.