Il NYT accusa OpenAI di aver occultato prove in una importante causa sul copyright
La battaglia legale in corso tra The New York Times e OpenAI ha preso una piega drammatica, con accuse secondo cui il gigante dell'IA avrebbe intenzionalmente oscurato prove riguardanti i suoi dataset di addestramento. Questa escalation minaccia di spostare il focus della causa dalla violazione del copyright all'integrità del processo di discovery giudiziaria.
Accuse di pratiche di dati ingannevoli
The New York Times e The Daily News sostengono che OpenAI non sia stata sincera riguardo alla propria capacità tecnica di effettuare ricerche sia nel proprio corpus di addestramento che nei log delle chat degli utenti. Nel corso della lite biennale, OpenAI ha sostenuto che la ricerca nei suoi massicci dataset sarebbe stata tecnicamente onerosa e avrebbe compromesso la privacy degli utenti.
Tuttavia, una recente deposizione dell'ingegnere della privacy dei dati di OpenAI, Vinnie Monaco, ha messo in discussione questa narrazione. Monaco avrebbe rivelato che OpenAI aveva già condotto ricerche interne nel proprio corpus di addestramento specificamente per identificare opere giornalistiche protette da copyright. Inoltre, la deposizione suggerisce che OpenAI avesse accumulato un database di circa 78 milioni di conversazioni di ChatGPT anonimizzate per valutare internamente l'entità della potenziale violazione del copyright.
Project Giraffe e il filtro "Bloom"
Forse la rivelazione tecnica più significativa riguarda "Project Giraffe", un set di strumenti implementati da OpenAI. Secondo gli attori, poco dopo il deposito della causa, OpenAI ha utilizzato un filtro "Bloom" come parte di questo progetto per rilevare e registrare casi di "regurgitation" — ovvero situazioni in cui il modello riproduce contenuti protetti da copyright parola per parola nei suoi output.
L'esistenza di Project Giraffe contraddice la precedente posizione di OpenAI, secondo cui identificare casi specifici di riproduzione di contenuti all'interno dei propri log sarebbe stata un'attività proibitiva. Gli attori sostengono che questi strumenti dimostrino che OpenAI non solo fosse in grado di monitorare la violazione del copyright, ma che stesse attivamente costruendo un'infrastruttura per tracciarla.
Dispute sull'integrità dei dati e sulla discovery
Il conflitto si è concentrato anche sulla qualità dei dati forniti alla corte. Mentre gli attori avevano inizialmente richiesto un campione di 120 milioni di log delle chat, OpenAI ha negoziato la cifra riducendola a 20 milioni. Quando il campione è stato finalmente presentato a dicembre, la corte lo avrebbe giudicato "inutilizzabile" a causa di eccessive oscurazioni.
Il NYT è andato oltre, sostenendo che OpenAI abbia eliminato miliardi di output di ChatGPT in violazione di un ordine di conservazione disposto dalla corte e abbia sostituito milioni di log nel campione fornito. In risposta, il portavoce di OpenAI Drew Pusateri ha negato ogni accusa, accusando il Times di tentare di invadere la privacy degli utenti man mano che il loro caso legale si indebolisce.
Perché questo è importante per l'industria dell'IA
Questo caso rappresenta un punto di svolta per il futuro dello sviluppo dell'IA generativa e i confini legali del "fair use". Se la corte dovesse stabilire che OpenAI ha occultato prove o manipolato la discovery, ciò potrebbe creare un precedente su come le aziende di IA debbano dichiarare le proprie metodologie di addestramento e la provenienza dei dati. Per gli sviluppatori e i fondatori di startup IA, l'esito chiarirà il livello di trasparenza richiesto nel navigare l'intersezione tra l'ingestione massiccia di dati e i diritti di proprietà intellettuale.
Punti chiave
- Strumenti di monitoraggio interno: Le accuse suggeriscono che OpenAI abbia utilizzato "Project Giraffe" e un filtro "Bloom" per tracciare attivamente la "regurgitation" di contenuti protetti da copyright.
- Testimonianze contraddittorie: Le prove emerse dalle deposizioni suggeriscono che OpenAI possedesse la capacità tecnica di ricercare i propri dati di addestramento, contraddicendo le precedenti affermazioni circa l'onere tecnico.
- Integrità della discovery in gioco: La causa ora dipende dal fatto che OpenAI abbia o meno violato gli ordini di conservazione eliminando gli output e fornendo campioni di dati oscurati "inutilizzabili".
