Il Dipartimento di Giustizia degli Stati Uniti ha effettuato un importante intervento legale nella continua guerra sul copyright tra i giganti dei media e gli sviluppatori di IA. Sostenendo che l'addestramento di modelli linguistici di grandi dimensioni (LLM) su dati protetti da copyright costituisca "fair use", il DOJ ha fornito uno scudo legale massiccio per aziende come OpenAI e Microsoft.

L'argomentazione del DOJ: Addestramento vs. Output

Al centro della causa collettiva che coinvolge il New York Times vi è una distinzione fondamentale tra il modo in cui un'IA apprende e ciò che produce. Il New York Times sostiene che milioni dei suoi articoli siano stati utilizzati senza autorizzazione per addestrare modelli come GPT-4, causando danni per miliardi di dollari e creando prodotti che competono direttamente con il quotidiano.

Tuttavia, il recente atto depositato dal DOJ sostiene che la violazione del copyright avvenga nel momento dell'output, non nel momento dell'acquisizione (ingestion). Il dipartimento sostiene che, sebbene interi lavori vengano copiati durante la fase di addestramento, tali copie non vengono mai rese pubblicamente disponibili. Inoltre, il DOJ afferma che gli output di modelli come GPT-4 "spesso, se non sempre, mancano di una somiglianza sostanziale" con il materiale originale. Separando il processo di addestramento dal contenuto generato, il DOJ sta tentando di scindere l'atto dell'apprendimento automatico dal concetto legale di sostituzione del mercato.

L' "analogia di Hemingway" e la creatività umana

Per rendere comprensibile il concetto di machine learning, il DOJ ha invocato un'analogia letteraria che coinvolge l'autrice Joan Didion. L'atto ha osservato che, da adolescente, la Didion copiava i racconti di Ernest Hemingway per analizzarne la struttura sintattica e imparare il mestiere. Il DOJ sostiene che, se la legge trattasse l'addestramento delle macchine come una violazione, una scrittrice come la Didion potrebbe teoricamente incorrere in responsabilità legale ogni volta che pubblica un nuovo lavoro, poiché il suo processo di apprendimento sarebbe inestricabilmente legato alla sua successiva scrittura.

Il dipartimento sostiene inoltre che imporre una responsabilità oggettiva per l'addestramento dell'IA paradossalmente soffocherebbe proprio la creatività che la legge sul copyright intende proteggere. Con gli esseri umani che utilizzano sempre più gli LLM per bozzare e modificare opere originali, il DOJ suggerisce che rendere l'addestramento inammissibile senza massicci regimi di licenza paralizzerebbe l'innovazione guidata dall'IA.

La posizione del DOJ contraddice direttamente le recenti conclusioni dell'Ufficio del Copyright degli Stati Uniti. L'ex titolare Shira Perlmutter aveva precedentemente argomentato contro una difesa generalizzata basata sul "fair use", osservando che l'IA opera a una scala e a una velocità che vanno ben oltre le capacità umane e spesso crea prodotti commerciali che competono direttamente con i creatori di contenuti originali.

Il DOJ è passato all'offensiva contro questa valutazione, affermando che il rapporto di Perlmutter non ha alcuna autorità legale vincolante e non tiene conto della giurisprudenza consolidata riguardante l'analisi caso per caso. Il dipartimento avverte che imporre una responsabilità ampia imporrebbe di fatto un regime di licenze che renderebbe lo sviluppo di modelli di IA avanzati legalmente e finanziariamente impossibile.

Punti chiave

  • Separazione tra addestramento e output: Il DOJ sostiene che la copia di testi per l'addestramento non costituisca una violazione se gli output del modello risultante non mostrano una "somiglianza sostanziale" con le opere originali.
  • Protezione dell'innovazione: Il dipartimento avverte che richiedere licenze per tutti i dati di addestramento soffocherebbe la creatività e impedirebbe lo sviluppo di LLM che assistono nella creazione di contenuti umani.
  • Un punto di svolta legale: Questo intervento crea un conflitto ad alta posta in gioco tra il DOJ e l'Ufficio del Copyright degli Stati Uniti, preparando il terreno per una sentenza definitiva della corte sul futuro dell'IA generativa.

ARTICLE: Il Dipartimento di Giustizia degli Stati Uniti ha presentato un parere di amicus curiae nella causa sul copyright del New York Times, sostenendo che la copia di testi protetti per addestrare modelli linguistici di grandi dimensioni (LLM) rientri nel "fair use". L'atto fornisce a società come OpenAI e Microsoft uno scudo legale che potrebbe tenerle lontane da un fondo di risarcimento danni che il quotidiano stima in miliardi di dollari.

Perché il caso è importante ora

La causa consolida diverse rivendicazioni secondo cui gli sviluppatori di IA avrebbero inserito milioni di articoli di giornale nei loro modelli senza permesso, per poi rilasciare prodotti che competono direttamente con il giornalismo del Times. Se un tribunale dovesse respingere l'argomentazione del DOJ sul fair use, le aziende di IA potrebbero trovarsi di fronte a enormi costi di licenza o essere costrette a interrompere lo sviluppo della prossima generazione di agenti conversazionali.

L'argomentazione principale del DOJ

L'atto suddivide il flusso di lavoro dell'IA in due fasi distinte. Primo, il modello ingerisce grandi corpora di testo; secondo, genera risposte ai prompt degli utenti. Il dipartimento afferma che la violazione avviene solo quando un'opera protetta da copyright viene riprodotta in modo tale che il pubblico possa accedervi. Poiché le copie utilizzate per l'addestramento non lasciano mai i server dello sviluppatore, l'atto di ingestione non raggiunge tale soglia.

Il DOJ si appoggia inoltre al test della "sostanziale somiglianza" (substantial similarity), uno standard consolidato del diritto d'autore. Sostiene che il testo prodotto da modelli come GPT-4 "spesso, se non sempre" differisca a sufficienza da qualsiasi singola fonte tale da impedire a un attore in giudizio di dimostrare la somiglianza richiesta. In breve, l'atto sostiene che il focus legale debba essere sul risultato finale, non sul processo di apprendimento interno.

Un'analogia letteraria per illustrare il punto

Per rendere l'argomentazione tecnica più comprensibile, l'atto cita la storia di una scrittrice adolescente che copiava i racconti di Ernest Hemingway per studiarne lo stile. Il DOJ afferma che, se la legge trattasse quell'esercizio di apprendimento come una violazione, la scrittrice potrebbe essere citata in giudizio ogni volta che pubblica un nuovo brano, nonostante la sua opera fosse originale. Il dipartimento avverte che estendere la stessa logica all'IA "paralizzerebbe la stessa creatività che la legge sul copyright è stata progettata per proteggere".

Cosa c'è in gioco per gli sviluppatori di IA e i creatori di contenuti

  • Rischio per l'innovazione: Richiedere licenze per ogni frammento di testo utilizzato nell'addestramento potrebbe far lievitare i costi a tal punto da rendere finanziariamente insostenibile la creazione di modelli all'avanguardia.
  • Flusso di lavoro creativo: Gli scrittori umani si affidano sempre più agli LLM per la stesura, l'editing e il brainstorming. Se il processo di addestramento venisse ritenuto illegale, tali strumenti potrebbero scomparire, rimodellando il modo in cui i contenuti vengono prodotti in tutti i settori.
  • Impatto sul mercato: L'industria dei giornali sostiene che i modelli di IA in grado di rispondere a domande o generare testi simili a notizie erodano il valore del giornalismo originale, sottraendo potenzialmente entrate pubblicitarie e abbonamenti.

Un recente rapporto dell'Ufficio del Copyright degli Stati Uniti, redatto sotto la direzione dell'ex titolare Shira Perlmutter, ha respinto una difesa basata su un uso legittimo (fair use) indiscriminato. L'ufficio ha evidenziato tre fattori che distinguono l'IA dall'apprendimento umano: l'enorme volume di materiale copiato, la velocità con cui viene elaborato e il fatto che i modelli risultanti possono essere confezionati e venduti come prodotti commerciali che competono direttamente con i creatori originali.

Il DOJ ribatte a questi punti, osservando che il rapporto non ha autorità legale vincolante e che la giurisprudenza esistente richiede già un'analisi caso per caso dell'uso legittimo. Avverte che imporre una "responsabilità ampia" costringerebbe di fatto l'industria in un regime di licenze che "renderebbe lo sviluppo di modelli di IA avanzati legalmente e finanziariamente impossibile".

Cosa potrebbe accadere in seguito

Il tribunale distrettuale che si occupa del caso Times dovrà bilanciare la posizione del DOJ sull'uso legittimo con le conclusioni dell'Ufficio del Copyright. Una sentenza a favore del DOJ stabilirebbe il precedente secondo cui i dati di addestramento possono essere raccolti senza un permesso esplicito, a condizione che i risultati del modello non presentino una somiglianza sostanziale. Una decisione a favore del giornale potrebbe innescare un'ondata di negoziazioni sulle licenze, rimodellando potenzialmente l'economia della ricerca sull'IA.

In sintesi

L'atto del DOJ trasforma la questione se l'addestramento dell'IA costituisca un uso legittimo in una battaglia giudiziaria ad alta posta in gioco. L'esito determinerà se gli sviluppatori potranno continuare a costruire potenti modelli linguistici su testi esistenti o se dovranno cercare costose licenze per ogni frammento di materiale che ingeriscono. La decisione avrà ripercussioni su tutto il settore tecnologico, l'industria dei media e l'intera economia creativa.