Perché il caso è finito in tribunale

ANI ha intentato una causa dopo aver notato che le risposte di ChatGPT a quesiti su notizie recenti dall'India somigliavano ai propri articoli pubblicati nell'agosto e settembre 2024. L'agenzia ha sostenuto che il modello linguistico di grandi dimensioni stesse riproducendo i suoi testi protetti da copyright, un'affermazione che, se confermata, costringerebbe OpenAI a sospendere o limitare pesantemente i suoi modelli in India.

OpenAI ha replicato che i due modelli citati — GPT-4 e il più recente GPT-4o — sono stati addestrati su dati con date di cutoff nell'aprile 2022 e nell'aprile 2024. Gli articoli di ANI sono apparsi dopo tali date, quindi non potevano far parte del set di addestramento originale. Il giudice Amit Bansal ha affermato che la sovrapposizione derivava molto probabilmente dalla Retrieval-Augmented Generation (RAG), che estrae contenuti web attuali nella risposta in tempo reale, e non dal fatto che il modello "ricordi" gli articoli.

La svolta legale: l'addestramento come "ricerca"

Il caso è importante perché la corte ha interpretato in modo ampio l'eccezione sul copyright dell'India per "uso privato o personale, inclusa la ricerca". Entrambe le parti hanno concordato che OpenAI abbia utilizzato il materiale di ANI durante la fase iniziale di addestramento, ma il giudice ha considerato tale uso come "trasformativo". In altre parole, il modello ha estratto solo grammatica, sintassi e schemi statistici, lasciando intatto il contenuto espressivo.

La corte ha stabilito due condizioni rigorose:

  • Le copie utilizzate per l'addestramento devono provenire da fonti lecite, non da archivi piratati o paywall a cui l'utente non può accedere.
  • Il materiale deve rimanere all'interno dell'ambiente dello sviluppatore; non può essere pubblicato o distribuito.

Applicando un test di equità in tre parti, il giudice ha ritenuto che l'uso di OpenAI fosse limitato all'addestramento, non ha riscontrato prove che il modello memorizzasse passaggi testuali parola per parola e ha osservato che ANI non ha subito perdite economiche dirette poiché le due aziende operano in segmenti di mercato differenti.

Come questo si inserisce in un mosaico di sentenze globali

La posizione dell'India rispecchia ora diverse sentenze statunitensi che favoriscono una visione trasformativa degli output dell'IA. In Kadrey v. Meta, un tribunale ha stabilito che il testo generato che non copia le parole esatte non costituisce violazione, mentre la storica decisione Google Books ha riconosciuto una limitata eccezione di "ricerca e visualizzazione" per i progetti di digitalizzazione. Altre cause negli Stati Uniti, come il caso Raw Story, sono state archiviate per mancanza di danni dimostrabili, ma la controversia Anthropic ha ricordato ai giudici che l'uso di dati piratati può comunque comportare responsabilità.

In Europa, le opinioni divergono nettamente. I tribunali di Monaco hanno stabilito che la riproduzione di testi di canzoni incorporati nei pesi del modello equivale a una violazione, mentre un tribunale di Londra ha recentemente respinto una richiesta contro Stability AI per motivi simili. La sentenza dell'Alta Corte di Delhi aggiunge un altro elemento: se l'addestramento è limitato a fonti lecite e l'output non è una copia testuale, l'attività può rientrare nell'eccezione per la ricerca.

Cosa dovrebbero monitorare gli sviluppatori

  • RAG vs. addestramento – La distinzione della corte tra "memorizzazione" (addestramento) e recupero in tempo reale (RAG) suggerisce che le future controversie si concentreranno sul fatto che una risposta provenga da una base di conoscenza statica o venga recuperata dal web in tempo reale. Gli sviluppatori potrebbero dover rendere più chiara questa distinzione nella documentazione del prodotto.
  • Provenienza delle fonti – Il requisito delle "fonti lecite" potrebbe spingere le aziende a inasprire le pipeline di cura dei dati, utilizzando contratti o licenze che dimostrino la legittimità di ogni frammento di testo.
  • Uso esclusivamente interno – Le aziende che pianificano di commercializzare gli output dei modelli devono mantenere i dati di addestramento rigorosamente interni. La condivisione di corpora grezzi con partner o con il pubblico potrebbe indebolire la difesa basata sulla ricerca.
  • Test del danno economico – Poiché la corte ha sottolineato l'assenza di un danno finanziario diretto, gli attori dovranno dimostrare una perdita concreta, non solo una percepita diluizione del marchio.
  • Risposta legislativa – I legislatori indiani stanno monitorando i dibattiti sul copyright relativi all'IA. Qualsiasi emendamento che restringa l'eccezione per la ricerca potrebbe influenzare retroattivamente i modelli già distribuiti, innescando un'ondata di audit di conformità.

La controargomentazione che ancora perseguita l'IA

Il reclamo di ANI ha evidenziato una preoccupazione reale: man mano che i LLM diventano più abili nel riprodurre espressioni specifiche, il confine tra uso "trasformativo" e "copia" può farsi labile. I critici sostengono che la RAG, pur essendo tecnicamente una funzione di ricerca, faccia comunque emergere contenuti protetti da copyright senza autorizzazione, violando potenzialmente il diritto di "comunicazione al pubblico".

Un precedente con effetti a catena in tutto il mondo

Classificando l'addestramento dei modelli come un'attività di ricerca consentita, l'Alta Corte di Delhi ha segnalato che l'India non bloccherà automaticamente lo sviluppo di modelli linguistici di grandi dimensioni per motivi di copyright, a condizione che gli sviluppatori rispettino la legalità delle fonti e mantengano l'addestramento interno. Questa interpretazione potrebbe incoraggiare le aziende a espandere le proprie operazioni in India, sapendo che un importante ostacolo legale si è attenuato.

Per i regolatori altrove, la sentenza offre un modello: definire un'eccezione per la ricerca ristretta e ben documentata, imporre standard di reperimento delle fonti chiari e richiedere che la gestione dei dati di addestramento avvenga esclusivamente a livello interno. Le nazioni che adotteranno un linguaggio simile potrebbero dare ai propri ecosistemi di IA nazionali la certezza necessaria per attrarre investimenti.

In sintesi: La decisione dell'Alta Corte di Delhi non concede carta bianca per lo scraping di qualsiasi testo ai fini dell'addestramento dell'IA, ma stabilisce che, secondo la legge indiana, un addestramento disciplinato e conforme alla legge si qualifica come ricerca. Tale interpretazione potrebbe diventare un punto di riferimento per i tribunali di tutto il mondo, mentre si interrogano se insegnare alle macchine a comprendere il linguaggio sia un'attività accademica protetta o una potenziale violazione.