El acuerdo de Anthropic de 1.500 millones de dólares por piratería: una pérdida récord y una victoria estratégica
Anthropic ha alcanzado un histórico acuerdo de 1.500 millones de dólares con un grupo de autores de libros tras las alegaciones de haber utilizado bases de datos pirateadas para entrenar sus modelos. Aunque el masivo pago representa un golpe financiero, los matices legales del caso podrían, de hecho, suponer una victoria significativa para la industria de la IA en general en lo que respecta al uso legítimo (fair use).
Los detalles del acuerdo récord
Un tribunal federal de San Francisco ha aprobado un acuerdo histórico después de que las pruebas revelaran que Anthropic descargó libros de notorias bases de datos de piratería, específicamente LibGen y PiLiMi, entre 2021 y 2022. La escala del acuerdo no tiene precedentes en la historia de las demandas colectivas, ya que abarca aproximadamente 482.460 obras registradas.
Del total de las obras implicadas, los autores reclamaron con éxito el 91,3 por ciento. Cada reclamante recibirá aproximadamente 3.000 dólares, una cifra que cuadruplica el mínimo legal. Como parte de la resolución legal, Anthropic está obligada a destruir los archivos pirateados utilizados durante este periodo. Crucialmente, el acuerdo no otorga a la empresa un pase libre general; los autores conservan el derecho a presentar reclamaciones si los resultados de la IA reproducen obras originales o si las futuras prácticas de adquisición de datos de Anthropic violan las leyes de derechos de autor.
Un tecnicismo que favorece el desarrollo de la IA
A pesar del asombroso coste de 1.500 millones de dólares, el precedente legal sentado por este caso es sorprendentemente favorable para los laboratorios de IA. El acuerdo aborda el acto específico de utilizar fuentes pirateadas, pero no dictamina sobre la legalidad del entrenamiento de la IA en sí mismo.
El juez Alsup ya había establecido previamente una distinción crítica: entrenar la IA con libros obtenidos legalmente es "transformativo —y de forma espectacular—" y entra de lleno en la doctrina del uso legítimo (fair use). Esta distinción es vital para empresas como OpenAI, Google y Meta. Sugiere que, si bien la fuente de los datos (piratería frente a adquisición legal) es una responsabilidad, el proceso de entrenar un modelo para comprender el lenguaje y los patrones es legalmente defendible.
La frontera no resuelta del raspado masivo de datos (mass scraping)
Si bien este fallo ofrece un salvavidas a los laboratorios que entrenaron con conjuntos de datos masivos, la batalla legal sobre la "adquisición legal" está lejos de terminar. La pregunta central sigue siendo: ¿el raspado masivo (mass scraping) de contenido de internet sin el consentimiento explícito de los propietarios de los sitios web constituye una adquisición legal o una infracción de los derechos de autor?
Este acuerdo pone de relieve una realidad legal bifurcada para la industria de la IA. Las empresas pueden evitar sanciones masivas asegurándose de que sus canales de datos estén limpios de repositorios pirateados conocidos, pero siguen enfrentándose a un panorama incierto en cuanto a los derechos de los editores web y los creadores de contenido. A medida que los laboratorios de IA continúen escalando, la tensión entre el progreso tecnológico transformativo y los derechos de propiedad intelectual seguirá siendo el obstáculo legal más importante de la industria.
Conclusiones clave
- Pago récord: Anthropic pagará 1.500 millones de dólares a los autores tras utilizar bases de datos pirateadas como LibGen, lo que marca el mayor acuerdo de derechos de autor en la historia de las demandas colectivas.
- Precedente de uso legítimo: El tribunal afirmó que entrenar la IA con datos obtenidos legalmente es "espectacularmente transformativo", lo que proporciona un importante escudo legal para el entrenamiento legítimo de la IA.
- La integridad de los datos es crítica: El fallo subraya que la legalidad del entrenamiento de la IA a menudo depende de la procedencia de los datos de entrenamiento y no del proceso de entrenamiento en sí mismo.
