El Departamento de Justicia de los EE. UU. ha emitido una intervención legal significativa en la guerra de derechos de autor en curso entre los gigantes de los medios y los desarrolladores de IA. Al argumentar que el entrenamiento de modelos de lenguaje de gran tamaño (LLM) con datos protegidos por derechos de autor constituye "uso legítimo", el DOJ ha proporcionado un enorme escudo legal para empresas como OpenAI y Microsoft.

El argumento del DOJ: Entrenamiento vs. Resultado

En el centro de la demanda consolidada que involucra a The New York Times se encuentra una distinción fundamental entre cómo aprende una IA y qué es lo que produce. The New York Times alega que millones de sus artículos fueron utilizados sin permiso para entrenar modelos como GPT-4, lo que ha causado daños por miles de millones de dólares y ha creado productos que compiten directamente con el periódico.

Sin embargo, el reciente escrito del DOJ argumenta que la infracción de los derechos de autor ocurre en el punto de salida, no en el punto de ingesta. El departamento sostiene que, si bien se copian obras completas durante la fase de entrenamiento, estas copias nunca se ponen a disposición del público. Además, el DOJ afirma que los resultados de modelos como GPT-4 "a menudo, si no siempre, carecen de una similitud sustancial" con el material de origen. Al separar el proceso de entrenamiento del contenido generado, el DOJ intenta desacoplar el acto del aprendizaje automático del concepto legal de sustitución de mercado.

La "analogía de Hemingway" y la creatividad humana

Para que el concepto de aprendizaje automático sea comprensible, el DOJ invocó una analogía literaria que involucra a la autora Joan Didion. El escrito señaló que, siendo adolescente, Didion copiaba los relatos de Ernest Hemingway para analizar su estructura sintáctica y aprender su oficio. El DOJ argumenta que, si la ley tratara el entrenamiento de máquinas como una infracción, una escritora como Didion podría, teóricamente, enfrentar responsabilidad legal cada vez que publicara una obra nueva, ya que su proceso de aprendizaje estaría inextricablemente vinculado a su escritura posterior.

El departamento argumenta además que imponer una responsabilidad estricta por el entrenamiento de la IA, paradójicamente, sofocaría la misma creatividad que la ley de derechos de autor pretende proteger. Dado que los seres humanos utilizan cada vez más los LLM para redactar y editar obras originales, el DOJ sugiere que prohibir el entrenamiento sin esquemas de licencias masivos paralizaría la innovación impulsada por la IA.

Desafiando a la Oficina de Derechos de Autor de los EE. UU.

La postura del DOJ contradice directamente los hallazgos recientes de la Oficina de Derechos de Autor de los EE. UU. La exregistradora Shira Perlmutter había argumentado previamente en contra de una defensa general de "uso legítimo", señalando que la IA opera a una escala y velocidad que superan con creces la capacidad humana y que a menudo crea productos comerciales que compiten directamente con los creadores de contenido originales.

El DOJ ha pasado a la ofensiva contra esta evaluación, afirmando que el informe de Perlmutter no tiene autoridad legal vinculante y no tiene en cuenta la jurisprudencia establecida respecto al análisis caso por caso. El departamento advierte que imponer una responsabilidad amplia obligaría efectivamente a un régimen de licencias que haría que el desarrollo de modelos de IA avanzados fuera legal y financieramente imposible.

Puntos clave

  • Separación del entrenamiento y el resultado: El DOJ argumenta que copiar texto para el entrenamiento no constituye una infracción si los resultados del modelo resultante no muestran una "similitud sustancial" con las obras originales.
  • Protección de la innovación: El departamento advierte que exigir licencias para todos los datos de entrenamiento sofocaría la creatividad y evitaría el desarrollo de LLM que asisten en la creación de contenido humano.
  • Un caso testigo legal: Esta intervención crea un conflicto de alto nivel entre el DOJ y la Oficina de Derechos de Autor de los EE. UU., preparando el escenario para un fallo judicial definitivo sobre el futuro de la IA generativa.

ARTÍCULO: El Departamento de Justicia de los EE. UU. presentó un informe amicus curiae en la demanda de derechos de autor de New York Times, argumentando que copiar texto protegido para entrenar modelos de lenguaje de gran tamaño (LLM) califica como uso legítimo. El escrito otorga a empresas como OpenAI y Microsoft un escudo legal que podría mantenerlas fuera de un fondo de indemnizaciones que el periódico estima en miles de millones de dólares.

Por qué el caso es importante ahora

La demanda consolida varias alegaciones de que los desarrolladores de IA alimentaron sus modelos con millones de artículos de periódicos sin permiso, para luego lanzar productos que compiten directamente con la propia información del Times. Si un tribunal rechaza el argumento de uso legítimo del DOJ, las empresas de IA podrían enfrentarse a facturas de licencias masivas o verse obligadas a detener el desarrollo de la próxima generación de agentes conversacionales.

El argumento central del DOJ

El escrito divide el flujo de trabajo de la IA en dos etapas distintas. Primero, el modelo ingiere grandes corpus de texto; segundo, genera respuestas a las instrucciones de los usuarios. El departamento afirma que la infracción solo surge cuando una obra protegida por derechos de autor se reproduce de una manera que el público pueda acceder a ella. Debido a que las copias de entrenamiento nunca salen de los servidores del desarrollador, el acto de ingestión no alcanza ese umbral.

El DOJ también se apoya en la prueba de "similitud sustancial", un estándar de derechos de autor de larga data. Sostiene que el texto generado por modelos como GPT-4 "a menudo, si no siempre", difiere lo suficiente de cualquier fuente individual como para que un demandante no pueda probar la similitud requerida. En resumen, el escrito argumenta que el enfoque legal debería centrarse en el resultado final, no en el proceso de aprendizaje interno.

Una analogía literaria para ilustrar el punto

Para que el argumento técnico sea más comprensible, el documento invoca una historia sobre una escritora adolescente que copiaba los relatos de Ernest Hemingway para estudiar su estilo. El DOJ afirma que, si la ley tratara ese ejercicio de aprendizaje como una infracción, la escritora podría ser demandada cada vez que publicara una nueva obra, a pesar de que su trabajo fuera original. El departamento advierte que extender la misma lógica a la IA "paralizaría la misma creatividad que la ley de derechos de autor fue diseñada para proteger".

Lo que está en juego para los desarrolladores de IA y los creadores de contenido

  • Riesgo de innovación: Exigir licencias para cada fragmento de texto utilizado en el entrenamiento podría elevar los costos de tal manera que la creación de modelos de vanguardia resulte financieramente inviable.
  • Flujo de trabajo creativo: Los escritores humanos dependen cada vez más de los LLM para redactar, editar y realizar lluvias de ideas. Si el proceso de entrenamiento se considerara ilegal, esas herramientas podrían desaparecer, transformando la forma en que se produce el contenido en todas las industrias.
  • Impacto en el mercado: La industria de los periódicos argumenta que los modelos de IA que pueden responder preguntas o generar textos similares a noticias erosionan el valor del reportaje original, lo que podría desviar los ingresos publicitarios y las suscripciones.

El contraargumento de la Oficina de Derechos de Autor

Un informe reciente de la Oficina de Derechos de Autor de EE. UU., elaborado bajo la gestión de la exregistradora Shira Perlmutter, rechazó una defensa generalizada de uso legítimo (fair use). La oficina destacó tres factores que distinguen a la IA del aprendizaje humano: el enorme volumen de material copiado, la velocidad con la que se procesa y el hecho de que los modelos resultantes pueden empaquetarse y venderse como productos comerciales que compiten directamente con los creadores originales.

El DOJ rebate esos puntos, señalando que el informe no tiene autoridad legal vinculante y que la jurisprudencia existente ya exige un análisis caso por caso del uso legítimo. Advierte que imponer una "responsabilidad amplia" obligaría efectivamente a la industria a adoptar un régimen de licencias que "haría que el desarrollo de modelos de IA avanzados fuera legal y financieramente imposible".

Qué podría pasar a continuación

El tribunal de distrito que lleva el caso del Times tendrá que sopesar la postura de uso legítimo del DOJ frente a las conclusiones de la Oficina de Derechos de Autor. Un fallo a favor del DOJ sentaría un precedente de que los datos de entrenamiento pueden recolectarse sin permiso explícito, siempre que los resultados del modelo se mantengan alejados de la similitud sustancial. Una decisión a favor del periódico podría desencadenar una ola de negociaciones de licencias, transformando potencialmente la economía de la investigación en IA.

En conclusión

El escrito del DOJ convierte la cuestión de si el entrenamiento de la IA constituye un uso legítimo en una batalla judicial de alto riesgo. El resultado determinará si los desarrolladores pueden seguir construyendo modelos de lenguaje potentes a partir de textos existentes o si deben buscar licencias costosas para cada fragmento de material que ingieran. La decisión tendrá repercusiones en el sector tecnológico, la industria de los medios y la economía creativa en general.