El NYT acusa a OpenAI de ocultar pruebas en un importante juicio por derechos de autor
La batalla legal en curso entre The New York Times y OpenAI ha dado un giro dramático, con alegaciones de que el gigante de la IA ocultó intencionadamente pruebas relacionadas con sus conjuntos de datos de entrenamiento. Esta escalada amenaza con desviar el enfoque de la demanda, pasando de la infracción de derechos de autor a la integridad del proceso judicial de exhibición de pruebas (discovery).
Alegaciones de prácticas de datos engañosas
The New York Times y The Daily News afirman que OpenAI no ha sido veraz respecto a su capacidad técnica para buscar tanto en su corpus de entrenamiento como en los registros de chat de los clientes. A lo largo de los dos años de litigio, OpenAI ha sostenido que la búsqueda en sus masivos conjuntos de datos sería técnicamente abrumadora y comprometería la privacidad de los usuarios.
Sin embargo, una declaración reciente del ingeniero de privacidad de datos de OpenAI, Vinnie Monaco, ha cuestionado esta narrativa. Según se alega, Monaco reveló que OpenAI ya había realizado búsquedas internas en su corpus de entrenamiento específicamente para identificar obras periodísticas protegidas por derechos de autor. Además, la declaración sugiere que OpenAI había acumulado una base de datos de aproximadamente 78 millones de conversaciones de ChatGPT desidentificadas para evaluar internamente el alcance de una posible infracción de derechos de autor.
Project Giraffe y el filtro "Bloom"
Quizás la revelación técnica más significativa involucra a "Project Giraffe", un conjunto de herramientas implementadas por OpenAI. Según los demandantes, poco después de presentarse la demanda, OpenAI utilizó un filtro "Bloom" como parte de este proyecto para detectar y registrar instancias de "regurgitación", donde el modelo reproduce contenido protegido por derechos de autor de forma literal en sus resultados.
La existencia de Project Giraffe contradice la postura previa de OpenAI de que identificar instancias específicas de reproducción de contenido dentro de sus registros era una tarea prohibitiva. Los demandantes argumentan que estas herramientas demuestran que OpenAI no solo era capaz de supervisar la infracción de derechos de autor, sino que estaba construyendo activamente infraestructura para rastrearla.
Disputas sobre la integridad de los datos y la exhibición de pruebas
El conflicto también se ha centrado en la calidad de los datos proporcionados al tribunal. Aunque los demandantes solicitaron originalmente una muestra de 120 millones de registros de chat, OpenAI negoció la cifra hasta reducirla a 20 millones. Cuando la muestra se presentó finalmente en diciembre, según se informa, el tribunal la consideró "inutilizable" debido al exceso de tachaduras (redactions).
El NYT ha ido más allá, alegando que OpenAI eliminó miles de millones de resultados de ChatGPT en violación de una orden de preservación dictada por el tribunal y sustituyó millones de registros en la muestra proporcionada. En respuesta, el portavoz de OpenAI, Drew Pusateri, ha negado todas las alegaciones, acusando al Times de intentar invadir la privacidad de los usuarios a medida que su caso legal se debilita.
Por qué esto es importante para la industria de la IA
Este caso es un referente para el futuro del desarrollo de la IA generativa y los límites legales del "uso legítimo" (fair use). Si el tribunal determina que OpenAI ocultó pruebas o manipuló la exhibición de pruebas, podría sentar un precedente sobre cómo las empresas de IA deben divulgar sus metodologías de entrenamiento y el origen de sus datos. Para los desarrolladores y fundadores de IA, el resultado aclarará el nivel de transparencia requerido al navegar por la intersección entre la ingesta masiva de datos y los derechos de propiedad intelectual.
Conclusiones clave
- Herramientas de monitoreo interno: Las alegaciones sugieren que OpenAI utilizó "Project Giraffe" y un filtro "Bloom" para rastrear activamente la regurgitación de contenido protegido por derechos de autor.
- Testimonio contradictorio: Las pruebas de la declaración sugieren que OpenAI poseía la capacidad técnica para buscar en sus datos de entrenamiento, contradiciendo sus afirmaciones previas sobre la carga técnica.
- Integridad de la exhibición de pruebas en juego: La demanda ahora depende de si OpenAI violó las órdenes de preservación al eliminar resultados y proporcionar muestras de datos con tachaduras "inutilizables".
