La IA Gemini de Google se enfrenta a una demanda colectiva presentada ante un tribunal federal de Nueva York que acusa a la empresa de entrenar sus modelos con libros y artículos protegidos por derechos de autor sin permiso. La demanda, presentada por una coalición que incluye a importantes editoriales y al autor Scott Turow, afirma que Google eliminó deliberadamente la información de derechos de autor para ocultar el uso de "materiales robados" en su sistema de IA generativa.

La demanda y sus alegatos principales

La presentación ante el Tribunal de Distrito de los EE. UU. para el Distrito Sur de Nueva York enumera a Hachette, Cencage, Elsevier, el colectivo S.C.R.I.B.E. y a Turow como demandantes. Alegan que Google fue más allá del acuerdo de "solo fragmentos" (snippet-only) que regía Google Books, utilizando obras de texto completo de ese archivo y de títulos subidos a Google Play para entrenar a Gemini. Según la demanda, Google no solo extrajo el contenido, sino que también alteró o eliminó los metadatos de derechos de autor, un paso que, según los demandantes, tenía la intención de ocultar la infracción.

Un memorando interno de Google mencionado en la demanda advierte que el empleo de libros con derechos de autor para el entrenamiento de IA podría ser "altamente problemático" y exponer a la empresa a multas que oscilan entre los 10.000 y los 100.000 millones de dólares. Los demandantes señalan una reciente sanción de 1.500 millones de dólares contra otra empresa de IA por el uso no autorizado de datos como punto de referencia para la escala de la responsabilidad potencial.

Cómo llegamos hasta aquí

La relación de Google con las editoriales de libros comenzó con Google Books, un índice de búsqueda que mostraba breves extractos y detalles bibliográficos, dejando el texto completo tras un muro de pago. Ese modelo se basaba en acuerdos de licencia que limitaban a Google a mostrar fragmentos. Con los años, Google amplió su presencia a través de la tienda Google Play, donde editores y autores suben libros electrónicos de texto completo para su venta.

Los demandantes argumentan que el cambio de Google de un servicio de indexación de "alcance limitado" a una fuente de datos para el entrenamiento de modelos de lenguaje extensos (LLMs) infringe los acuerdos originales. Afirman que la empresa nunca obtuvo los permisos amplios necesarios para incorporar obras completas en el proceso de entrenamiento de Gemini.

Qué está en juego para Google y la industria de la IA

Si un tribunal determina que el uso de material protegido por derechos de autor sin una licencia viola la ley de propiedad intelectual, la decisión podría remodelar la forma en que los desarrolladores de IA recopilan los datos de entrenamiento.

Posibles defensas y contraargumentos

Es probable que Google se apoye en la doctrina del "uso legítimo" (fair use), que permite el uso limitado de material protegido por derechos de autor para comentarios, críticas o transformación. Fallos recientes en California han tratado el entrenamiento de IA como una actividad transformadora, otorgándole la protección del uso legítimo. Los demandantes de Nueva York presentaron la demanda fuera de esa jurisdicción para evitar esos precedentes.

Los demandantes contraargumentan que la eliminación de los metadatos de derechos de autor demuestra una intención de ocultar la fuente, lo que socava cualquier argumento de transformación de buena fe. También citan el memorando interno como prueba de que Google reconoció el riesgo legal.

Qué observar a continuación

El caso pasará por mociones previas al juicio que podrían dar forma a los argumentos disponibles para ambas partes, incluyendo si el tribunal aplicará el análisis de uso legítimo utilizado en California o adoptará un estándar diferente. Un fallo sobre la jurisdicción podría determinar si los tribunales de Nueva York se convierten en el foro principal para las disputas de derechos de autor relacionadas con la IA.

En resumen: La demanda en Nueva York contra Gemini de Google podría redibujar la línea entre el uso permisible de datos y la infracción de derechos de autor, obligando a los desarrolladores de IA a replantearse cómo adquieren la materia prima que impulsa sus modelos y remodelando la economía de toda la industria.