Satya Nadella acaba de entablar una disputa pública con los mismos laboratorios que su empresa ayudó a construir. El director ejecutivo de Microsoft emitió una advertencia contundente sobre cómo las mayores empresas de IA están reescribiendo las reglas de la propiedad de los datos, y el mensaje tuvo un impacto inusual. En una publicación reciente en su blog, Nadella acusó a los laboratorios de vanguardia, incluidos OpenAI y Anthropic, de construir un mercado manipulado. Recopilan datos públicos para entrenar modelos masivos y luego aplican sus términos de servicio para evitar que cualquiera aprenda de los resultados que producen esos modelos. El resultado, argumenta, es una transferencia de valor unidireccional que deja a las empresas pagando la cuenta mientras entregan su conocimiento propietario.

El doble rasero de la destilación

Para entender la queja, ayuda observar la técnica que estos laboratorios están tan ansiosos por bloquear. La destilación es un método de entrenamiento común en el que un modelo más pequeño y especializado aprende de los resultados de uno más grande, en lugar de ingerir texto bruto de internet desde cero. Una startup o un equipo de investigación podría alimentar a un modelo de vanguardia con millones de prompts, capturar las respuestas y utilizar esa rica señal para entrenar un modelo compacto que se ejecute localmente o atienda una necesidad de nicho. Es más barato y consume mucha menos energía que construir un modelo fundacional desde cero.

Tanto OpenAI como Anthropic prohíben esta práctica en sus términos de servicio. Cuando detectan una destilación sistemática, la tratan como una violación. La aplicación de estas reglas a menudo se dirige a los rivales, particularmente a las empresas de IA con sede en China, a las que se acusa de utilizar el método para cerrar la brecha de capacidades sin igualar los miles de millones gastados en las ejecuciones de entrenamiento originales.

Nadella destacó la tensión en el centro de esta política. Estos mismos laboratorios construyeron sus modelos insignia rastreando la web abierta, extrayendo libros, foros, repositorios de código y artículos, todo bajo el argumento legal de que el entrenamiento con datos de acceso público constituye un uso legítimo (fair use). Minaron los bienes comunes. Sin embargo, ahora despliegan barreras legales para evitar que nadie trate los resultados de sus modelos como material de enseñanza público a cambio. Puedes aprender del conocimiento abierto del mundo, parecen decir, pero nadie puede aprender de nosotros.

Esa asimetría importa más allá del debate académico. Establece una jerarquía donde un puñado de proveedores de infraestructura controla quién puede saber qué. Si el uso legítimo justifica su ingesta de la inteligencia publicada de la humanidad, los resultados de esos modelos comienzan a parecer un bien común privatizado. Tanto competidores como clientes tienen prohibido reciclar esa señal en nuevas herramientas. El camino conduce únicamente hacia los laboratorios más grandes.

Pagando dos veces por su propia inteligencia

Nadella acuñó una frase para la trampa económica que ve formándose: la “paradoja de la información inversa”. En su opinión, las empresas están pagando actualmente por la inteligencia artificial dos veces, y solo uno de esos pagos aparece en una factura.

El primer coste es obvio. Las empresas compran créditos de API, se suscriben a Copilot o adquieren licencias de servicios de chatbot. El segundo coste es oculto. Cada vez que un empleado corrige un hecho alucinado, califica una respuesta como útil o refina un informe generado, esa acción produce lo que Nadella llama “exhaust” (residuo). Es el rastro de correcciones, datos de preferencia y registros de interacción generados durante el trabajo real.

Este exhaust no es basura digital. A menudo contiene lógica de negocio ganada con esfuerzo. Un equipo de logística podría pedirle a un modelo que optimice las rutas de envío utilizando restricciones internas que la empresa tardó años en desarrollar. Un departamento legal podría corregir iterativamente el lenguaje de un contrato hasta que el resultado coincida con el estilo de la empresa. Un grupo de investigación farmacéutica podría consultar datos clínicos de formas que revelen prioridades estratégicas. Cuando esas interacciones fluyen a través de una API de terceros, el proveedor ve el intercambio completo. El modelo aprende cómo deben ser las buenas respuestas para ese dominio específico.

Con el tiempo, esta retroalimentación hace que el modelo general del proveedor sea más agudo en las tareas exactas para las que el cliente lo contrató. El proveedor puede entonces volverse y vender esa capacidad mejorada al competidor del cliente, o lanzar un producto adyacente que imite el flujo de trabajo especializado. La empresa original pagó las cuotas de suscripción, donó su experiencia propietaria y, efectivamente, entrenó a su propia competencia.

Por qué la IA soberana está pasando de ser una palabra de moda a una estrategia

La respuesta lógica a esta fuga es recuperar el control sobre el bucle de aprendizaje. El argumento de Nadella está claramente diseñado para posicionar a Microsoft como un tipo diferente de propietario. En lugar de insistir en que los clientes alimenten su inteligencia en una caja negra centralizada, está defendiendo entornos donde el cliente mantiene las llaves.

Aquí es donde la conversación en torno a la IA soberana adquiere peso práctico. Ejecutar modelos dentro de una nube privada, un centro de datos local o una red virtual estrictamente controlada significa que los datos de interacción nunca salen del perímetro de la organización. La empresa sigue beneficiándose de los modelos fundacionales modernos, pero los pesos, los prompts y los datos de preferencia permanecen dentro de un límite que la empresa administra.

Microsoft ha construido su negocio de la nube Azure precisamente en torno a esta promesa de despliegues privados y residencia regional de datos. En su publicación, Nadella señaló que Microsoft quiere ser la plataforma donde las empresas puedan alojar su propio entrenamiento e inferencia sin enviar inadvertidamente su propiedad intelectual a un proveedor de modelos distante. La propuesta es sencilla: utilice una IA potente, pero conserve sus datos residuales.

Otros proveedores están haciendo ruido similar, pero la intervención de Nadella tiene un peso adicional debido a la profunda asociación de Microsoft con OpenAI. Para un CEO cuyo