Alibaba’s Qwen2.5-Max y DeepSeek’s V3-Flash llegaron al mercado esta semana, cada uno tomando un camino diferente hacia una inferencia de IA más económica. Alibaba activa solo unos 95 mil millones de parámetros por consulta con su diseño de mezcla de expertos (MoE) de 2,4 billones de parámetros; DeepSeek recorta la arquitectura para reducir el precio por token. La carrera armamentista de la IA ahora se mide en dólares por token, no solo en el tamaño del modelo.

De "más parámetros" a "menor costo"

Durante años, la métrica principal en el desarrollo de modelos de lenguaje de gran tamaño (LLM) fue el recuento de parámetros. OpenAI, Google y otros presumían de haber roto la barrera de los billones de parámetros, asumiendo que lo más grande significaba lo más inteligente. Alibaba y DeepSeek demuestran que el cálculo ha cambiado.

Qwen2.5-Max de Alibaba todavía se apoya en la escala, pero añade un truco de ahorro de costos. En un modelo denso, cada parámetro se ejecuta en cada inferencia, convirtiendo una red de 2,4 billones de parámetros en una bestia hambrienta de energía. El MoE divide la red en muchos "expertos" y dirige cada solicitud a un subconjunto. El enrutador de Qwen2.5-Max selecciona aproximadamente 95 mil millones de parámetros para cualquier prompt, ofreciendo la capacidad de razonamiento de un sistema de un billón de parámetros mientras mantiene bajo control la latencia y el consumo de energía.

DeepSeek prescinde por completo de la ambición de los billones de parámetros. Su modelo V3-Flash está diseñado para funcionar de forma barata, rápida y a escala. La empresa comercializa el modelo en torno a un "precio de inferencia ultra bajo", dirigido a desarrolladores que procesan millones de tokens diariamente sin arruinarse. El precio exacto no se ha revelado, pero el mensaje es claro: si una startup no puede permitirse las tarifas por token de Occidente, V3-Flash se convierte en una alternativa viable.

Por qué el costo de inferencia se está convirtiendo en una ventaja competitiva

El costo de inferencia es importante cuando los modelos salen del laboratorio y entran en producción. Las empresas que integran LLM en chatbots, procesos de análisis de documentos o motores de recomendación descubren rápidamente que el precio por token domina los gastos operativos. Un modelo que cuesta la mitad por token puede duplicar el presupuesto para otras iniciativas: más datos, mayor tráfico o funciones adicionales.

Las dos firmas chinas se dirigen a diferentes segmentos de mercado. El MoE de Alibaba promete un alto rendimiento para tareas complejas y con mucha carga de razonamiento, manteniendo al mismo tiempo un presupuesto de computación por solicitud modesto. El modelo más ligero de DeepSeek, por su parte, atrae a cargas de trabajo de alto volumen y sensibles a la latencia, donde la potencia bruta importa menos que un costo predecible.

Ambas estrategias podrían socavar a los proveedores occidentales que agrupan modelos grandes con precios premium. Si los desarrolladores logran resultados comparables con un precio por token más bajo, el incentivo para quedarse con las APIs costosas se debilita.

Lo que está en juego para el ecosistema global de la IA

  • Startups y PYMES: Los menores costos de inferencia reducen la barrera para los productos impulsados por IA. Los equipos que antes necesitaban capital adicional para las facturas de las API ahora pueden prototipar y lanzar productos con presupuestos más ajustados.
  • Empresas: Las grandes corporaciones que ejecutan servicios internos de IA pueden reducir los gastos operativos, liberando fondos para la adquisición de datos, el ajuste fino (fine-tuning) de modelos o computación adicional.
  • Proveedores occidentales: Sus modelos de ingresos dependen de los cargos por token. Un cambio hacia alternativas centradas en el costo les obliga a bajar los precios o a diferenciarse mediante capacidades que los modelos más económicos aún no pueden igualar.
  • Reguladores y responsables políticos: Una IA más asequible podría acelerar la adopción en diversos sectores, planteando interrogantes sobre la supervisión, la privacidad de los datos y el ritmo de la automatización.

Las compensaciones y los contraargumentos

Los modelos MoE como Qwen2.5-Max no son un regalo. La lógica de enrutamiento añade complejidad de ingeniería, y la activación dispersa puede producir un rendimiento desigual entre los distintos tipos de consulta. Si el enrutador falla, una solicitud puede activar expertos subóptimos, degradando la calidad del resultado. Además, el hardware todavía favorece la computación densa; los aceleradores especializados para la inferencia MoE aún no están extendidos, lo que podría limitar las ganancias de eficiencia en el mundo real.

La filosofía de DeepSeek, centrada primero en el costo, también conlleva riesgos. Un precio agresivo a menudo significa restricciones más estrictas en el tamaño del modelo y en los datos de entrenamiento, lo que podría limitar el rendimiento. Para aplicaciones que exigen un razonamiento matizado, el modelo más barato puede quedarse corto, empujando a los usuarios de nuevo hacia alternativas más grandes y costosas.

Por último, la "inteligencia por dólar" es solo un eje de la competencia. La latencia, la fiabilidad, el soporte del ecosistema y el cumplimiento de las regulaciones regionales siguen siendo decisivos. Las empresas que ofrezcan un paquete equilibrado en todas estas dimensiones probablemente dominarán, no solo aquellas que ganen la guerra de precios.

Qué observar a continuación

  • Publicación de benchmarks: Las evaluaciones independientes de la eficiencia de enrutamiento MoE de Qwen2.5-Max y del coste por token de V3-Flash revelarán si el entusiasmo se traduce en ahorros cuantificables.
  • Desarrollos de hardware: La adopción de aceleradores optimizados para la activación dispersa podría amplificar los beneficios de MoE, mientras que las GPU de propósito general podrían mantener la competitividad de los modelos densos.
  • Respuestas en los precios: Los proveedores occidentales podrían ajustar sus niveles de precios o añadir funciones de ahorro de costes, como descuentos por inferencia por lotes o licencias locales.
  • Movimientos regulatorios: A medida que la IA más económica se extienda, los gobiernos podrían introducir estándares de transparencia y seguridad que podrían afectar la forma en que estos modelos se despliegan a gran escala.

Conclusión

El modelo Qwen2.5-Max de Alibaba, basado en MoE, y el económico V3-Flash de DeepSeek demuestran que la carrera de la IA ahora se rige tanto por una hoja de cálculo de presupuesto como por el recuento de parámetros. Las empresas que ofrezcan capacidades lingüísticas sofisticadas manteniendo bajo el coste por token abrirán la IA a un conjunto más amplio de usuarios, reconfigurando la dinámica competitiva que durante mucho tiempo ha favorecido a los modelos más grandes y costosos.