Microsoft lanzó MAI Code 1.1 Flash como el modelo de codificación de próxima generación para GitHub Copilot, pero los primeros benchmarks y las tablas de precios lo sitúan por detrás de la oferta de pesos abiertos de DeepSeek, tanto en rendimiento como en coste.

La realidad de los benchmarks frente al comunicado de prensa

Las notas de lanzamiento de Microsoft prometen un salto del 25 % en la eficiencia de tokens y un recorte del 75 % en el coste en comparación con la versión de junio de su modelo MAI. La empresa también destaca un aumento del 4 % en la "supervivencia del código" tras entrenar el modelo en cientos de miles de entornos de aprendizaje por refuerzo dentro de Copilot.

Las pruebas independientes cuentan una historia diferente. En la suite SWE-bench Verified, MAI Code 1.1 Flash registra una tasa de aprobación del 72,6 %, superando ligeramente a Claude Haiku 4.5 (69,8 %) y GPT-5.4 mini (69,2 %). La ventaja es modesta y se limita a una única métrica.

La brecha se amplía en Terminal Bench 2.1, que mide la capacidad de un modelo para completar tareas de línea de comandos en el mundo real. Aquí, MAI Code 1.1 Flash obtiene un 62,9 %, mientras que DeepSeek-V4-Flash-0731 registra un resultado del 82,7 %. Esa diferencia es lo suficientemente grande como para afectar a los desarrolladores que dependen de la generación de código centrada en la terminal.

Puntos de presión en los precios

Microsoft comercializa el nuevo modelo como una opción "económica", pero los precios de los tokens dicen lo contrario. DeepSeek-V4-Flash cobra 0,14 $ por token de entrada y 0,28 $ por token de salida. MAI Code 1.1 Flash tiene un precio de 0,20 $ para la entrada y 1,20 $ para la salida. Claude Haiku 4.5 se sitúa en 1,00 $ y 5,00 $ respectivamente, lo que confirma su estatus premium.

El fuerte aumento en el coste de los tokens de salida significa que cualquier flujo de trabajo que genere grandes bloques de código hará que el modelo de Microsoft se convierta en la opción más cara, incluso tras las reducciones prometidas respecto a su predecesor. Para los desarrolladores y empresas de gran escala, la economía se inclina marcadamente hacia DeepSeek.

Cómo llegó MAI Code 1.1 Flash

El modelo forma parte del impulso más amplio de Microsoft para sustituir los servicios de terceros en el stack de Copilot por alternativas desarrolladas internamente. Al entrenar con extensos datos de aprendizaje por refuerzo extraídos del uso de Copilot, Microsoft espera estrechar el bucle de retroalimentación entre el comportamiento del usuario y la mejora del modelo. El lanzamiento también sigue un patrón de actualizaciones incrementales: la versión de junio se posicionó como una forma de ahorrar costes, y la iteración Flash se presenta como el siguiente paso en esa trayectoria.

Ganadores, perdedores y lo que está en juego

Las empresas que buscan controlar el gasto en IA pueden encontrar los precios de DeepSeek más atractivos, especialmente cuando el volumen de salida es alto. Microsoft, por su parte, gana un control más estricto sobre el ecosistema de Copilot y la capacidad de desviar los ingresos de proveedores externos como OpenAI o Anthropic.

La posible defensa de Microsoft

Los propios datos de Microsoft enfatizan las ganancias en eficiencia de tokens y una ventaja modesta en SWE-bench.

Qué observar a continuación

  • Métricas de adopción: Las estadísticas de uso de Copilot revelarán si los desarrolladores cambian al nuevo modelo predeterminado o si importan modelos alternativos a través de la API.
  • Ajustes de precios: Si el precio de los tokens de salida de Microsoft se mantiene alto, la presión del mercado podría forzar una revisión.
  • Actualizaciones de benchmarks: Las nuevas versiones de las pruebas centradas en la terminal pueden alterar el equilibrio de rendimiento, especialmente a medida que Microsoft perfecciona su pipeline de aprendizaje por refuerzo.
  • Competencia de pesos abiertos: La entrada de modelos de pesos abiertos adicionales en el espacio de la codificación podría intensificar la carrera entre precio y rendimiento.

Conclusión

MAI Code 1.1 Flash aporta mejoras modestas en un benchmark limitado, pero se queda corto frente al modelo de pesos abiertos de DeepSeek tanto en rendimiento de terminal como en coste de tokens, dejando a los desarrolladores la tarea de sopesar la conveniencia de la integración frente a la eficiencia pura.