Microsoft a déployé MAI Code 1.1 Flash comme le modèle de codage de nouvelle génération pour GitHub Copilot, mais les premiers benchmarks et les tableaux de prix le placent derrière l'offre en poids ouverts de DeepSeek, tant en termes de performance que de coût.
La réalité des benchmarks face au communiqué de presse
Les notes de lancement de Microsoft promettent un bond de 25 % de l'efficacité des tokens et une réduction de 75 % des coûts par rapport à la version de juin de son modèle MAI. L'entreprise vante également une hausse de 4 % de la « survie du code » après avoir entraîné le modèle dans des centaines de milliers d'environnements d'apprentissage par renforcement au sein de Copilot.
Des tests indépendants racontent une histoire différente. Sur la suite SWE-bench Verified, MAI Code 1.1 Flash enregistre un taux de réussite de 72,6 %, dépassant légèrement Claude Haiku 4.5 (69,8 %) et GPT-5.4 mini (69,2 %). L'avantage est modeste et limité à une seule métrique.
L'écart se creuse sur Terminal Bench 2.1, qui mesure la capacité d'un modèle à accomplir des tâches de ligne de commande en conditions réelles. Ici, MAI Code 1.1 Flash obtient un score de 62,9 %, tandis que DeepSeek-V4-Flash-0731 affiche un résultat de 82,7 %. Cette différence est suffisamment importante pour affecter les développeurs qui s'appuient sur la génération de code centrée sur le terminal.
Points de pression sur les prix
Microsoft commercialise le nouveau modèle comme une option « économique », mais la tarification des tokens dit le contraire. DeepSeek-V4-Flash facture 0,14 $ par token d'entrée et 0,28 $ par token de sortie. MAI Code 1.1 Flash affiche 0,20 $ pour l'entrée et 1,20 $ pour la sortie. Claude Haiku 4.5 se situe respectivement à 1,00 $ et 5,00 $, confirmant son statut premium.
La forte augmentation du coût des tokens de sortie signifie que tout flux de travail générant de larges blocs de code verra le modèle de Microsoft devenir l'option la plus coûteuse, même après les réductions promises par rapport à son prédécesseur. Pour les développeurs à grande échelle et les entreprises, l'économie penche nettement en faveur de DeepSeek.
Comment MAI Code 1.1 Flash est arrivé
Le modèle s'inscrit dans la stratégie plus large de Microsoft visant à remplacer les services tiers de la pile Copilot par des alternatives développées en interne. En s'entraînant sur de vastes données d'apprentissage par renforcement issues de l'utilisation de Copilot, Microsoft espère resserrer la boucle de rétroaction entre le comportement de l'utilisateur et l'amélioration du modèle. Le lancement suit également un schéma de mises à niveau progressives : la version de juin était positionnée comme un moyen de réduire les coûts, et l'itération Flash est présentée comme la prochaine étape de cette trajectoire.
Gagnants, perdants et enjeux globaux
Les entreprises cherchant à contrôler leurs dépenses en IA pourraient trouver la tarification de DeepSeek plus attractive, surtout lorsque le volume de sortie est élevé. Microsoft, quant à lui, gagne un contrôle plus étroit sur l'écosystème Copilot et la capacité de détourner les revenus des fournisseurs externes tels qu'OpenAI ou Anthropic.
La défense possible de Microsoft
Les propres données de Microsoft mettent l'accent sur les gains d'efficacité des tokens et un léger avantage sur SWE-bench.
À surveiller ensuite
- Indicateurs d'adoption : Les statistiques d'utilisation de Copilot révéleront si les développeurs passent au nouveau modèle par défaut ou s'ils importent des modèles alternatifs via l'API.
- Ajustements de prix : Si le prix des tokens de sortie de Microsoft reste élevé, la pression du marché pourrait forcer une révision.
- Mises à jour des benchmarks : De nouvelles versions de tests axés sur le terminal pourraient modifier l'équilibre des performances, surtout à mesure que Microsoft affine son pipeline d'apprentissage par renforcement.
- Concurrence des modèles en poids ouverts : L'arrivée de nouveaux modèles en poids ouverts sur le marché du codage pourrait intensifier la course prix-performance.
À retenir
MAI Code 1.1 Flash apporte des gains modestes sur un benchmark restreint, mais reste en deçà du modèle en poids ouverts de DeepSeek, tant pour les performances sur terminal que pour le coût des tokens, laissant aux développeurs le soin de peser la commodité de l'intégration face à l'efficacité brute.
