Le nouveau modèle MiMo-V2-Flash de Xiaomi, un système de type « mixture-of-experts » (MoE) de 309 milliards de paramètres, domine désormais le classement open-source de SWE-Bench avec une précision de 73,4 %, tout en utilisant moins de 1/50e de la puissance de calcul de modèles comparables. Ce résultat démontre qu'une performance d'élite est possible sans les factures énergétiques massives qui sont devenues la norme pour la recherche sur les grands modèles de langage.

Pourquoi Xiaomi s'est tourné vers le MoE

Une architecture MoE contourne les coûts en attachant de nombreux sous-réseaux « experts » à une structure commune (backbone). Le modèle stocke l'intégralité des 309 milliards de paramètres mais n'en active qu'environ 15 milliards pour chaque jeton (token). Cette activation sélective réduit considérablement la mémoire et la puissance de calcul nécessaires à l'inférence, permettant au modèle de fonctionner sur environ dix GPU H100 avec 618 Go de VRAM en mode FP16.

Les astuces d'ingénierie qui le rendent pratique

  • Modèle d'attention hybride – La plupart des couches utilisent une attention par fenêtre glissante (sliding-window attention), limitant la matrice d'attention à une bande étroite autour de chaque jeton. Chaque sixième couche passe à une attention globale, capturant les dépendances à longue portée sans faire exploser la mémoire. Ce modèle réduit l'utilisation de la mémoire d'un facteur six.
  • Module de décodage rapide – Un prédicteur intégré émet plusieurs jetons lors d'une seule passe avant (forward pass), offrant une vitesse de génération jusqu'à 2,6 fois supérieure au décodage autorégressif standard.
  • Fenêtre de contexte de 256 K – L'architecture peut ingérer des entrées d'un quart de million de jetons, ce qui est utile pour les bases de code, les articles de recherche ou tout document long.

Ces composants permettent au modèle de rester utilisable sur du matériel qui serait autrement hors de portée pour un système de l'échelle de 309 milliards de paramètres.

Multi-Teacher On-Policy Distillation (MOPD)

MOPD entraîne le modèle étudiant — MiMo-V2-Flash — en utilisant de nombreux enseignants spécialisés : un pour les mathématiques, un autre pour la programmation, et ainsi de suite. Tandis que l'étudiant génère ses propres réponses, il reçoit simultanément les retours de tous les enseignants. Comme l'étudiant apprend à partir de la distribution qu'il produira réellement, la distillation reste stable et le transfert de connaissances reste concentré sur des tâches du monde réel.

MOPD consomme moins de 1/50e de la puissance de calcul requise par les méthodes traditionnelles.

Performances aux benchmarks

Benchmark Score
SWE-Bench (codage) 73,4 %
GPQA-Diamond (QA générale) 83,7 %
MMLU-Pro (compréhension du langage multitâche) 84,9 %
Arena-Hard (chat adversaire) 86,2 %

Les compromis qui subsistent

Même avec les économies réalisées grâce au MoE, faire tourner MiMo-V2-Flash n'est pas à la portée d'un simple ordinateur portable. Les déploiements nécessitent toujours environ dix GPU H100, et l'exigence de 618 Go de VRAM confine le modèle aux environnements de centres de données dotés d'interconnexions à haute vitesse.

À surveiller ensuite

À retenir : MiMo-V2-Flash prouve que des pipelines d'entraînement ingénieux et des architectures modulaires peuvent offrir des performances de premier plan sans les coûts de calcul démesurés qui définissent le développement des grands modèles de langage depuis des années. Le prochain défi sera de rendre ces performances assez abordables pour tout le monde, au-delà des laboratoires bien financés.