Il nuovo modello MiMo-V2-Flash di Xiaomi, un sistema mixture-of-experts (MoE) da 309 miliardi di parametri, guida ora la classifica open-source su SWE-Bench con un'accuratezza del 73,4%, utilizzando meno di 1/50 della potenza di calcolo rispetto ai modelli comparabili. Il risultato dimostra che prestazioni d'élite sono possibili senza le enormi bollette energetiche che sono diventate la norma per la ricerca sui modelli linguistici di grandi dimensioni.
Perché Xiaomi ha scelto la MoE
Un'architettura MoE aggira i costi collegando molte sottoreti "esperte" a un backbone condiviso. Il modello memorizza tutti i 309 miliardi di parametri, ma ne attiva solo circa 15 miliardi per ogni token. Questa attivazione selettiva riduce drasticamente la memoria e la potenza di calcolo necessarie per l'inferenza, consentendo al modello di girare su circa dieci GPU H100 con 618 GB di VRAM in modalità FP16.
I trucchi ingegneristici che lo rendono pratico
- Pattern di attenzione ibrido – La maggior parte dei layer utilizza l'attenzione a finestra scorrevole (sliding-window attention), limitando la matrice di attenzione a una stretta banda attorno a ogni token. Ogni sesto layer passa all'attenzione globale, catturando dipendenze a lungo raggio senza far esplodere l'uso della memoria. Questo pattern riduce l'uso della memoria di un fattore sei.
- Modulo di decodifica rapida – Un predittore integrato emette diversi token in un singolo passaggio in avanti (forward pass), offrendo una velocità di generazione fino a 2,6 volte superiore rispetto alla decodifica autoregressiva standard.
- Finestra di contesto da 256 K – L'architettura elabora input da un quarto di milione di token, utile per codebase, documenti di ricerca o qualsiasi documento lungo.
Questi componenti rendono il modello utilizzabile su hardware che altrimenti sarebbe fuori portata per un sistema di scala 309 miliardi di parametri.
Multi-Teacher On-Policy Distillation (MOPD)
MOPD addestra il modello studente — MiMo-V2-Flash — utilizzando molti insegnanti specializzati: uno per la matematica, un altro per la programmazione, e così via. Mentre lo studente genera le proprie risposte, riceve feedback da tutti gli insegnanti contemporaneamente. Poiché lo studente impara dalla distribuzione che produrrà effettivamente, la distillazione rimane stabile e il trasferimento di conoscenza resta focalizzato su compiti del mondo reale.
MOPD consuma meno di 1/50 della potenza di calcolo richiesta dai metodi tradizionali.
Prestazioni nei benchmark
| Benchmark | Punteggio |
|---|---|
| SWE-Bench (coding) | 73,4 % |
| GPQA-Diamond (general QA) | 83,7 % |
| MMLU-Pro (multitask language understanding) | 84,9 % |
| Arena-Hard (adversarial chat) | 86,2 % |
I compromessi che rimangono
Anche con i risparmi offerti dalla MoE, eseguire MiMo-V2-Flash non è un'operazione da laptop. L'implementazione richiede ancora circa dieci GPU H100, e il requisito di 618 GB di VRAM confina il modello ad ambienti data-center con interconnessioni ad alta velocità.
Cosa osservare in futuro
Conclusione: MiMo-V2-Flash dimostra che pipeline di addestramento intelligenti e architetture modulari possono offrire prestazioni di alto livello senza i costi di calcolo fuori controllo che hanno caratterizzato lo sviluppo dei modelli linguistici di grandi dimensioni per anni. La prossima sfida sarà rendere tali prestazioni accessibili a chiunque, oltre i laboratori ben finanziati.
