O novo modelo MiMo-V2-Flash da Xiaomi, um sistema de mistura de especialistas (MoE) de 309 bilhões de parâmetros, agora lidera o ranking de código aberto no SWE-Bench com 73,4% de precisão, utilizando menos de 1/50 do poder computacional de modelos comparáveis. O resultado mostra que um desempenho de elite é possível sem as contas de energia massivas que se tornaram o padrão para a pesquisa de modelos de linguagem de grande escala.
Por que a Xiaomi recorreu ao MoE
Uma arquitetura MoE evita o custo ao anexar muitas sub-redes "especialistas" a um backbone compartilhado. O modelo armazena todos os 309 bilhões de parâmetros, mas ativa apenas cerca de 15 bilhões para cada token. Essa ativação seletiva reduz drasticamente a memória e o processamento de inferência, permitindo que o modelo rode em aproximadamente dez GPUs H100 com 618 GB de VRAM no modo FP16.
Os truques de engenharia que o tornam prático
- Padrão de atenção híbrido – A maioria das camadas utiliza atenção de janela deslizante (sliding-window attention), limitando a matriz de atenção a uma banda estreita ao redor de cada token. A cada sexta camada, o sistema muda para atenção global, capturando dependências de longo alcance sem explodir o uso de memória. O padrão reduz o uso de memória em um fator de seis.
- Módulo de decodificação rápida – Um preditor integrado emite vários tokens em uma única passagem direta (forward pass), entregando uma velocidade de geração até 2,6 vezes maior do que a decodificação autorregressiva padrão.
- Janela de contexto de 256 K – A arquitetura processa entradas de um quarto de milhão de tokens, o que é útil para bases de código, artigos de pesquisa ou qualquer documento longo.
Esses componentes mantêm o modelo utilizável em hardwares que, de outra forma, estariam fora do alcance para um sistema na escala de 309 bilhões de parâmetros.
Multi-Teacher On-Policy Distillation (MOPD)
O MOPD treina o modelo estudante — MiMo-V2-Flash — usando vários professores especializados: um para matemática, outro para programação, e assim por diante. Enquanto o estudante gera suas próprias respostas, ele recebe feedback de todos os professores ao mesmo tempo. Como o estudante aprende a partir da distribuição que ele realmente produzirá, a destilação permanece estável e a transferência de conhecimento permanece focada em tarefas do mundo real.
O MOPD consome menos de 1/50 do processamento exigido pelos métodos tradicionais.
Desempenho em benchmarks
| Benchmark | Pontuação |
|---|---|
| SWE-Bench (codificação) | 73,4 % |
| GPQA-Diamond (QA geral) | 83,7 % |
| MMLU-Pro (compreensão de linguagem multitarefa) | 84,9 % |
| Arena-Hard (chat adversarial) | 86,2 % |
As compensações que permanecem
Mesmo com as economias do MoE, rodar o MiMo-V2-Flash não é algo que se faça em um laptop. As implementações ainda exigem cerca de dez GPUs H100, e o requisito de 618 GB de VRAM confina o modelo a ambientes de data center com interconexões de alta velocidade.
O que observar a seguir
Conclusão: O MiMo-V2-Flash prova que pipelines de treinamento inteligentes e arquiteturas modulares podem entregar desempenho de alto nível sem os custos computacionais descontrolados que definiram o desenvolvimento de modelos de linguagem de grande escala por anos. O próximo obstáculo é tornar esse desempenho acessível o suficiente para qualquer pessoa além de laboratórios bem financiados.
