O novo modelo MiMo-V2-Flash da Xiaomi, um sistema de mistura de especialistas (MoE) de 309 bilhões de parâmetros, agora lidera o ranking de código aberto no SWE-Bench com 73,4% de precisão, utilizando menos de 1/50 do poder computacional de modelos comparáveis. O resultado mostra que um desempenho de elite é possível sem as contas de energia massivas que se tornaram o padrão para a pesquisa de modelos de linguagem de grande escala.

Por que a Xiaomi recorreu ao MoE

Uma arquitetura MoE evita o custo ao anexar muitas sub-redes "especialistas" a um backbone compartilhado. O modelo armazena todos os 309 bilhões de parâmetros, mas ativa apenas cerca de 15 bilhões para cada token. Essa ativação seletiva reduz drasticamente a memória e o processamento de inferência, permitindo que o modelo rode em aproximadamente dez GPUs H100 com 618 GB de VRAM no modo FP16.

Os truques de engenharia que o tornam prático

  • Padrão de atenção híbrido – A maioria das camadas utiliza atenção de janela deslizante (sliding-window attention), limitando a matriz de atenção a uma banda estreita ao redor de cada token. A cada sexta camada, o sistema muda para atenção global, capturando dependências de longo alcance sem explodir o uso de memória. O padrão reduz o uso de memória em um fator de seis.
  • Módulo de decodificação rápida – Um preditor integrado emite vários tokens em uma única passagem direta (forward pass), entregando uma velocidade de geração até 2,6 vezes maior do que a decodificação autorregressiva padrão.
  • Janela de contexto de 256 K – A arquitetura processa entradas de um quarto de milhão de tokens, o que é útil para bases de código, artigos de pesquisa ou qualquer documento longo.

Esses componentes mantêm o modelo utilizável em hardwares que, de outra forma, estariam fora do alcance para um sistema na escala de 309 bilhões de parâmetros.

Multi-Teacher On-Policy Distillation (MOPD)

O MOPD treina o modelo estudante — MiMo-V2-Flash — usando vários professores especializados: um para matemática, outro para programação, e assim por diante. Enquanto o estudante gera suas próprias respostas, ele recebe feedback de todos os professores ao mesmo tempo. Como o estudante aprende a partir da distribuição que ele realmente produzirá, a destilação permanece estável e a transferência de conhecimento permanece focada em tarefas do mundo real.

O MOPD consome menos de 1/50 do processamento exigido pelos métodos tradicionais.

Desempenho em benchmarks

Benchmark Pontuação
SWE-Bench (codificação) 73,4 %
GPQA-Diamond (QA geral) 83,7 %
MMLU-Pro (compreensão de linguagem multitarefa) 84,9 %
Arena-Hard (chat adversarial) 86,2 %

As compensações que permanecem

Mesmo com as economias do MoE, rodar o MiMo-V2-Flash não é algo que se faça em um laptop. As implementações ainda exigem cerca de dez GPUs H100, e o requisito de 618 GB de VRAM confina o modelo a ambientes de data center com interconexões de alta velocidade.

O que observar a seguir

Conclusão: O MiMo-V2-Flash prova que pipelines de treinamento inteligentes e arquiteturas modulares podem entregar desempenho de alto nível sem os custos computacionais descontrolados que definiram o desenvolvimento de modelos de linguagem de grande escala por anos. O próximo obstáculo é tornar esse desempenho acessível o suficiente para qualquer pessoa além de laboratórios bem financiados.