SkewAdam reduz o uso de memória no treinamento de Mixture-of-Experts em mais de 60% e proporciona um salto perceptível na precisão, permitindo que desenvolvedores encaixem um modelo MoE de 6,78 bilhões de parâmetros em uma única GPU de 40 GB.

Por que o treinamento de MoE atinge um limite de memória

Arquiteturas Mixture-of-Experts roteiam cada entrada através de um pequeno subconjunto de sub-redes "especialistas" (experts), mantendo uma espinha dorsal (backbone) densa. O benefício é um modelo que pode escalar para bilhões de parâmetros sem um aumento proporcional no processamento. Na prática, o otimizador — especificamente a variante AdamW que a maioria das equipes utiliza — consome a maior parte da RAM da GPU. Para um modelo de 6,78 B de parâmetros, apenas os tensores de momentum e variância do otimizador exigem cerca de 50 GB. Adicione as ativações e os pesos do modelo, e o pico de memória chega a 81,4 GB, forçando o uso de configurações multi-GPU ou cronogramas de treinamento mais lentos.

O que o SkewAdam faz de diferente

O SkewAdam não inventa uma nova regra de aprendizado. Ele reorganiza onde os momentos do Adam residem:

  • A espinha dorsal densa mantém o momentum de precisão total, preservando as atualizações suaves de que as camadas densas precisam.
  • O banco de especialistas armazena uma aproximação fatorada da variância, reduzindo os dados mantidos para cada especialista.
  • O roteador, que decide quais especialistas ativar, retém uma estimativa exata do segundo momento.

Ao tratar esses três componentes como "camadas" (tiers) separadas, o otimizador descarta a precisão redundante onde ela é menos importante e a mantém onde é mais crucial.

Impacto mensurável

Executar o mesmo modelo MoE de 6,78 B de parâmetros com o SkewAdam resulta em:

  • Pico de memória da GPU: 31,3 GB (reduzido de 81,4 GB)
  • Pegada do estado do otimizador: 1,29 GB (reduzido de 50 GB)

O estado reduzido cabe confortavelmente dentro de um único acelerador de 40 GB.

Ganhos de precisão, não apenas economia

Cortes de memória geralmente prejudicam a qualidade do modelo, mas o SkewAdam melhora a perplexidade — uma métrica padrão de modelos de linguagem — de 126,8 (AdamW) para 108,4. Ele também supera o Muon (120,2) e o Lion (393,7) na mesma tarefa. Os autores afirmam que o aumento vem da preservação do momentum em todas as três camadas; métodos que descartam o momentum inteiramente, como o Adafactor, ficam para trás.

Questões em aberto

Os resultados do SkewAdam são demonstrados em um modelo de 6,78 B de parâmetros. Ainda não está claro se as mesmas proporções de estado de memória se mantêm para modelos uma ordem de magnitude maior ou para tarefas além da modelagem de linguagem.

O que observar

  • Benchmarks em configurações MoE maiores (dezenas de bilhões de parâmetros).
  • Adoção por frameworks de código aberto e inclusão em scripts de treinamento populares.
  • Feedback da comunidade sobre compensações (trade-offs) ocultas, como velocidade de convergência ou estabilidade sob diferentes cronogramas de taxa de aprendizado.

Fonte: post de um desenvolvedor detalhando o design do otimizador e os resultados empíricos.