A Nvidia lançou o Nemotron 3.5 Lightning em 11 de agosto. O modelo mixture-of-experts de 30 bilhões de parâmetros funciona com apenas 3 bilhões de parâmetros ativos, e sua biblioteca de roteamento complementar, NeMo Switchyard, já desencadeou um debate sobre custos de inferência e eficiência de cache. A maneira como o Switchyard alterna requisições entre modelos pode destruir os caches de prompt e potencialmente dobrar a conta de uma única sessão de inferência.

Um modelo construído para agentes de pesos abertos

O Nemotron 3.5 Lightning é voltado para agentes de IA que chamam ferramentas, validam resultados e mantêm um rastro de raciocínio. Três escolhas técnicas o diferenciam:

  • Arquitetura híbrida – Ele funde um núcleo de espaço de estados Mamba-2 com um Transformer convencional, provando que designs não baseados em Transformer podem competir nessa escala.
  • Quantização de ponto flutuante de 4 bits – O fornecimento em baixa precisão permite que o modelo de 30B produza aproximadamente 100 tokens por segundo em um MacBook Pro M5 Max, uma velocidade que um modelo de precisão total teria dificuldade em igualar.
  • Abertura total – A Nvidia lançou os arquivos de pesos e a receita de treinamento completa, uma raridade para um modelo voltado para inferência de alto desempenho.

Usuários iniciais dizem que o modelo pode “pensar demais”, gerando longas cadeias de raciocínio que às vezes erram. Os desenvolvedores ganham um executor de agentes poderoso e abertamente disponível, mas devem elaborar os prompts com cuidado para evitar verbosidade desnecessária.

Por que a camada de roteamento é importante

O NeMo Switchyard é a biblioteca da Nvidia para rotear dinamicamente uma requisição para o “melhor” modelo entre um conjunto de candidatos. Em teoria, um roteador pode aumentar a qualidade da resposta ao escolher um modelo especialista para cada consulta. Na prática, a decisão de roteamento entra em conflito com os mecanismos de cache de prompt nos quais muitos pipelines de inferência dependem.

  • Caches de prompt armazenam embeddings de tokens do prompt inicial para que gerações posteriores possam reutilizá-los sem recomputar a etapa de “prefill”.
  • Trocas de roteamento movem uma requisição do Modelo A para o Modelo B após os primeiros tokens, forçando o sistema a descartar o prompt em cache e recomputá-lo do zero para o novo modelo.

Como a maior parte dos gastos com IA vai para a leitura do prompt em cache, em vez da geração de novos tokens, um único salto de roteamento pode efetivamente dobrar o custo de uma requisição.

O cabo de guerra dos custos

O que está no horizonte

O debate surge no momento em que a estratégia de pesos abertos da Nvidia encontra concorrência direta. Em 15 de agosto, o Qwen 3.8-27B será lançado, e os primeiros benchmarks sugerem que ele pode competir de igual para igual com o Nemotron 3.5 Lightning em cenários de desenvolvimento local.

O padrão da Nvidia — pesos abertos, receitas de treinamento abertas e uma camada de roteamento aberta — parece projetado para tornar suas GPUs o hardware padrão para qualquer pessoa que execute esses modelos localmente. Ao expor a pilha de software, a Nvidia espera prender os desenvolvedores ao seu ecossistema, mesmo que a lógica de roteamento adicione penalidades de custo ocultas.

Conclusão

Se você planeja executar o Nemotron 3.5 Lightning em sua própria máquina, pergunte não apenas “quão rápido ele pode gerar?”, mas também “com que frequência o Switchyard me forçará a descartar meu cache de prompt?”. Essa resposta determinará se a promessa de pesos abertos do modelo se tornará uma economia no mundo real ou um experimento caro. À medida que alternativas como o Qwen surgem, o equilíbrio entre a flexibilidade de roteamento e a eficiência de custo baseada em cache decidirá qual conjunto de ferramentas — e, em última análise, qual plataforma de hardware — vencerá.