Nemotron 3 Nano 30B A3B, il predecessore, era già stato posizionato come un'alternativa compatta ai modelli foundation più grandi. Passando a un'architettura ibrida Mamba-Transformer e attivando solo 3,6 miliardi di parametri in ogni momento, Lightning spinge i confini dell'efficienza pur offrendo una capacità di ragionamento paragonabile a modelli molto più grandi.

Perché la velocità è importante ora

Gli agenti AI si stanno spostando dall'inferenza di tipo batch all'interazione continua. Un chatbot che si ferma per diversi secondi sembra lento; uno strumento di completamento del codice che ritarda rispetto alla digitazione di uno sviluppatore interrompe il flusso di lavoro. In questi contesti, il throughput di token al secondo si traduce direttamente nella reattività percepita. La cifra di 670 token al secondo è circa il doppio dei 386 token al secondo riportati per Google Gemini 3.5 Flash-Lite, e riduce il tempo necessario per completare un compito standard dell'Intelligence Index a circa mezzo minuto. Al contrario, Qwen 3.6 35B A3B richiede 3,5 minuti e Gemma 4 31B richiede 5,8 minuti per lo stesso compito.

Quel divario è fondamentale per qualsiasi servizio che debba gestire molte richieste simultanee. Un server che elabora il doppio dei token sullo stesso hardware può ridurre i costi o raddoppiare la capacità, un chiaro vantaggio per i fornitori di servizi cloud e le aziende.

Come il modello raggiunge questi risultati

L'architettura ibrida di Nemotron 3.5 Lightning combina i punti di forza dei Transformer nel riconoscimento di pattern a lungo raggio con l'efficienza degli stati di spazio (state-space) dei blocchi Mamba. Il design mantiene alto il numero totale di parametri — 31,6 miliardi — per preservare la capacità di modellazione, ma solo 3,6 miliardi sono attivi per ogni singolo token. L'attivazione sparsa riduce il calcolo per token, aumentando il throughput senza una perdita proporzionale di qualità.

Artificial Analysis ha misurato un punteggio Intelligence Index di 24 per Lightning, un salto di nove punti rispetto al 15 ottenuto dal precedente modello Nano. Questo lo pone al pari di OpenAI gpt-oss-120b, anche se Lightning utilizza circa un quarto dei parametri. Resta ancora indietro rispetto ai modelli di punta — Meta Muse Glimmer (35) e Qwen 3.6 35B A3B (32) — ma il suo rapporto intelligenza-parametri si colloca tra i migliori.

I benchmark agentici raccontano una storia simile

I carichi di lavoro agentici — pianificazione, uso di strumenti, ragionamento multi-step — sono il campo in cui Lightning eccelle. Nel benchmark GDPval-AA v2, il modello ha ottenuto un rating Elo di 824, superando il gpt-oss-120b da 120 miliardi di parametri (800) e il più grande Nemotron 3 Super di Nvidia (698). Nel test Terminal-Bench v2.1, il tasso di successo di Lightning è salito dal 7% al 24,3%, avvicinandosi al 26,2% registrato da gpt-oss-120b.

Nvidia ha attribuito i risultati alle collaborazioni post-training con partner come CodeRabbit e Harvey per l'affinamento del modello su compiti specifici del dominio. Questi perfezionamenti mantengono il modello veloce pur rimanendo competitivo su carichi di lavoro specializzati.

Disponibilità e considerazioni pratiche

Il modello viene rilasciato sotto la permissiva licenza OpenMDW-1.1, con pesi nei formati BF16 e NVFP4. La variante NVFP4 comprime maggiormente il modello con una perdita minima di qualità, un'opzione utile per implementazioni edge o istanze cloud attente ai costi. Una finestra di contesto da un milione di token consente al modello di gestire prompt molto lunghi senza troncamenti, il che è prezioso per l'analisi a livello di documento o per basi di codice estese.

L'inferenza serverless è già disponibile su provider come DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius e Crusoe. Gli sviluppatori possono iniziare a sperimentare senza dover costruire un'infrastruttura personalizzata, anche se la reale convenienza economica dipenderà dai prezzi di ogni singola piattaforma.

In sintesi: Nemotron 3.5 Lightning dimostra che un modello può eguagliare il livello di ragionamento dei sistemi da 120 miliardi di parametri, offrendo quasi il doppio del throughput di token rispetto ai principali concorrenti, il che lo rende un forte candidato per gli agenti AI sensibili alla latenza.