Nemotron 3 Nano 30B A3B, jego poprzednik, był już pozycjonowany jako kompaktowa alternatywa dla większych modeli fundamentowych. Dzięki przejściu na hybrydową architekturę Mamba-Transformer i aktywacji jedynie 3,6 miliarda parametrów w danym momencie, Lightning przesuwa granice wydajności, oferując jednocześnie moc rozumowania porównywalną z znacznie większymi modelami.
Dlaczego szybkość ma teraz znaczenie
Agenci AI przechodzą z wnioskowania wsadowego (batch-style) na ciągłą interakcję. Chatbot, który pauzuje na kilka sekund, wydaje się ociężały; narzędzie do autouzupełniania kodu, które nie nadąża za pisaniem programisty, zakłóca przepływ pracy. W takich warunkach przepustowość wyrażona w liczbie tokenów na sekundę bezpośrednio przekłada się na postrzeganą responsywność. Wynik 670 tokenów na sekundę jest niemal dwukrotnie wyższy niż 386 tokenów na sekundę raportowane dla Google Gemini 3.5 Flash-Lite, co skraca czas wykonania standardowego zadania w Intelligence Index do około pół minuty. Dla porównania, Qwen 3.6 35B A3B potrzebuje 3,5 minuty, a Gemma 4 31B potrzebuje 5,8 minuty na to samo zadanie.
Ta różnica ma znaczenie dla każdej usługi, która musi obsługiwać wiele jednoczesnych żądań. Serwer przetwarzający dwukrotnie więcej tokenów na tym samym sprzęcie może albo obniżyć koszty, albo podwoić wydajność, co stanowi wyraźną przewagę dla dostawców chmury i przedsiębiorstw.
Jak model osiąga takie wyniki
Hybrydowa architektura Nemotron 3.5 Lightning łączy zalety rozpoznawania wzorców na dużych dystansach, charakterystyczne dla Transformerów, z wydajnością bloków Mamba typu state-space. Projekt utrzymuje wysoką całkowitą liczbę parametrów — 31,6 miliarda — aby zachować zdolność modelowania, ale tylko 3,6 miliarda jest aktywnych dla danego tokenu. Rzadka aktywacja (sparse activation) redukuje moc obliczeniową na token, zwiększając przepustowość bez proporcjonalnej utraty jakości.
Artificial Analysis zmierzyło wynik Intelligence Index na poziomie 24 dla Lightning, co stanowi skok o dziewięć punktów w porównaniu do 15 punktów zdobytych przez wcześniejszy model Nano. Stawia to model na równi z gpt-oss-120b od OpenAI, mimo że Lightning wykorzystuje około jednej czwartej liczby parametrów. Wciąż ustępuje on jednak najlepszym modelom — Muse Glimmer (35) od Meta oraz Qwen 3.6 35B A3B (32) — ale jego stosunek inteligencji do liczby parametrów plasuje go wśród najlepszych.
Benchmarki agentowe mówią to samo
Obciążenia agentowe — planowanie, używanie narzędzi, wielokrokowy proces rozumowania — to obszary, w których Lightning błyszczy. W benchmarku GDPval-AA v2 model uzyskał rating Elo na poziomie 824, wyprzedzając 120-miliardowy model gpt-oss-120b (800) oraz większy model Nemotron 3 Super (698) od samej Nvidii. W teście Terminal-Bench v2.1 skuteczność Lightning wzrosła z 7% do 24,3%, zbliżając się do poziomu 26,2% zarejestrowanego przez gpt-oss-120b.
Nvidia przypisała te wyniki współpracy po treningu z partnerami takimi jak CodeRabbit i Harvey, co pozwoliło na dostrojenie modelu do zadań specyficznych dla danej dziedziny. Te ulepszenia sprawiają, że model pozostaje szybki, zachowując jednocześnie konkurencyjność w specjalistycznych obciążeniach.
Dostępność i kwestie praktyczne
Model jest udostępniany na łagodnej licencji OpenMDW-1.1, z wagami w formatach BF16 i NVFP4. Wariant NVFP4 pozwala na bardziej zwarty zapis modelu przy minimalnej utracie jakości, co jest przydatną opcją dla wdrożeń brzegowych (edge) lub kosztowo optymalnych instancji chmurowych. Okno kontekstowe o wielkości miliona tokenów pozwala modelowi obsługiwać bardzo długie prompty bez ucinania treści, co jest niezwykle cenne przy analizie dokumentów lub rozbudowanych bazach kodu.
Wnioskowanie typu serverless jest już dostępne u dostawców takich jak DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius i Crusoe. Deweloperzy mogą zacząć eksperymentować bez budowania własnej infrastruktury, choć rzeczywista opłacalność będzie zależeć od cenników poszczególnych platform.
Podsumowanie: Nemotron 3.5 Lightning udowadnia, że model może dorównać poziomowi rozumowania systemom o 120 miliardach parametrów, oferując jednocześnie niemal dwukrotnie wyższą przepustowość tokenów niż czołowi konkurenci, co czyni go silnym kandydatem dla agentów AI wrażliwych na opóźnienia.
