Nemotron 3 Nano 30B A3B, de voorganger, werd al gepositioneerd als een compact alternatief voor grotere foundation models. Door over te stappen op een hybride Mamba-Transformer-architectuur en op elk moment slechts 3,6 miljard parameters te activeren, verlegt Lightning de grenzen van efficiëntie terwijl het nog steeds een redeneervermogen levert dat vergelijkbaar is met veel grotere modellen.
Waarom snelheid nu belangrijk is
AI-agenten bewegen zich van batchgewijze inferentie naar continue interactie. Een chatbot die enkele seconden pauzeert, voelt traag aan; een tool voor code-aanvulling die achterloopt op het typen van een ontwikkelaar, verstoort de workflow. In die omgevingen vertaalt de doorvoer in tokens per seconde zich direct in de ervaren reactiesnelheid. De waarde van 670 tokens per seconde is ongeveer het dubbele van de 386 tokens per seconde die zijn gerapporteerd voor Google's Gemini 3.5 Flash-Lite, en het verkort de tijd om een standaard Intelligence Index-taak te voltooien tot ongeveer een half minuut. Ter vergelijking: Qwen 3.6 35B A3B heeft 3,5 minuten nodig en Gemma 4 31B heeft 5,8 minuten nodig voor dezelfde taak.
Dat verschil is cruciaal voor elke dienst die veel gelijktijdige verzoeken moet afhandelen. Een server die twee keer zoveel tokens verwerkt op dezelfde hardware, kan ofwel de kosten verlagen of de capaciteit verdubbelen, een duidelijk voordeel voor cloudproviders en ondernemingen.
Hoe het model zijn cijfers behaalt
De hybride architectuur van Nemotron 3.5 Lightning combineert de sterke punten van Transformers in het herkennen van patronen op lange afstand met de efficiëntie van Mamba-blocks in de state-space. Het ontwerp houdt het totale aantal parameters hoog — 31,6 miljard — om de modelleringscapaciteit te behouden, maar er zijn er slechts 3,6 miljard actief voor elk gegeven token. Sparse activatie vermindert de rekenkracht per token, waardoor de doorvoer stijgt zonder een evenredig verlies aan kwaliteit.
Artificial Analysis mat een Intelligence Index-score van 24 voor Lightning, een sprong van negen punten ten opzichte van de 15 die het eerdere Nano-model behaalde. Dat brengt het op gelijke hoogte met OpenAI's gpt-oss-120b, ook al gebruikt Lightning ongeveer een kwart van de parameters. Het blijft nog achter bij de topmodellen — Meta's Muse Glimmer (35) en Qwen 3.6 35B A3B (32) — maar de intelligentie-tot-parameterverhouding behoort tot de beste.
Agentic benchmarks vertellen een vergelijkbaar verhaal
Agentic workloads — planning, toolgebruik, meerstapsredeneren — zijn waar Lightning uitblinkt. Op de GDPval-AA v2 benchmark behaalde het model een Elo-rating van 824, waarmee het de 120 miljard parameters tellende gpt-oss-120b (800) en Nvidia's eigen grotere Nemotron 3 Super (698) overtreft. In de Terminal-Bench v2.1 test steeg het succespercentage van Lightning van 7% naar 24,3%, waarmee het dicht in de buurt komt van de 26,2% die door gpt-oss-120b werd geregistreerd.
Nvidia gaf de credit aan samenwerkingen na de training met partners zoals CodeRabbit en Harvey voor het afstemmen van het model op domeinspecifieke taken. Deze verfijningen houden het model snel terwijl het concurrerend blijft op gespecialiseerde workloads.
Beschikbaarheid en praktische overwegingen
Het model wordt uitgebracht onder de permissieve OpenMDW-1.1-licentie, met gewichten in BF16- en NVFP4-formaten. De NVFP4-variant maakt het model compacter met minimaal kwaliteitsverlies, een nuttige optie voor edge-implementaties of kostenbewuste cloud-instanties. Een contextvenster van één miljoen tokens stelt het model in staat om zeer lange prompts te verwerken zonder afkaping, wat waardevol is voor documentanalyse op hoog niveau of uitgebreide codebases.
Serverloze inferentie is al beschikbaar bij aanbieders zoals DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius en Crusoe. Ontwikkelaars kunnen beginnen met experimenteren zonder een eigen infrastructuur op te bouwen, hoewel de werkelijke kosteneffectiviteit zal afhangen van de prijsstelling van elk platform.
Kernpunt: Nemotron 3.5 Lightning bewijst dat een model het redeneerniveau van 120 miljard parameters tellende systemen kan evenaren, terwijl het bijna twee keer de token-doorvoer levert van vooraanstaande concurrenten, wat het een sterke kandidaat maakt voor latentiegevoelige AI-agenten.
