Nemotron 3 Nano 30B A3B, der Vorgänger, war bereits als kompakte Alternative zu größeren Foundation-Modellen positioniert. Durch den Wechsel zu einer hybriden Mamba-Transformer-Architektur und die Aktivierung von nur 3,6 Milliarden Parametern zu jedem Zeitpunkt verschiebt Lightning die Effizienzgrenzen, während es gleichzeitig eine Argumentationsleistung liefert, die mit viel größeren Modellen vergleichbar ist.
Warum Geschwindigkeit jetzt entscheidend ist
KI-Agenten bewegen sich von Batch-Inferenz hin zu kontinuierlicher Interaktion. Ein Chatbot, der mehrere Sekunden pausiert, wirkt träge; ein Code-Vervollständigungstool, das der Eingabe eines Entwicklers hinterherhinkt, stört den Arbeitsfluss. In diesen Szenarien übersetzt sich der Durchsatz in Token pro Sekunde direkt in die wahrgenommene Reaktionsfähigkeit. Der Wert von 670 Token pro Sekunde ist etwa doppelt so hoch wie die für Googles Gemini 3.5 Flash-Lite gemeldeten 386 Token pro Sekunde und halbiert die Zeit für eine Standardaufgabe im Intelligence Index auf etwa eine halbe Minute. Im Gegensatz dazu benötigt Qwen 3.6 35B A3B 3,5 Minuten und Gemma 4 31B 5,8 Minuten für dieselbe Aufgabe.
Diese Lücke ist entscheidend für jeden Dienst, der viele gleichzeitige Anfragen verarbeiten muss. Ein Server, der auf derselben Hardware doppelt so viele Token verarbeitet, kann entweder die Kosten senken oder die Kapazität verdoppeln – ein klarer Vorteil für Cloud-Anbieter und Unternehmen.
Wie das Modell diese Werte erreicht
Die hybride Architektur von Nemotron 3.5 Lightning kombiniert die Stärken der Transformer bei der Mustererkennung über lange Distanzen mit der Effizienz der Mamba-State-Space-Blöcke. Das Design hält die Gesamtzahl der Parameter hoch – 31,6 Milliarden –, um die Modellierungskapazität zu bewahren, aber es sind nur 3,6 Milliarden für ein gegebenes Token aktiv. Die spärliche Aktivierung (Sparse Activation) reduziert die Rechenlast pro Token und erhöht so den Durchsatz, ohne die Qualität proportional zu beeinträchtigen.
Artificial Analysis maß einen Intelligence-Index-Score von 24 für Lightning, einen Sprung um neun Punkte gegenüber dem Wert von 15 des früheren Nano-Modells. Damit liegt es auf Augenhöhe mit OpenAI’s gpt-oss-120b, obwohl Lightning nur etwa ein Viertel der Parameter verwendet. Es liegt zwar immer noch hinter den Top-Modellen zurück – Meta’s Muse Glimmer (35) und Qwen 3.6 35B A3B (32) –, aber sein Intelligenz-zu-Parameter-Verhältnis gehört zu den besten.
Agentische Benchmarks zeichnen ein ähnliches Bild
Agentische Workloads – Planung, Werkzeugnutzung, mehrstufiges Denken – sind die Bereiche, in denen Lightning glänzt. Im GDPval-AA v2 Benchmark erreichte das Modell eine Elo-Bewertung von 824 und übertraf damit das 120-Milliarden-Parameter-Modell gpt-oss-120b (800) sowie Nvidias eigenes, größeres Nemotron 3 Super (698). Im Terminal-Bench v2.1 Test stieg die Erfolgsrate von Lightning von 7 % auf 24,3 % und kam damit nah an die von gpt-oss-120b verzeichneten 26,2 % heran.
Nvidia schreibt die Feinabstimmung des Modells auf domänenspezifische Aufgaben Post-Training-Kooperationen mit Partnern wie CodeRabbit und Harvey zu. Diese Verfeinerungen halten das Modell schnell und gleichzeitig wettbewerbsfähig bei spezialisierten Workloads.
Verfügbarkeit und praktische Überlegungen
Das Modell wird unter der permissiven OpenMDW-1.1-Lizenz veröffentlicht, mit Gewichten in den Formaten BF16 und NVFP4. Die NVFP4-Variante komprimiert das Modell stärker bei minimalem Qualitätsverlust – eine nützliche Option für Edge-Deployments oder kostensensible Cloud-Instanzen. Ein Kontextfenster von einer Million Token ermöglicht es dem Modell, sehr lange Prompts ohne Kürzung zu verarbeiten, was für Analysen auf Dokumentenebene oder umfangreiche Codebasen wertvoll ist.
Serverlose Inferenz ist bereits bei Anbietern wie DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius und Crusoe verfügbar. Entwickler können mit dem Experimentieren beginnen, ohne eine eigene Infrastruktur aufbauen zu müssen, wobei die tatsächliche Kosteneffizienz von der Preisgestaltung der jeweiligen Plattform abhängen wird.
Fazit: Nemotron 3.5 Lightning beweist, dass ein Modell das Argumentationsniveau von 120-Milliarden-Parameter-Systemen erreichen kann, während es fast den doppelten Token-Durchsatz der führenden Konkurrenten liefert, was es zu einem starken Kandidaten für latenzsensitive KI-Agenten macht.
