Öncülü olan Nemotron 3 Nano 30B A3B, halihazırda daha büyük temel modellere (foundation models) kompakt bir alternatif olarak konumlandırılmıştı. Lightning, hibrit bir Mamba-Transformer mimarisine geçerek ve herhangi bir anda yalnızca 3,6 milyar parametreyi etkinleştirerek, çok daha büyük modellerle kıyaslanabilir bir muhakeme gücü sunarken verimlilik sınırlarını zorluyor.

Hız şu an neden önemli

Yapay zeka ajanları, toplu işlem (batch-style) çıkarımından sürekli etkileşime geçiyor. Birkaç saniye duraksayan bir sohbet botu hantal hissettirir; bir yazılımcının yazım hızının gerisinde kalan bir kod tamamlama aracı ise iş akışını bozar. Bu ortamlarda, saniye başına token (token-per-second) verimliliği, doğrudan algılanan tepkisellik anlamına gelir. 670 token/saniye rakamı, Google'ın Gemini 3.5 Flash-Lite modeli için bildirilen 386 token/saniyenin yaklaşık iki katıdır ve standart bir Intelligence Index görevini tamamlamaya ayrılan süreyi yaklaşık yarım dakikaya indirir. Buna karşılık, Qwen 3.6 35B A3B aynı görev için 3,5 dakikaya, Gemma 4 31B ise 5,8 dakikaya ihtiyaç duyar.

Bu fark, aynı anda birçok isteği yönetmesi gereken her türlü hizmet için önemlidir. Aynı donanım üzerinde iki kat daha fazla token işleyen bir sunucu, maliyetleri düşürebilir veya kapasiteyi iki katına çıkarabilir; bu da bulut sağlayıcıları ve işletmeler için açık bir avantajdır.

Model bu rakamlara nasıl ulaşıyor

Nemotron 3.5 Lightning'in hibrit mimarisi, Transformer'ların uzun menzilli örüntü tanıma güçlerini Mamba bloklarının durum-uzayı (state-space) verimliliği ile harmanlıyor. Tasarım, modelleme kapasitesini korumak için toplam parametre sayısını yüksek (31,6 milyar) tutuyor ancak herhangi bir token için yalnızca 3,6 milyar parametre aktif hale geliyor. Seyrek aktivasyon (sparse activation), token başına hesaplama yükünü azaltarak kalitede orantısız bir kayba yol açmadan verimliliği artırıyor.

Artificial Analysis, Lightning için 24 puanlık bir Intelligence Index skoru ölçtü; bu, önceki Nano modelinin aldığı 15 puandan dokuz puanlık bir sıçrama anlamına geliyor. Bu durum, Lightning yaklaşık dörtte bir oranında parametre kullanmasına rağmen onu OpenAI'ın gpt-oss-120b modeliyle eş değer bir konuma getiriyor. Hala en iyi modellerin —Meta'nın Muse Glimmer (35) ve Qwen 3.6 35B A3B (32) modellerinin— gerisinde kalsa da, zeka-parametre oranı en iyiler arasında yer alıyor.

Ajan tabanlı kıyaslamalar da benzer bir tablo çiziyor

Planlama, araç kullanımı ve çok adımlı muhakeme gibi ajan tabanlı (agentic) iş yükleri, Lightning'in parladığı alanlardır. GDPval-AA v2 kıyaslamasında model, 824 Elo puanı alarak 120 milyar parametreli gpt-oss-120b'yi (800) ve Nvidia'nın kendi daha büyük modeli olan Nemotron 3 Super'i (698) geride bıraktı. Terminal-Bench v2.1 testinde ise Lightning'in başarı oranı %7'den %24,3'e yükselerek gpt-oss-120b tarafından kaydedilen %26,2'ye yaklaştı.

Nvidia, modelin alana özgü görevler için optimize edilmesini CodeRabbit ve Harvey gibi ortaklarla yapılan eğitim sonrası iş birliklerine borçlu olduğunu belirtti. Bu iyileştirmeler, modelin uzmanlaşmış iş yüklerinde rekabetçi kalmasını sağlarken hızını da koruyor.

Erişilebilirlik ve pratik hususlar

Model, BF16 ve NVFP4 formatlarındaki ağırlıklarla birlikte esnek OpenMDW-1.1 lisansı altında sunuluyor. NVFP4 varyantı, modeli minimum kalite kaybıyla daha sıkı bir şekilde paketleyerek uç cihaz (edge) dağıtımları veya maliyet odaklı bulut örnekleri için kullanışlı bir seçenek sunuyor. Bir milyon tokenlık bağlam penceresi (context window), modelin çok uzun istemleri (prompts) kesintiye uğratmadan işlemesine olanak tanıyor; bu da belge düzeyinde analiz veya kapsamlı kod tabanları için oldukça değerlidir.

Sunucusuz çıkarım (serverless inference); DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius ve Crusoe gibi sağlayıcılarda halihazırda çalışıyor. Geliştiriciler, özel bir altyapı kurmaya gerek kalmadan denemeler yapmaya başlayabilirler, ancak gerçek maliyet etkinliği her platformun kendi fiyatlandırmasına bağlı olacaktır.

Özet: Nemotron 3.5 Lightning, bir modelin 120 milyar parametreli sistemlerin muhakeme seviyesine ulaşabileceğini kanıtlarken, önde gelen rakiplerinden neredeyse iki kat daha fazla token verimliliği sunuyor; bu da onu gecikmeye duyarlı yapay zeka ajanları için güçlü bir aday yapıyor.