Nemotron 3 Nano 30B A3B, pendahulunya, sudah diposisikan sebagai alternatif ringkas untuk model fondasi yang lebih besar. Dengan beralih ke arsitektur hybrid Mamba-Transformer dan hanya mengaktifkan 3,6 miliar parameter pada satu waktu, Lightning mendorong batas efisiensi sambil tetap memberikan kemampuan penalaran yang sebanding dengan model yang jauh lebih besar.
Mengapa kecepatan menjadi penting sekarang
Agen AI sedang beralih dari inferensi gaya batch ke interaksi berkelanjutan. Chatbot yang berhenti selama beberapa detik terasa lamban; alat pelengkapan kode yang tertinggal dari ketikan pengembang akan mengganggu alur kerja. Dalam pengaturan tersebut, throughput token-per-detik secara langsung diterjemahkan menjadi responsivitas yang dirasakan. Angka 670 token-per-detik kira-kira dua kali lipat dari 386 token per detik yang dilaporkan untuk Google Gemini 3.5 Flash-Lite, dan ini memangkas waktu untuk menyelesaikan tugas Intelligence Index standar menjadi sekitar setengah menit. Sebaliknya, Qwen 3.6 35B A3B membutuhkan 3,5 menit dan Gemma 4 31B membutuhkan 5,8 menit untuk tugas yang sama.
Kesenjangan tersebut sangat penting bagi layanan apa pun yang harus menangani banyak permintaan secara bersamaan. Server yang memproses dua kali lebih banyak token pada perangkat keras yang sama dapat menurunkan biaya atau menggandakan kapasitas, sebuah keuntungan nyata bagi penyedia cloud dan perusahaan.
Bagaimana model ini mencapai angka-angkanya
Arsitektur hybrid Nemotron 3.5 Lightning memadukan kekuatan pengenalan pola jarak jauh dari Transformer dengan efisiensi state-space dari blok Mamba. Desain ini menjaga jumlah total parameter tetap tinggi—31,6 miliar—untuk mempertahankan kapasitas pemodelan, tetapi hanya 3,6 miliar yang aktif untuk token tertentu. Aktivasi sparse mengurangi komputasi per token, meningkatkan throughput tanpa kehilangan kualitas secara proporsional.
Artificial Analysis mengukur skor Intelligence Index sebesar 24 untuk Lightning, lonjakan sembilan poin dari skor 15 yang diraih oleh model Nano sebelumnya. Hal ini menempatkannya setara dengan gpt-oss-120b milik OpenAI, meskipun Lightning hanya menggunakan sekitar seperempat dari jumlah parameternya. Model ini masih tertinggal dari model-model papan atas—Muse Glimmer (35) milik Meta dan Qwen 3.6 35B A3B (32)—tetapi rasio kecerdasan-terhadap-parameter-nya termasuk yang terbaik.
Benchmark agentic menceritakan kisah yang serupa
Beban kerja agentic—perencanaan, penggunaan alat, penalaran multi-langkah—adalah bidang di mana Lightning unggul. Pada benchmark GDPval-AA v2, model ini meraih rating Elo sebesar 824, melampaui gpt-oss-120b yang memiliki 120 miliar parameter (800) dan Nemotron 3 Super milik Nvidia yang lebih besar (698). Dalam pengujian Terminal-Bench v2.1, tingkat keberhasilan Lightning naik dari 7% menjadi 24,3%, mendekati angka 26,2% yang dicatat oleh gpt-oss-120b.
Nvidia mengatribusikan hal ini pada kolaborasi pasca-pelatihan dengan mitra seperti CodeRabbit dan Harvey untuk menyetel model pada tugas-tugas spesifik domain. Penyempurnaan tersebut menjaga model tetap cepat sambil tetap kompetitif pada beban kerja khusus.
Ketersediaan dan pertimbangan praktis
Model ini dirilis di bawah lisensi OpenMDW-1.1 yang permisif, dengan bobot dalam format BF16 dan NVFP4. Varian NVFP4 mengemas model secara lebih padat dengan kehilangan kualitas minimal, sebuah opsi yang berguna untuk deployment edge atau instance cloud yang hemat biaya. Jendela konteks satu juta token memungkinkan model menangani prompt yang sangat panjang tanpa pemotongan, yang sangat berharga untuk analisis tingkat dokumen atau basis kode yang luas.
Inferensi serverless sudah tersedia pada penyedia seperti DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius, dan Crusoe. Pengembang dapat mulai bereksperimen tanpa harus membangun infrastruktur khusus, meskipun efektivitas biaya yang sebenarnya akan bergantung pada harga masing-masing platform.
Kesimpulan: Nemotron 3.5 Lightning membuktikan bahwa sebuah model dapat menandingi tingkat penalaran sistem 120 miliar parameter sambil memberikan throughput token hampir dua kali lipat dari pesaing terkemuka, menjadikannya kandidat kuat untuk agen AI yang sensitif terhadap latensi.
