Nemotron 3 Nano 30B A3B, pendahulunya, sudah pun diposisikan sebagai alternatif kompak kepada model asas yang lebih besar. Dengan beralih kepada seni bina hibrid Mamba-Transformer dan hanya mengaktifkan 3.6 bilion parameter pada satu-satu masa, Lightning melonjakkan sempadan kecekapan sambil tetap memberikan kuasa penaakulan yang setanding dengan model yang jauh lebih besar.

Mengapa kelajuan penting sekarang

Ejen AI sedang beralih daripada inferens gaya berkelompok (batch-style) kepada interaksi berterusan. Chatbot yang terhenti selama beberapa saat terasa lembap; alat pelengkapan kod yang tertinggal daripada taipan pembangun mengganggu aliran kerja. Dalam tetapan tersebut, daya pemprosesan token sesaat diterjemahkan secara langsung kepada responsif yang dirasai. Angka 670 token sesaat adalah kira-kira dua kali ganda daripada 386 token sesaat yang dilaporkan untuk Google Gemini 3.5 Flash-Lite, dan ia memendekkan masa untuk menyelesaikan tugasan Indeks Kecerdasan (Intelligence Index) standard kepada kira-kira setengah minit. Sebaliknya, Qwen 3.6 35B A3B memerlukan 3.5 minit dan Gemma 4 31B memerlukan 5.8 minit untuk tugasan yang sama.

Jurang tersebut penting bagi mana-mana perkhidmatan yang mesti mengendalikan banyak permintaan serentak. Pelayan yang memproses dua kali ganda lebih banyak token pada perkakasan yang sama boleh sama ada mengurangkan kos atau menggandakan kapasiti, satu kelebihan jelas bagi penyedia awan dan perusahaan.

Bagaimana model ini mencapai angka tersebut

Seni bina hibrid Nemotron 3.5 Lightning menggabungkan kekuatan pengecaman corak jarak jauh Transformers dengan kecekapan ruang-keadaan (state-space) blok Mamba. Reka bentuk ini mengekalkan jumlah parameter yang tinggi—31.6 bilion—untuk mengekalkan kapasiti pemodelan, tetapi hanya 3.6 bilion yang aktif untuk mana-mana token yang diberikan. Pengaktifan jarang (sparse activation) mengurangkan pengiraan bagi setiap token, meningkatkan daya pemprosesan tanpa kehilangan kualiti yang berkadar terus.

Artificial Analysis mengukur skor Indeks Kecerdasan sebanyak 24 untuk Lightning, lonjakan sembilan mata daripada skor 15 yang dicapai oleh model Nano sebelum ini. Ini meletakkannya setaraf dengan gpt-oss-120b milik OpenAI, walaupun Lightning menggunakan kira-kira suku daripada jumlah parameter tersebut. Ia masih ketinggalan di belakang model teratas—Muse Glimmer (35) milik Meta dan Qwen 3.6 35B A3B (32)—tetapi nisbah kecerdasan-kepada-parameter miliknya antara yang terbaik.

Penanda aras ejenik menceritakan kisah yang sama

Beban kerja ejenik—perancangan, penggunaan alatan, penaakulan berbilang langkah—adalah bidang di mana Lightning menyerlah. Pada penanda aras GDPval-AA v2, model ini memperoleh penarafan Elo sebanyak 824, mengatasi gpt-oss-120b dengan 120 bilion parameter (800) dan Nemotron 3 Super milik Nvidia sendiri yang lebih besar (698). Dalam ujian Terminal-Bench v2.1, kadar kejayaan Lightning meningkat daripada 7 % kepada 24.3 %, menghampiri 26.2 % yang dicatatkan oleh gpt-oss-120b.

Nvidia menyifatkan kerjasama pasca-latihan dengan rakan kongsi seperti CodeRabbit dan Harvey sebagai faktor yang menala model tersebut untuk tugasan khusus domain. Penambahbaikan tersebut memastikan model kekal pantas sambil kekal kompetitif pada beban kerja khusus.

Ketersediaan dan pertimbangan praktikal

Model ini dikeluarkan di bawah lesen OpenMDW-1.1 yang permisif, dengan pemberat dalam format BF16 dan NVFP4. Varian NVFP4 memampatkan model dengan lebih padat dengan kehilangan kualiti yang minimum, satu pilihan berguna untuk penggunaan di pinggir (edge) atau instans awan yang mementingkan kos. Tetingkap konteks satu juta token membolehkan model mengendalikan prompt yang sangat panjang tanpa pemotongan, yang sangat berharga untuk analisis peringkat dokumen atau pangkalan kod yang luas.

Inferens tanpa pelayan (serverless) sudah tersedia pada penyedia seperti DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius dan Crusoe. Pembangun boleh mula bereksperimen tanpa membina infrastruktur tersuai, walaupun keberkesanan kos yang sebenar akan bergantung pada harga setiap platform.

Rumusan: Nemotron 3.5 Lightning membuktikan bahawa sesebuah model boleh menyamai tahap penaakulan sistem 120 bilion parameter sambil memberikan hampir dua kali ganda daya pemprosesan token berbanding pesaing utama, menjadikannya calon yang kuat untuk ejen AI yang sensitif terhadap kependaman (latency).