Nvidia melancarkan Nemotron 3.5 Lightning pada 11 Ogos. Model mixture-of-experts dengan 30 bilion parameter ini beroperasi dengan hanya 3 bilion parameter aktif, dan perpustakaan penghalaan (routing library) pasangannya, NeMo Switchyard, telah mencetuskan perdebatan mengenai kos inferens dan kecekapan cache. Cara Switchyard menghantar permintaan antara model boleh merosakkan cache prompt dan berpotensi menggandakan bil bagi satu sesi inferens.
Model yang dibina untuk ejen pemberat terbuka (open-weight agents)
Nemotron 3.5 Lightning menyasarkan ejen AI yang memanggil alatan, mengesahkan hasil, dan mengekalkan jejak penaakulan. Tiga pilihan teknikal membezakannya:
- Seni bina hibrid – Ia menggabungkan teras ruang-keadaan (state-space) Mamba-2 dengan Transformer konvensional, membuktikan bahawa reka bentuk bukan Transformer boleh bersaing pada skala ini.
- Kuantisasi titik apungan 4-bit – Penghantaran dalam ketepatan rendah membolehkan model 30 B menghasilkan kira-kira 100 token sesaat pada MacBook Pro M5 Max, satu kelajuan yang sukar ditandingi oleh model ketepatan penuh.
- Keterbukaan penuh – Nvidia telah mengeluarkan fail pemberat dan resipi latihan yang lengkap, sesuatu yang jarang berlaku bagi model yang disasarkan untuk inferens berprestasi tinggi.
Pengguna awal mengatakan model ini boleh "berfikir berlebihan" (over-think), mengeluarkan rantaian penaakulan yang panjang yang kadangkala tersilap. Pembangun mendapat pelaksana ejen yang berkuasa dan tersedia secara terbuka, tetapi mesti memberikan prompt dengan teliti untuk mengelakkan kelewah (verbosity) yang tidak perlu.
Mengapa lapisan penghalaan (routing layer) itu penting
NeMo Switchyard ialah perpustakaan Nvidia untuk menghalakan permintaan secara dinamik kepada model "terbaik" daripada sekumpulan calon. Secara teori, penghala boleh meningkatkan kualiti jawapan dengan memilih model pakar untuk setiap pertanyaan. Dalam praktiknya, keputusan penghalaan bercanggah dengan mekanisme cache-prompt yang menjadi sandaran banyak saluran paip (pipeline) inferens.
- Cache prompt menyimpan embedding token bagi prompt awal supaya penjanaan seterusnya boleh menggunakannya semula tanpa mengira semula langkah "prefill".
- Pertukaran penghalaan memindahkan permintaan daripada Model A ke Model B selepas beberapa token pertama, memaksa sistem membuang prompt yang telah di-cache dan mengiranya semula dari awal untuk model baharu.
Memandangkan sebahagian besar perbelanjaan AI digunakan untuk membaca prompt yang di-cache berbanding menjana token baharu, satu lompatan penghalaan boleh secara berkesan menggandakan kos sesuatu permintaan.
Tarik tali kos
Apa yang bakal menjelang
Perdebatan ini muncul ketika strategi pemberat terbuka Nvidia menghadapi persaingan langsung. Pada 15 Ogos, Qwen 3.8-27B akan dilancarkan, dan penanda aras awal menunjukkan ia mampu bersaing dengan Nemotron 3.5 Lightning dalam senario pembangunan tempatan.
Corak Nvidia—pemberat terbuka, resipi latihan terbuka, dan lapisan penghalaan terbuka—kelihatan direka untuk menjadikan GPU miliknya sebagai perkakasan lalai bagi sesiapa sahaja yang menjalankan model ini secara tempatan. Dengan mendedahkan timbunan perisian (software stack), Nvidia berharap dapat mengunci pembangun ke dalam ekosistemnya, walaupun logik penghalaan menambah penalti kos tersembunyi.
Kesimpulan
Jika anda merancang untuk menjalankan Nemotron 3.5 Lightning pada mesin anda sendiri, jangan hanya tanya "berapa cepat ia boleh menjana?", tetapi tanya juga "berapa kerap Switchyard akan memaksa saya membuang cache prompt saya?" Jawapan itu akan menentukan sama ada janji pemberat terbuka model tersebut menjadi penjimatan dunia nyata atau eksperimen yang mahal. Apabila alternatif seperti Qwen muncul, keseimbangan antara fleksibiliti penghalaan dan kecekapan kos berasaskan cache akan menentukan kit alatan mana—dan akhirnya platform perkakasan mana—yang akan menang.
