Nvidia ilizindua Nemotron 3.5 Lightning mnamo Agosti 11. Mtindo huu wa mixture-of-experts wenye vigezo bilioni 30 unafanya kazi kwa kutumia vigezo hai bilioni 3 pekee, na maktaba yake ya uelekezaji ya NeMo Switchyard tayari imezua mjadala kuhusu gharama za inference na ufanisi wa kashimenti. Jinsi Switchyard inavyohamisha maombi kati ya mitindo inaweza kuharibu kashimenti za maelekezo (prompt caches) na huenda ikadubua bili kwa kikao kimoja cha inference.
Mtindo ulioundwa kwa ajili ya mawakala wa open-weight
Nemotron 3.5 Lightning inalenga mawakala wa AI wanaotumia zana, kuhakiki matokeo, na kuhifadhi kumbukumbu ya mantiki (reasoning trace). Chaguzi tatu za kiufundi zinauweka tofauti:
- Muundo mseto (Hybrid architecture) – Inachanganya kiini cha Mamba-2 state-space na Transformer ya kawaida, ikithibitisha kuwa miundo isiyo ya Transformer inaweza kushindana katika kiwango hiki.
- 4-bit floating-point quantization – Kutumia usahihi mdogo (low-precision) kunaruhusu mtindo wa 30 B kuzalisha takriban token 100 kwa sekunde kwenye M5 Max MacBook Pro, kasi ambayo mtindo wa usahihi kamili (full-precision) ingeshindwa kuifikia.
- Ufunguaji kamili (Full openness) – Nvidia ilitoa faili za uzito (weight files) na fomula kamili ya mafunzo, jambo ambalo ni nadra kwa mtindo unaolenga inference ya hali ya juu.
Watumiaji wa awali wanasema mtindo unaweza "kufikiria kupita kiasi," ukitoa mnyororo mrefu wa mantiki ambao wakati mwingine unakosea. Watengenezaji wanapata mtendaji wa wakala (agent executor) mwenye nguvu na unaopatikana wazi, lakini lazima watumie maelekezo (prompt) kwa uangalifu ili kuepuka maneno mengi yasiyo na lazima.
Kwa nini tabaka la uelekezaji (routing layer) ni muhimu
NeMo Switchyard ni maktaba ya Nvidia kwa ajili ya kuelekeza ombi kwa njia ya kidinamiki kwenda kwenye mtindo "bora" kati ya machaguo yanayopatikana. Kinadharia, kielekezi (router) kinaweza kuongeza ubora wa jibu kwa kuchagua mtindo mtaalamu kwa kila hoja. Kiutendaji, uamuzi wa uelekezaji unakinzana na mifumo ya kashimenti ya maelekezo (prompt-caching) ambayo mifumo mingi ya inference inategemea.
- Prompt caches huhifadhi token embeddings za maelekezo ya awali ili vizalisho vya baadaye viweze kuzitumia tena bila kuhitaji kukokotoa tena hatua ya "prefill".
- Routing swaps huhamisha ombi kutoka Model A kwenda Model B baada ya token chache za kwanza, ikilazimisha mfumo kutupa maelekezo yaliyohifadhiwa na kuyakokotoa upya tangu mwanzo kwa ajili ya mtindo mpya.
Kwa kuwa gharama nyingi za AI hutumika kusoma maelekezo yaliyohifadhiwa badala ya kuzalisha token mpya, hatua moja ya uelekezaji inaweza kuongeza gharama ya ombi mara mbili.
Vita vya gharama
Nini kiko upeoni
Mjadala huu unakuja wakati mkakati wa Nvidia wa open-weight unapokutana na ushindani wa moja kwa moja. Mnamo Agosti 15, Qwen 3.8-27B itazinduliwa, na vipimo vya awali vinaonyesha kuwa inaweza kushindana na Nemotron 3.5 Lightning katika mazingira ya maendeleo ya ndani (local development).
Mtindo wa Nvidia—open weights, fomula za mafunzo wazi, na tabaka la uelekezaji wazi—unaonekana kusanifiwa ili kufanya GPUs zake kuwa vifaa vya msingi kwa yeyote anayeweka mitindo hii ndani ya mashine yake. Kwa kuweka wazi mfumo wa programu (software stack), Nvidia inatumai kuwafunga watengenezaji kwenye mfumo wake (ecosystem), hata kama mantiki ya uelekezaji inaongeza gharama zilizofichika.
Hitimisho
Ikiwa unapanga kuendesha Nemotron 3.5 Lightning kwenye mashine yako mwenyewe, usiulize tu "inaweza kuzalisha kwa kasi gani?" bali pia "Switchyard itanilazimisha mara ngapi kutupa kashimenti yangu ya maelekezo?" Jibu hilo litapanga ikiwa ahadi ya open-weight ya mtindo huu itakuwa akiba ya kweli au jaribio la gharama kubwa. Kadiri mbadala kama Qwen zinavyojitokeza, uwiano kati ya unyumbufu wa uelekezaji na ufanisi wa gharama unaotokana na kashimenti utaamua ni seti gani ya zana—na hatimaye jukwaa gani la vifaa—litakaloingia kileleni.
