Nvidia એ 11 ઓગસ્ટના રોજ Nemotron 3.5 Lightning લોન્ચ કર્યું. આ 30-બિલિયન-પેરામીટર ધરાવતું mixture-of-experts મોડેલ માત્ર 3 બિલિયન એક્ટિવ પેરામીટર્સ સાથે ચાલે છે, અને તેની સાથી NeMo Switchyard routing library એ ઇન્ફરન્સ ખર્ચ અને કેશ કાર્યક્ષમતા (cache efficiency) અંગે પહેલેથી જ ચર્ચા જગાવી દીધી છે. Switchyard જે રીતે મોડેલ્સ વચ્ચે વિનંતીઓ (requests) મોકલે છે, તેનાથી પ્રોમ્પ્ટ કેશ (prompt caches) નકામી થઈ શકે છે અને સંભવિત રીતે એક સિંગલ ઇન્ફરન્સ સેશનનું બિલ બમણું થઈ શકે છે.

ઓપન-વેઇટ એજન્ટ્સ માટે બનાવેલું મોડેલ

Nemotron 3.5 Lightning એવા AI એજન્ટ્સને લક્ષ્ય બનાવે છે જે ટૂલ્સનો ઉપયોગ કરે છે, પરિણામોને ચકાસે છે અને રીઝનિંગ ટ્રેસ (reasoning trace) જાળવી રાખે છે. ત્રણ ટેકનિકલ પસંદગીઓ તેને અલગ પાડે છે:

  • Hybrid architecture – તે Mamba-2 state-space કોરને પરંપરાગત Transformer સાથે જોડે છે, જે સાબિત કરે છે કે non-Transformer ડિઝાઇન પણ આ સ્કેલ પર સ્પર્ધા કરી શકે છે.
  • 4-bit floating-point quantization – લો-પ્રિસિઝન (low-precision) માં ઉપલબ્ધ હોવાને કારણે, આ 30 B મોડેલ M5 Max MacBook Pro પર સેકન્ડ દીઠ અંદાજે 100 ટોકન્સ જનરેટ કરી શકે છે, જે સ્પીડ મેળવવામાં ફૂલ-પ્રિસિઝન મોડેલ સંઘર્ષ કરી શકે છે.
  • Full openness – Nvidia એ વેઇટ ફાઇલો અને સંપૂર્ણ ટ્રેનિંગ રેસીપી (training recipe) જાહેર કરી છે, જે હાઇ-પરફોર્મન્સ ઇન્ફરન્સ માટેના મોડેલ માટે દુર્લભ છે.

શરૂઆતના વપરાશકર્તાઓ કહે છે કે આ મોડેલ "ઓવર-થિંક" (વધારે પડતું વિચારવું) કરી શકે છે, જેનાથી લાંબી રીઝનિંગ ચેઇન્સ બહાર આવે છે જે ક્યારેક ભૂલ કરી શકે છે. ડેવલપર્સને એક શક્તિશાળી, ઓપનલી ઉપલબ્ધ એજન્ટ એક્ઝિક્યુટર મળે છે, પરંતુ બિનજરૂરી લાંબા લખાણ (verbosity) થી બચવા માટે તેમને સાવચેતીપૂર્વક પ્રોમ્પ્ટ આપવા પડશે.

રાઉટિંગ લેયર શા માટે મહત્વનું છે

NeMo Switchyard એ ઉપલબ્ધ મોડેલ્સના સમૂહમાંથી વિનંતીને "શ્રેષ્ઠ" મોડેલ પર ડાયનેમિકલી રાઉટ કરવા માટેની Nvidia ની લાઇબ્રેરી છે. સૈદ્ધાંતિક રીતે, એક રાઉટર દરેક ક્વેરી માટે સ્પેશિયાલિસ્ટ મોડેલ પસંદ કરીને જવાબની ગુણવત્તા વધારી શકે છે. વ્યવહારમાં, રાઉટિંગ નિર્ણય એ પ્રોમ્પ્ટ-કેશિંગ મિકેનિઝમ્સ સાથે ટકરાય છે જેના પર ઘણા ઇન્ફરન્સ પાઇપલાઇન્સ આધાર રાખે છે.

  • Prompt caches પ્રારંભિક પ્રોમ્પ્ટના ટોકન એમ્બેડિંગ્સ (token embeddings) સ્ટોર કરે છે જેથી પછીના જનરેશનમાં "prefill" સ્ટેપ ફરીથી ગણ્યા વગર તેનો ઉપયોગ કરી શકાય.
  • Routing swaps પ્રથમ થોડા ટોકન્સ પછી વિનંતીને મોડેલ A થી મોડેલ B પર લઈ જાય છે, જેનાથી સિસ્ટમને કેશ કરેલા પ્રોમ્પ્ટને ફેંકી દેવા અને નવા મોડેલ માટે તેને ફરીથી શૂન્યથી ગણવા માટે મજબૂર કરવામાં આવે છે.

મોટાભાગનો AI ખર્ચ નવા ટોકન્સ જનરેટ કરવાને બદલે કેશ કરેલા પ્રોમ્પ્ટને વાંચવામાં જાય છે, તેથી એક સિંગલ રાઉટિંગ હોપ (routing hop) અસરકારક રીતે વિનંતીનો ખર્ચ બમણો કરી શકે છે.

ખર્ચની ખેંચતાણ

ભવિષ્યમાં શું છે

આ ચર્ચા ત્યારે આવી છે જ્યારે Nvidia ની ઓપન-વેઇટ વ્યૂહરચના સીધી સ્પર્ધાનો સામનો કરી રહી છે. 15 ઓગસ્ટના રોજ, Qwen 3.8-27B લોન્ચ થશે, અને શરૂઆતના બેન્ચમાર્ક સૂચવે છે કે તે લોકલ ડેવલપમેન્ટ સિનારિયોમાં Nemotron 3.5 Lightning સામે ટકી શકે છે.

Nvidia ની પેટર્ન—ઓપન વેઇટ્સ, ઓપન ટ્રેનિંગ રેસીપી અને ઓપન રાઉટિંગ લેયર—તેના GPUs ને સ્થાનિક રીતે આ મોડેલ્સ ચલાવનાર કોઈપણ માટે ડિફોલ્ટ હાર્ડવેર બનાવવા માટે ડિઝાઇન કરવામાં આવી હોય તેવું લાગે છે. સોફ્ટવેર સ્ટેકને ખુલ્લો મૂકીને, Nvidia ડેવલપર્સને તેના ઇકોસિસ્ટમમાં બાંધવા માંગે છે, ભલે રાઉટિંગ લોજિક છુપા ખર્ચના દંડ (cost penalties) ઉમેરતું હોય.

સારાંશ

જો તમે તમારા પોતાના મશીન પર Nemotron 3.5 Lightning ચલાવવાનું આયોજન કરી રહ્યા હોવ, તો માત્ર "તે કેટલી ઝડપથી જનરેટ કરી શકે છે?" એટલું જ નહીં, પણ "Switchyard મને કેટલી વાર મારો પ્રોમ્પ્ટ કેશ ફેંકી દેવા માટે મજબૂર કરશે?" તે પણ પૂછો. તે જવાબ નક્કી કરશે કે મોડેલનું ઓપન-વેઇટ વચન વાસ્તવિક બચત બનશે કે મોંઘો પ્રયોગ. જેમ જેમ Qwen જેવા વિકલ્પો દેખાય છે, તેમ રાઉટિંગ ફ્લેક્સિબિલિટી અને કેશ-ડ્રિવન ખર્ચ કાર્યક્ષમતા વચ્ચેનું સંતુલન નક્કી કરશે કે કયું ટૂલકિટ—અને અંતે કયું હાર્ડવેર પ્લેટફોર્મ—જીતે છે.