Nvidia ने ११ ऑगस्ट रोजी Nemotron 3.5 Lightning लाँच केले. ३०-बिलियन-पॅरामीटर असलेले हे mixture-of-experts मॉडेल केवळ ३ बिलियन सक्रिय पॅरामीटर्ससह चालते, आणि त्याचा सोबती असलेला NeMo Switchyard routing library ने इन्फरन्स खर्च (inference costs) आणि कॅशे कार्यक्षमतेवर (cache efficiency) आधीच वाद निर्माण केला आहे. Switchyard ज्या प्रकारे मॉडेल्समध्ये विनंत्या (requests) पाठवते, त्यामुळे प्रॉम्प्ट कॅशे (prompt caches) नष्ट होऊ शकतात आणि एका सिंगल इन्फरन्स सेशनसाठी बिल संभाव्यतः दुप्पट होऊ शकते.

ओपन-वेट एजंट्ससाठी बनवलेले मॉडेल

Nemotron 3.5 Lightning हे अशा AI एजंट्ससाठी आहे जे टूल्स वापरतात, निकालांची पडताळणी करतात आणि रिझनिंग ट्रेस (reasoning trace) ठेवतात. तीन तांत्रिक निवडींमुळे हे मॉडेल वेगळे ठरते:

  • हायब्रिड आर्किटेक्चर (Hybrid architecture) – हे Mamba-2 state-space कोअरला पारंपारिक Transformer सोबत जोडते, ज्यामुळे हे सिद्ध होते की नॉन-Transformer डिझाइन्स देखील या स्तरावर स्पर्धा करू शकतात.
  • 4-bit फ्लोटिंग-पॉइंट क्वांटायझेशन (4-bit floating-point quantization) – लो-प्रिसिजनमध्ये उपलब्ध असल्यामुळे, हे 30 B मॉडेल M5 Max MacBook Pro वर साधारणपणे प्रति सेकंद १०० टोकन्स तयार करू शकते, जी गती फुल-प्रिसिजन मॉडेलला मिळवणे कठीण जाईल.
  • पूर्ण मोकळेपणा (Full openness) – Nvidia ने वेट फाइल्स आणि संपूर्ण ट्रेनिंग रेसिपी प्रसिद्ध केली आहे, जे हाय-परफॉर्मन्स इन्फरन्ससाठी बनवलेल्या मॉडेलच्या बाबतीत दुर्मिळ आहे.

सुरुवातीच्या वापरकर्त्यांच्या मते, हे मॉडेल "अतिविचार" (over-think) करू शकते, ज्यामुळे कधीकधी चुकीचे लांब रिझनिंग चेन्स (reasoning chains) तयार होतात. डेव्हलपर्सना एक शक्तिशाली आणि मुक्तपणे उपलब्ध असलेला एजंट एक्झिक्युटर मिळतो, परंतु अनावश्यक शब्दांचा वापर टाळण्यासाठी त्यांना काळजीपूर्वक प्रॉम्प्ट द्यावे लागतील.

राउटिंग लेयर का महत्त्वाचा आहे

NeMo Switchyard ही उपलब्ध पर्यायांपैकी विनंती "सर्वोत्तम" मॉडेलकडे डायनॅमिकली पाठवण्यासाठी Nvidia ने तयार केलेली लायब्ररी आहे. सिद्धांतानुसार, प्रत्येक क्वेरीसाठी स्पेशलिस्ट मॉडेल निवडून राउटर उत्तराचा दर्जा सुधारू शकतो. परंतु प्रत्यक्षात, राउटिंगचा निर्णय प्रॉम्प्ट-कॅशिंग मेकॅनिझमशी (prompt-caching mechanisms) संघर्ष करतो, ज्यावर अनेक इन्फरन्स पाइपलाईन्स अवलंबून असतात.

  • प्रॉम्प्ट कॅशे (Prompt caches) सुरुवातीच्या प्रॉम्प्टचे टोकन एम्बेडिंग्स (token embeddings) साठवून ठेवतात, जेणेकरून नंतरच्या जनरेशनमध्ये "prefill" स्टेप पुन्हा न करता त्यांचा वापर करता येईल.
  • राउटिंग स्वॅप्स (Routing swaps) पहिल्या काही टोकन्सनंतर विनंती मॉडेल A कडून मॉडेल B कडे वळवतात, ज्यामुळे सिस्टमला कॅश केलेला प्रॉम्प्ट फेकून द्यावा लागतो आणि नवीन मॉडेलसाठी तो शून्यापासून पुन्हा तयार करावा लागतो.

बहुतेक AI खर्च नवीन टोकन्स तयार करण्याऐवजी कॅश केलेला प्रॉम्प्ट वाचण्यात जातो, त्यामुळे राउटिंगचा एक सिंगल 'हॉप' (hop) विनंतीचा खर्च प्रभावीपणे दुप्पट करू शकतो.

खर्चाची चढाओढ

भविष्यात काय आहे

Nvidia ची ओपन-वेट स्ट्रॅटेजी थेट स्पर्धेच्या समोर असताना हा वाद निर्माण झाला आहे. १५ ऑगस्ट रोजी Qwen 3.8-27B लाँच होणार आहे आणि सुरुवातीच्या बेंचमार्क असे सूचित करतात की ते स्थानिक डेव्हलपमेंट सिनेरिओमध्ये Nemotron 3.5 Lightning ला टक्कर देऊ शकते.

Nvidia ची पद्धत—ओपन वेट्स, ओपन ट्रेनिंग रेसिपी आणि ओपन राउटिंग लेयर—याचा उद्देश त्यांचे GPUs हे स्थानिक पातळीवर मॉडेल्स चालवणाऱ्यांसाठी डीफॉल्ट हार्डवेअर बनवणे असा दिसतो. सॉफ्टवेअर स्टॅक उघड करून, Nvidia डेव्हलपर्सना त्यांच्या इकोसिस्टममध्ये बांधून ठेवण्याची आशा करते, जरी राउटिंग लॉजिकमुळे छुपे खर्च वाढले तरीही.

निष्कर्ष

जर तुम्ही तुमच्या स्वतःच्या मशीनवर Nemotron 3.5 Lightning चालवण्याचा विचार करत असाल, तर केवळ "ते किती वेगाने जनरेट करू शकते?" असेच विचारू नका, तर "Switchyard मला किती वेळा माझा प्रॉम्प्ट कॅशे फेकून देण्यास भाग पाडेल?" असाही प्रश्न विचारा. या उत्तरावरून हे ठरवले जाईल की या मॉडेलचे ओपन-वेट वचन वास्तववादी बचत ठरेल की एक महागडा प्रयोग. Qwen सारखे पर्याय उपलब्ध होत असताना, राउटिंग लवचिकता आणि कॅशे-आधारित खर्च कार्यक्षमता यांच्यातील संतुलन कोणता टूलकिट—आणि शेवटी कोणता हार्डवेअर प्लॅटफॉर्म—जिंकेल हे ठरवेल.