Alibaba चे Qwen2.5-Max आणि DeepSeek चे V3-Flash या आठवड्यात बाजारात आले आहेत, जे स्वस्त AI inference साठी वेगवेगळे मार्ग अवलंबत आहेत. Alibaba त्याच्या 2.4 trillion-parameter mixture-of-experts (MoE) डिझाइनसह प्रत्येक क्वेरीसाठी फक्त सुमारे 95 billion parameters सक्रिय करते; DeepSeek प्रति टोकन किंमत कमी करण्यासाठी आर्किटेक्चरमध्ये कपात करते. AI मधील ही स्पर्धा आता केवळ मॉडेलच्या आकारावर नाही, तर प्रति टोकन डॉलरवर मोजली जात आहे.
“जास्त पॅरामीटर्स” कडून “कमी खर्च” कडे
अनेक वर्षे large-language-model (LLM) विकासातील मुख्य निकष पॅरामीटरची संख्या हा होता. OpenAI, Google आणि इतरांनी trillion-parameter मर्यादा ओलांडल्याचा अभिमान व्यक्त केला, कारण त्यांना असे वाटत होते की आकार मोठा म्हणजे बुद्धिमत्ता जास्त. मात्र, Alibaba आणि DeepSeek ने हे दाखवून दिले आहे की आता ही गणिती पद्धत बदलली आहे.
Alibaba चे Qwen2.5-Max अजूनही स्केलवर अवलंबून आहे, परंतु त्यात खर्च वाचवण्याची एक युक्ती जोडली आहे. एका dense model मध्ये प्रत्येक inference साठी प्रत्येक पॅरामीटर कार्यान्वित होतो, ज्यामुळे 2.4 trillion-parameter नेटवर्क हे प्रचंड ऊर्जा वापरणारे यंत्र बनते. MoE या नेटवर्कला अनेक “experts” मध्ये विभागते आणि प्रत्येक विनंती (request) एका उपसमूहाकडे (subset) वळवते. Qwen2.5-Max चा राउटर कोणत्याही प्रॉम्प्टसाठी अंदाजे 95 billion parameters निवडतो, ज्यामुळे लेटन्सी (latency) आणि ऊर्जा नियंत्रित ठेवून trillion-parameter सिस्टमची तर्कशक्ती (reasoning power) मिळते.
DeepSeek ने trillion-parameter ची महत्त्वाकांक्षा पूर्णपणे सोडून दिली आहे. त्याचे V3-Flash मॉडेल स्वस्त, जलद आणि मोठ्या प्रमाणावर चालण्यासाठी बनवले आहे. कंपनी हे मॉडेल “ultra-low inference pricing” च्या माध्यमातून विकत आहे, ज्याचा लक्ष्य डेव्हलपर्स आहेत जे दररोज लाखो टोकन्सवर प्रक्रिया करतात आणि खर्च कमी ठेवू इच्छितात. नेमकी किंमत जाहीर केलेली नाही, परंतु संदेश स्पष्ट आहे: जर एखादे स्टार्टअप पाश्चात्य प्रति-टोकन दरा परवडत नसेल, तर V3-Flash हा एक व्यवहार्य पर्याय ठरेल.
Inference खर्च स्पर्धात्मक फायदा का बनत आहे
जेव्हा मॉडेल्स प्रयोगशाळेतून बाहेर पडून प्रत्यक्ष वापरासाठी (production) येतात, तेव्हा inference खर्च महत्त्वाचा ठरतो. जे उद्योग LLMs चा वापर चॅटबॉट्स, दस्तऐवज-विश्लेषण (document-analysis) पाइपलाइन किंवा शिफारस इंजिनमध्ये (recommendation engines) करतात, त्यांना लवकरच समजते की टोकन-स्तरीय किंमत त्यांच्या ऑपरेटिंग खर्चावर वर्चस्व गाजवते. प्रति टोकन अर्धा खर्च येणारे मॉडेल इतर उपक्रमांसाठी—अधिक डेटा, जास्त ट्रॅफिक किंवा अतिरिक्त फीचर्ससाठी—बजेट दुप्पट करू शकते.
या दोन चिनी कंपन्या वेगवेगळ्या बाजारपेठांना लक्ष्य करत आहेत. Alibaba चे MoE जटिल आणि तर्कशक्तीवर आधारित कामांसाठी उच्च कामगिरीचे आश्वासन देते, तसेच प्रति-विनंती (per-request) कॉम्प्युट बजेटही मर्यादित ठेवते. दुसरीकडे, DeepSeek चे अधिक सुटसुटीत (leaner) मॉडेल अशा कामांसाठी उपयुक्त आहे जिथे मोठ्या प्रमाणावर डेटा आणि कमी लेटन्सीची गरज असते, आणि जिथे कच्च्या ताकदीपेक्षा (raw horsepower) अंदाजित खर्च अधिक महत्त्वाचा असतो.
या दोन्ही रणनीती पाश्चात्य पुरवठादारांना (Western providers) आव्हान देऊ शकतात, जे मोठ्या मॉडेल्सना प्रीमियम किमतीसह विकतात. जर डेव्हलपर्सना स्वस्त टोकन किमतीत तशाच प्रकारचे परिणाम मिळत असतील, तर महागड्या APIs सोबत राहण्याची प्रेरणा कमी होईल.
जागतिक AI इकोसिस्टमसाठीचे महत्त्व
- Startups आणि SMEs: कमी inference खर्चामुळे AI-आधारित उत्पादनांसाठीचा अडथळा कमी होतो. ज्या टीम्सना पूर्वी API बिलांसाठी अतिरिक्त भांडवलाची गरज होती, त्या आता कमी बजेटमध्ये प्रोटोटाइप तयार करू शकतात आणि लाँच करू शकतात.
- Enterprises: अंतर्गत AI सेवा चालवणारे मोठे कॉर्पोरेट्स आपला ऑपरेटिंग खर्च कमी करू शकतात, ज्यामुळे डेटा संपादन, मॉडेल फाईन-ट्यूनिंग किंवा अतिरिक्त कॉम्प्युटसाठी निधी मोकळा होईल.
- Western Providers: त्यांचे महसूल मॉडेल प्रति-टोकन शुल्कावर अवलंबून आहे. खर्च-केंद्रित पर्यायांकडे होणाऱ्या या बदलामुळे त्यांना किमती कमी करण्यास किंवा अशा क्षमतांवर लक्ष केंद्रित करण्यास भाग पाडले जाईल ज्या स्वस्त मॉडेल्स अजून गाठू शकत नाहीत.
- Regulators आणि Policymakers: अधिक परवडणारे AI विविध क्षेत्रांमध्ये त्याचा अवलंब जलद करू शकते, ज्यामुळे देखरेख (oversight), डेटा गोपनीयता आणि ऑटोमेशनचा वेग याबद्दल प्रश्न निर्माण होऊ शकतात.
तडजोड आणि प्रतिवाद
Qwen2.5-Max सारखी MoE मॉडेल्स पूर्णपणे विनामूल्य किंवा सोपी नसतात. राउटिंग लॉजिकमुळे इंजिनिअरिंगची गुंतागुंत वाढते आणि sparse activation मुळे विविध प्रकारच्या क्वेरीमध्ये कामगिरी असमान असू शकते. जर राउटरने चुकीचा निर्णय घेतला, तर विनंती चुकीच्या experts कडे वळवली जाऊ शकते, ज्यामुळे आउटपुटची गुणवत्ता घसरू शकते. शिवाय, हार्डवेअर अजूनही dense compute ला प्राधान्य देते; MoE inference साठी विशेष अॅक्सिलरेटर्स अजूनही मोठ्या प्रमाणावर उपलब्ध नाहीत, ज्यामुळे वास्तविक जगातील कार्यक्षमता मर्यादित होऊ शकते.
DeepSeek च्या खर्च-प्रथम (cost-first) तत्त्वज्ञानामध्येही जोखीम आहे. आक्रमक किंमतींचा अर्थ अनेकदा मॉडेलचा आकार आणि ट्रेनिंग डेटावर कडक मर्यादा असा होतो, ज्यामुळे कामगिरीवर मर्यादा येऊ शकतात. ज्या उपयोगांसाठी सूक्ष्म तर्कशक्तीची (nuanced reasoning) आवश्यकता असते, तिथे स्वस्त मॉडेल अपुरे पडू शकते, ज्यामुळे वापरकर्ते पुन्हा मोठ्या आणि महागड्या पर्यायांकडे वळू शकतात.
शेवटी, “प्रति डॉलर बुद्धिमत्ता” हा स्पर्धेचा केवळ एक पैलू आहे. लेटन्सी, विश्वासार्हता, इकोसिस्टम सपोर्ट आणि प्रादेशिक नियमांचे पालन हे निर्णायक घटक राहतील. ज्या कंपन्या या सर्व आयामांमध्ये संतुलित पॅकेज देतील, त्या केवळ किंमत युद्ध जिंकणाऱ्या कंपन्यांपेक्षा अधिक वर्चस्व गाजवतील.
पुढे काय पाहावे
- बेंचमार्क रिलीज: Qwen2.5-Max ची MoE राउटिंग कार्यक्षमता आणि V3-Flash चा टोकन खर्च यांचे स्वतंत्र मूल्यमापन केल्यावर, सध्याची चर्चा खरोखर मोजता येण्याजोग्या बचतीमध्ये रूपांतरित होते की नाही, हे स्पष्ट होईल.
- हार्डवेअर विकास: स्पार्स ॲक्टिव्हेशनसाठी (sparse activation) ऑप्टिमाइझ केलेल्या अॅक्सिलरेटर्सचा वापर MoE चे फायदे वाढवू शकतो, तर सामान्य वापरासाठीचे GPUs डेन्स मॉडेल्सना (dense models) स्पर्धेत टिकवून ठेवू शकतात.
- किंमत प्रतिसाद: पाश्चात्य प्रदाते त्यांच्या टियर्समध्ये (tiers) बदल करू शकतात किंवा बॅच इन्फरन्स डिस्काउंट्स किंवा ऑन-प्रिमाइसेस लायसन्सिंग सारखी खर्च वाचवणारी वैशिष्ट्ये जोडू शकतात.
- नियामक पावले: स्वस्त AI चा प्रसार होत असताना, सरकारे पारदर्शकता आणि सुरक्षिततेसाठी अशी मानके लागू करू शकतात, ज्याचा परिणाम या मॉडेल्सच्या मोठ्या प्रमाणावरील उपयोजनावर (deployment) होऊ शकतो.
निष्कर्ष
Alibaba चे MoE-आधारित Qwen2.5-Max आणि DeepSeek चे कमी खर्चाचे V3-Flash हे दर्शवतात की, AI शर्यत आता केवळ पॅरामीटर संख्येवर नाही, तर बजेट स्प्रेडशीटवरही तितक्याच प्रमाणात अवलंबून आहे. ज्या कंपन्या प्रति-टोकन खर्च कमी ठेवून प्रगत भाषा क्षमता प्रदान करतील, त्या AI चा वापर वापरकर्त्यांच्या मोठ्या समूहापर्यंत पोहोचवतील, ज्यामुळे आतापर्यंत केवळ सर्वात मोठ्या आणि महागड्या मॉडेल्सना अनुकूल असलेल्या स्पर्धात्मक समीकरणांमध्ये बदल होईल.
