अनेक वर्षांपासून, टेक पॉलिसी वर्तुळात एक स्पष्ट धारणा होती: NVIDIA चिप्स नाहीत, तर प्रगत (frontier) AI नाही. H100 आणि नवीन Blackwell लाइन सारख्या हाय-एंड GPUs वरील निर्यातीवरील निर्बंध नेमके याच अडथळ्याभोवती (bottleneck) तयार करण्यात आले होते. सर्वोत्तम सिलिकॉनचा प्रवेश रोखला, तर सर्वात मोठे आणि सक्षम मॉडेल्स प्रशिक्षित करण्याची देशाची क्षमता मंदावेल, अशी एक थिअरी होती. Meituan ने आता या दाव्याला आव्हान दिले आहे.
फूड डिलिव्हरी आणि स्थानिक सेवांमध्ये वर्चस्व गाजवणाऱ्या प्रसिद्ध चिनी टेक दिग्गज कंपनीने LongCat 2.0 लाँच केले आहे. हे Mixture-of-Experts आर्किटेक्चरवर आधारित १.६ ट्रिलियन पॅरामीटर्सचे मॉडेल आहे. सर्वात महत्त्वाची गोष्ट म्हणजे? या टीमने हे मॉडेल पूर्णपणे चिनी देशांतर्गत चिप्सवर प्रशिक्षित केले आहे. यात कोणतेही NVIDIA H100 किंवा Blackwell GPUs वापरलेले नाहीत. आणि ते एखाद्या API च्या मागे लपवण्याऐवजी, Meituan ने त्याचे weights, ट्रेनिंग कोड आणि संपूर्ण डेटा पाइपलाइन GitHub वर सर्वांच्या तपासणीसाठी उपलब्ध करून दिली आहे.
LongCat 2.0 नेमके काय घेऊन येते
प्रथम आपण हार्डवेअरवर अवलंबून नसलेल्या तथ्यांकडे पाहूया. १.६ ट्रिलियन पॅरामीटर्ससह, LongCat 2.0 आतापर्यंत लाँच झालेल्या सर्वात मोठ्या ओपन-वेट मॉडेल्समध्ये मोडते. पॅरामीटर्स हे गुणवत्तेचे एकमेव मोजमाप नसले तरी, या स्तरावर ते गंभीर अभियांत्रिकी महत्त्वाकांक्षा दर्शवतात. Mixture-of-Experts डिझाइनमुळे, कोणत्याही विशिष्ट कार्यासाठी त्या पॅरामीटर्सचा केवळ एक छोटा भाग सक्रिय होतो. यामुळे मॉडेलला ज्ञानाची आणि तर्कशास्त्राच्या (reasoning) पॅटर्नची अफाट व्याप्ती साठवण्याची क्षमता मिळते आणि त्याच वेळी इन्फरन्स खर्च (inference costs) नियंत्रणाबाहेर जाण्यापासून रोखला जातो.
याचे कॉन्टेक्स्ट विंडो (context window) १० लाख टोकन्सपर्यंत पोहोचते. हे OpenAI आणि Anthropic च्या हाय-एंड सेवांच्या बरोबरीचे आहे आणि यामुळे मॉडेल प्रत्यक्षात काय करू शकते यामध्ये मोठा बदल होतो. इतक्या मोठ्या विंडोसह, तुम्ही एकाच प्रॉम्प्टमध्ये संपूर्ण कायदेशीर करार, महिन्यांचे चॅट लॉग्स किंवा कोड रिपॉझिटरीज देऊ शकता. लांब कागदपत्रांमधील माहिती लक्षात ठेवणारी ॲप्लिकेशन्स बनवणाऱ्या डेव्हलपर्ससाठी, ही केवळ किरकोळ सुधारणा नसून एक कार्यात्मक गरज आहे.
त्यानंतर येते ती पारदर्शकता. Meituan ने कोणतेही मर्यादित डेमो किंवा प्रतिबंधित API लाँच केले नाही. मॉडेलचे weights उपलब्ध आहेत, ट्रेनिंग कोड सार्वजनिक आहे आणि पाइपलाइन देखील आहे. हे संशोधकांसाठी महत्त्वाचे आहे ज्यांना निकाल पुन्हा मिळवायचे आहेत, अशा उद्योगांसाठी ज्यांना मॉडेलच्या वर्तनाची तपासणी (audit) करायची आहे आणि अशा इंजिनिअर्ससाठी ज्यांना कोणताही डेटा थर्ड-पार्टी सर्व्हरवर न पाठवता स्वतःच्या खासगी डेटावर मॉडेल फाईन-ट्यून करायचे आहे.
सर्वांनी दुर्लक्षित केलेली हार्डवेअरची गोष्ट
येथील मुख्य बातमी केवळ पॅरामीटरची संख्या नाही, तर त्याखालील सिलिकॉन आहे. LongCat 2.0 ला देशांतर्गत अॅक्सिलरेटर्सवर, विशेषतः Huawei Ascend सिरीज सारख्या चिप्सवर प्रशिक्षित करण्यात आले आहे. हे एखाद्या अस्तित्वात असलेल्या फ्रेमवर्कला NVIDIA क्लस्टरवर लावून 'रन' बटण दाबण्यापेक्षा पूर्णपणे वेगळे आहे.
ट्रिलियन-पॅरामीटर मॉडेल प्रशिक्षित करण्यासाठी डिस्ट्रिब्युटेड कम्प्युटिंगच्या (distributed computing) अत्यंत कठीण समस्या सोडवणे आवश्यक असते. मेमरी बँडविड्थ, इंटर-चिप कम्युनिकेशन आणि फ्लोटिंग-पॉइंट परफॉर्मन्स या सर्वांचे अत्यंत अचूक व्यवस्थापन करावे लागते. NVIDIA चा फायदा केवळ त्यांच्या GPUs मुळे नाही, तर तो त्यांच्या CUDA इकोसिस्टम, ऑप्टिमाइझ्ड कर्नल्स आणि त्या स्टॅक मधून जास्तीत जास्त परफॉर्मन्स कसा काढायचा याच्या सामूहिक ज्ञानामुळे आहे. Ascend हार्डवेअरवर यासारखे मॉडेल तयार करणे म्हणजे Meituan च्या इंजिनिअर्सना ट्रेनिंग फ्रेमवर्क्स अनुकूल करणे, लो-लेव्हल ऑपरेशन्स पुन्हा लिहिणे आणि पूर्णपणे वेगळ्या आर्किटेक्चरवर डिस्ट्रिब्युटेड ट्रेनिंग रनचे डीबगिंग करणे यांसारखे कठीण काम करावे लागले.
त्यांच्या यशातून एका मॉडेलपेक्षाही मोठी गोष्ट दिसून येते. हे दर्शवते की चिनी हार्डवेअर-सॉफ्टवेअर को-डिझाइन (co-design) आता इतक्या प्रगत स्तरावर पोहोचले आहे की पाश्चात्य चिप्सचा अभाव आता मोठा अडथळा ठरत नाही. ही एक मर्यादा आहे आणि खर्चिकही आहे, पण ती अशक्य अडथळा नाही.
हे मॉडेल प्रत्यक्षात कुठे कामगिरी करते
LongCat 2.0 ने चिनी तर्कशास्त्र (reasoning), गणित आणि लांब-संदर्भ शोधण्यामध्ये (long-context retrieval) उत्तम कामगिरी केली आहे. हे विशिष्ट आणि उच्च-मूल्य असलेले बेंचमार्क आहेत. गणितीय तर्कशास्त्र मॉडेलची लॉजिक आणि सिम्बॉलिक मॅनिप्युलेशन हाताळण्याची क्षमता तपासते. लांब-संदर्भ शोधणे (Long-context retrieval) हे मॉडेल १० लाख टोकन्सच्या माहितीच्या ढिगाऱ्यातून माहितीचा एखादा छोटा अंश न गमावता शोधू शकते का, हे तपासते. या दोन्ही चाचण्या पार करणे, हे केवळ हुशार वाटणाऱ्या मॉडेलमध्ये आणि प्रत्यक्षात काम करू शकणाऱ्या मॉडेलमध्ये असलेला फरक आहे.
Meituan हे याला Llama, DeepSeek आणि Qwen ला थेट पर्याय म्हणून सादर करत आहे. चिनी भाषेतील कामांसाठी ही स्पर्धा विशेषतः तीव्र आहे. प्रामुख्याने इंग्रजी इंटरनेट डेटावर प्रशिक्षित केलेले मॉडेल्स अनेकदा अभिजात चिनी संदर्भ (classical Chinese references), स्थानिक नियामक भाषा, मुख्य भूमीतील बाजारपेठांमध्ये वापरले जाणारे आर्थिक शब्द आणि चिनी सोशल मीडियामध्ये वर्चस्व गाजवणाऱ्या अनौपचारिक संक्षेपांमध्ये अडखळतात. ज्या कंपनीचा मुख्य व्यवसाय चिनी ग्राहक वर्तनावर आधारित आहे, अशा कंपनीकडून मिळालेल्या माहितीवर आणि सखोल चिनी भाषेच्या कौशल्याने तयार केलेल्या मॉडेलला अशा परिस्थितीत संरचनात्मक फायदा मिळतो.
हे केवळ चॅटबॉट्सपुरते मर्यादित नाही. PRC कंत्राट कायद्याचे विश्लेषण करणाऱ्या Legaltech कंपन्या, ऐतिहासिक मजकूर वाचणारे संशोधक, मँडरीन कर्ज कागदपत्रांवर प्रक्रिया करणारे बँका आणि प्रादेशिक बोलीभाषा हाताळणारे ग्राहक सेवा प्लॅटफॉर्म या सर्वांना अशा मॉडेल्सची गरज आहे जी केवळ इंग्रजी-केंद्रित दृष्टिकोनातून भाषांतर करण्याऐवजी बारकावे (nuance) समजून घेऊ शकतील.
Meituan चे गुप्त शस्त्र: व्याप्ती आणि डेटा
Meituan ही केवळ डिलिव्हरी ॲप असलेली एखादी संशोधन प्रयोगशाळा नाही. ती एक मोठी कार्यात्मक शक्ती (operational juggernaut) आहे जी दररोज चीनमधील लाखो रायडर्स, रेस्टॉरंट्स आणि व्यापाऱ्यांचे समन्वय साधते. या व्याप्तीमुळे वास्तविक जगातील भाषेचा प्रचंड डेटा तयार होतो. चॅटबॉट्सकडे पाठवलेल्या ग्राहकांच्या तक्रारी; प्रादेशिक बोलीभाषा आणि औपचारिक व्यावसायिक नोंदणी तपशील यांचा मेळ घालणारी रेस्टॉरंटची वर्णने; पत्ता प्रणाली आणि अनौपचारिक खुणांचे मिश्रण असलेली मार्गदर्शक सूचना; कर, स्वच्छता नियम आणि स्थानिक अध्यादेशांशी संबंधित व्यापारी सेवा तिकीट (merchant service tickets).
हा डेटा विस्कळीत, संदर्भावर आधारित आणि इतका स्थानिक आहे की सामान्य वेब क्रॉल डेटा त्याची कधीही प्रतिकृती तयार करू शकत नाही. हा डेटा LongCat 2.0 मध्ये वापरल्यामुळे मॉडेलला एक व्यावहारिक आधार मिळतो, जो केवळ शैक्षणिक प्रशिक्षणामध्ये नसतो. पॉलिश केलेल्या विकिपीडिया मजकुरावर प्रशिक्षण देणे ही एक गोष्ट आहे, तर प्रत्यक्ष व्यापारातील गोंधळलेल्या आणि व्यवहारात्मक भाषेवर प्रशिक्षण देणे ही पूर्णपणे वेगळी गोष्ट आहे.
परिस्थिती का बदलत आहे
जर कंपन्या देशांतर्गत सिलिकॉनवर frontier-class मॉडेल्स प्रशिक्षित करू शकत असतील, तर चिप निर्यात बंदीमागील संपूर्ण धोरणात्मक तर्क क्षीण होऊ लागतो. NVIDIA च्या पुरवठा साखळीवर नियंत्रण मिळवल्यास AI क्षमतेवर नियंत्रण मिळवता येईल, या गृहितकावर या बंदी बांधल्या गेल्या होत्या. हे गृहितक असे मानत होते की कोणताही सक्षम पर्यायी इकोसिस्टम अस्तित्वात नाही.
LongCat 2.0 हे असे जाहीर करत नाही की चिनी चिप्सने प्रत्येक निकषावर NVIDIA ला मागे टाकले आहे. तर, काम पूर्ण करण्यासाठी त्यांना पूर्णपणे मॅच करण्याची गरज नाही, याचा हा पुरावा आहे. पुरेशी मेमरी, पुरेशी बँडविड्थ आणि पुरेशी स्मार्ट सॉफ्टवेअर ऑप्टिमायझेशन यांमुळे स्पर्धात्मक परिणाम मिळवण्यासाठी आवश्यक अंतर भरून काढता येते. हे पूर्ण समानता (total parity) मिळवण्यापेक्षा खूपच सोपे आहे आणि असे दिसते की हे उद्दिष्ट साध्य झाले आहे.
जागतिक AI पुरवठा साखळीसाठी याचा अर्थ स्पष्ट आहे. सर्व गंभीर प्रशिक्षण प्रक्रिया NVIDIA हार्डवेअरद्वारेच पार पाडाव्या लागतील, हे गृहितक आता संपले आहे. यामुळे AI विकासातील राष्ट्रीय सार्वभौमत्वाकडे (national sovereignty) सत्ता झुकते. बाजूने पाहत असलेल्या देश आणि कंपन्यांना आता frontier क्षमतेसाठी केवळ एकच chokepoint पुरवठादार हा एकमेव मार्ग वाटत नाही. त्यांना एक विभाजन (bifurcation) आणि बहुध्रुवीय (multipolar) हार्डवेअर परिदृश्य, बहुतेकांच्या अंदाजापेक्षा वेगाने उदयास येताना दिसत आहे.
मुख्य निष्कर्ष
LongCat 2.0 हे केवळ तांत्रिक रिलीज नाही. हे एका राजकीय गृहितकाची परीक्षा आहे आणि ते गृहितक नुकतेच अपयशी ठरले आहे. Meituan ने हे सिद्ध केले आहे की योग्य डेटा, योग्य इंजिनिअरिंग टीम आणि योग्य हार्डवेअर असलेली एखादी ग्राहक तंत्रज्ञान कंपनी, एकही प्रतिबंधित पाश्चात्य GPU न वापरता 1.6-ट्रिलियन-पॅरामीटरचे open model प्रशिक्षित करू शकते.
डेव्हलपर्ससाठी, याचा अर्थ चिनी भाषा आणि long-context कामांमध्ये खऱ्या अर्थाने सखोलता असलेले एक नवीन open-weight पर्याय उपलब्ध झाला आहे. धोरणकर्त्यांसाठी, याचा अर्थ हार्डवेअर नाकारण्यावर आधारित निर्बंधांमध्ये केवळ खरेदी करण्याऐवजी अनुकूलनावर (adaptation) देखील लक्ष केंद्रित करणे आवश्यक आहे. उद्योगातील इतर घटकांसाठी, याचा अर्थ कोण काय आणि कोणत्या साधनांनी बनवू शकते, याचा नकाशा रिअल-टाइममध्ये पुन्हा लिहिला जात आहे.
निर्यात बंदीने कदाचित वेळ मिळवून दिली असेल. परंतु, त्यांनी एक पर्याय देखील निर्माण केला आहे असे दिसते.
