વર્ષોથી, ટેક પોલિસીના વર્તુળોમાં એક સ્પષ્ટ ધારણા હતી: NVIDIA ચિપ્સ વગર, ફ્રન્ટિયર AI શક્ય નથી. H100 અને નવી Blackwell લાઇન જેવા હાઇ-એન્ડ GPUs પરના નિકાસ નિયંત્રણો બરાબર તે જ અવરોધને ધ્યાનમાં રાખીને બનાવવામાં આવ્યા હતા. સિદ્ધાંત એ હતો કે શ્રેષ્ઠ સિલિકોનનો ઉપયોગ અટકાવી દેવાથી, તમે કોઈ દેશની સૌથી મોટી અને સૌથી સક્ષમ મોડલ્સને તાલીમ આપવાની ક્ષમતાને ધીમી કરી શકો છો. Meituan એ આ ધારણાને ખોટી સાબિત કરી દીધી છે.
ફૂડ ડિલિવરી અને લોકલ સર્વિસિસમાં પ્રભુત્વ માટે જાણીતું ચીની ટેક જાયન્ટ, LongCat 2.0 રિલીઝ કરી ચૂક્યું છે. તે Mixture-of-Experts આર્કિટેક્ચર પર આધારિત 1.6-ટ્રિલિયન-પેરામીટર મોડલ છે. સૌથી મોટી વાત શું છે? ટીમે તેને સંપૂર્ણપણે ચીની સ્થાનિક ચિપ્સ પર તાલીમ આપી છે. કોઈ NVIDIA H100 નથી. કોઈ Blackwell GPUs નથી. અને તેને API પાછળ છુપાવવાને બદલે, Meituan એ કોઈપણ વ્યક્તિ તપાસી શકે તે માટે GitHub પર તેના weights, તાલીમ કોડ અને સંપૂર્ણ ડેટા પાઇપલાઇન મૂકી દીધી છે.
LongCat 2.0 ખરેખર શું લાવે છે
ચાલો પહેલા હાર્ડવેર-અજ્ઞેય (hardware-agnostic) તથ્યો જોઈએ. 1.6 ટ્રિલિયન પેરામીટર્સ સાથે, LongCat 2.0 અત્યાર સુધી રિલીઝ થયેલા સૌથી મોટા open-weight મોડલ્સમાંનું એક છે. પેરામીટર્સ ગુણવત્તાનું એકમાત્ર માપ નથી, પરંતુ આ સ્કેલ પર, તેઓ ગંભીર એન્જિનિયરિંગ મહત્વાકાંક્ષા સૂચવે છે. કારણ કે તે Mixture-of-Experts ડિઝાઇનનો ઉપયોગ કરે છે, તેથી કોઈપણ આપેલ કાર્ય માટે તે પેરામીટર્સનો માત્ર એક ભાગ જ સક્રિય થાય છે. આનાથી ઇન્ફરન્સ ખર્ચ (inference costs) અનિયંત્રિત રીતે વધતો અટકે છે, જ્યારે મોડલને જ્ઞાન અને તર્કની વિશાળ શ્રેણી સંગ્રહ કરવાની ક્ષમતા પણ મળે છે.
તેનું context window દસ લાખ (one million) ટોકન્સ સુધી પહોંચે છે. તે OpenAI અને Anthropic ની હાઇ-એન્ડ ઓફરિંગ્સ સાથે મેળ ખાય છે, અને તે મોડલ વ્યવહારિક રીતે શું કરી શકે છે તે બદલી નાખે છે. આટલા મોટા વિન્ડો સાથે, તમે એક જ પ્રોમ્પ્ટમાં આખા કાનૂની કરારો, મહિનાઓના ચેટ લોગ્સ અથવા વિશાળ કોડ રિપોઝીટરીઝ આપી શકો છો. લાંબા દસ્તાવેજોમાં મેમરીની જરૂર હોય તેવી એપ્લિકેશન્સ બનાવતા ડેવલપર્સ માટે, આ માત્ર નાનો સુધારો નથી, પરંતુ એક કાર્યકારી જરૂરિયાત છે.
પછી તેની ખુલ્લાપણું (openness) છે. Meituan એ કોઈ મર્યાદિત ડેમો કે પ્રતિબંધિત API રિલીઝ કર્યું નથી. મોડલ weights ઉપલબ્ધ છે, તાલીમ કોડ જાહેર છે, અને પાઇપલાઇન પણ છે. તે એવા સંશોધકો માટે મહત્વનું છે જેઓ પરિણામો ફરીથી મેળવવા માંગે છે, એવા સાહસો (enterprises) માટે જેમને વર્તણૂકની ઓડિટ કરવાની જરૂર છે, અને એવા એન્જિનિયરો માટે જેમને કોઈ પણ ડેટા ત્રીજા પક્ષના સર્વર પર મોકલ્યા વિના પ્રોપ્રાઇટરી ડેટા પર મોડલને fine-tune કરવાની જરૂર છે.
હાર્ડવેરની એવી વાર્તા જે દરેક ચૂકી ગયા
અહીં મુખ્ય સમાચાર માત્ર પેરામીટરની સંખ્યા નથી, પરંતુ તેની નીચેનું સિલિકોન છે. LongCat 2.0 ને સ્થાનિક એક્સિલરેટર્સ પર તાલીમ આપવામાં આવી હતી, ખાસ કરીને Huawei Ascend શ્રેણી જેવી ચિપ્સ પર. તે કોઈ અસ્તિત્વમાં રહેલા ફ્રેમવર્કને NVIDIA ક્લસ્ટર પર લગાવીને રન કરવા કરતાં તદ્દન અલગ બાબત છે.
ટ્રિલિયન-પેરામીટર મોડલને તાલીમ આપવા માટે એક્સ્ટ્રીમ એજ પર ડિસ્ટ્રિબ્યુટેડ કમ્પ્યુટિંગ સમસ્યાઓ ઉકેલવી જરૂરી છે. મેમરી બેન્ડવિડ્થ, ઇન્ટર-ચિપ કોમ્યુનિકેશન અને ફ્લોટિંગ-પોઇન્ટ પર્ફોર્મન્સ - આ બધું જ અત્ય
Meituan આને Llama, DeepSeek અને Qwen ના સીધા વિકલ્પ તરીકે રજૂ કરી રહ્યું છે. ચીની ભાષાના કાર્યો માટે, આ સ્પર્ધા ખાસ કરીને તીવ્ર છે. મુખ્યત્વે અંગ્રેજી ઇન્ટરનેટ ડેટા પર તાલીમ પામેલા મોડલ્સ ઘણીવાર શાસ્ત્રીય ચીની સંદર્ભો, સ્થાનિક નિયમનકારી ભાષા, મુખ્ય ભૂમિના બજારોમાં વપરાતી નાણાકીય પરિભાષા અને ચીની સોશિયલ મીડિયામાં પ્રભુત્વ ધરાવતી અનૌપચારિક ટૂંકી ભાષા (shorthand) પર અટકી જાય છે. જે મોડલ ઊંડી ચીની ભાષાકીય કુશળતા સાથે બનાવવામાં આવ્યું હોય અને જે કંપનીના મુખ્ય વ્યવસાયનું સંચાલન ચીની ગ્રાહક વર્તણૂક પર આધારિત હોય, તેને આ પરિસ્થિતિઓમાં માળખાગત ફાયદો મળે છે.
આ માત્ર ચેટબોટ્સ પૂરતું મર્યાદિત નથી. PRC કોન્ટ્રાક્ટ કાયદાનું વિશ્લેષણ કરતી Legaltech કંપનીઓ, ઐતિહાસિક લખાણોનું વિશ્લેષણ કરતા સંશોધકો, મેન્ડરિન લોન દસ્તાવેજો પર પ્રક્રિયા કરતી બેંકો અને પ્રાદેશિક બોલીઓ સંભાળતા કસ્ટમર સર્વિસ પ્લેટફોર્મ્સ - આ બધાને એવા મોડલ્સની જરૂર છે જે અંગ્રેજી-કેન્દ્રિત દ્રષ્ટિકોણ દ્વારા અનુવાદ કરવાને બદલે સૂક્ષ્મ તફાવતોને સમજી શકે.
Meituan નું છુપાયેલું શસ્ત્ર: સ્કેલ અને ડેટા
Meituan એ માત્ર ડિલિવરી એપ ધરાવતી કોઈ સંશોધન પ્રયોગશાળા નથી. તે એક ઓપરેશનલ જગ્ગનૌટ છે જે દરરોજ સમગ્ર ચીનભરમાં લાખો રાઈડર્સ, રેસ્ટોરન્ટ્સ અને વેપારીઓનું સંકલન કરે છે. તે સ્કેલ વાસ્તવિક દુનિયાના ભાષાકીય ડેટાનો પ્રવાહ પેદા કરે છે. ચેટબોટ્સ દ્વારા સંચાલિત ગ્રાહકોની ફરિયાદો. પ્રાદેશિક સ્લેંગ અને ઔપચારિક વ્યવસાયિક નોંધણી વિગતોનું મિશ્રણ કરતા રેસ્ટોરન્ટના વર્ણનો. એડ્રેસ સિસ્ટમ અને અનૌપચારિક લેન્ડમાર્કનું મિશ્રણ કરતી રૂટિંગ સૂચનાઓ. ટેક્સ, સ્વચ્છતાના નિયમો અને સ્થાનિક કાયદાઓને સ્પર્શતી મર્ચન્ટ સર્વિસ ટિકિટો.
આ ડેટા અસ્તવ્યસ્ત, સંદર્ભિત અને એટલો ઊંડો સ્થાનિક છે કે સામાન્ય વેબ ક્રોલ ડેટા તેને ક્યારેય નકલ કરી શકતો નથી. આ ડેટાને LongCat 2.0 માં ફીડ કરવાથી મોડલને એવો વ્યવહારુ આધાર મળે છે જે શુદ્ધ શૈક્ષણિક તાલીમમાં હોતો નથી. પોલિશ્ડ વિકિપીડિયા ટેક્સ્ટ પર તાલીમ આપવી એ એક વાત છે, પરંતુ વાસ્તવિક વ્યાપારની અસ્તવ્યસ્ત અને વ્યવહારિક ભાષા પર તાલીમ આપવી એ બીજી વાત છે.
પાયો કેમ બદલાઈ રહ્યો છે
જો કંપનીઓ સ્થાનિક સિલિકોન પર અદ્યતન (frontier-class) મોડલ્સને તાલીમ આપી શકે છે, તો ચિપ નિકાસ પ્રતિબંધો પાછળનું સમગ્ર વ્યૂહાત્મક તર્ક ક્ષીણ થવા લાગે છે. આ પ્રતિબંધો એ ધારણા પર આધારિત હતા કે NVIDIA સપ્લાય લાઇન પર નિયંત્રણ રાખવાથી AI ક્ષમતા પર નિયંત્રણ મેળવી શકાશે. તે ધારણા એવું માની લેતી હતી કે કોઈ વ્યવહારુ વૈકલ્પિક ઇકોસિસ્ટમ અસ્તિત્વમાં નથી.
LongCat 2.0 એ એવું જાહેર કરવું નથી કે ચીની ચિપ્સ દરેક માપદંડ પર NVIDIA ને મળતી આવે છે. તે એ વાતનો પુરાવો છે કે કામ પૂરું કરવા માટે તેમને સંપૂર્ણ રીતે સમાન હોવાની જરૂર નથી. પૂરતી મેમરી, પૂરતો બેન્ડવિડ્થ અને પૂરતું સ્માર્ટ સોફ્ટવેર ઓપ્ટિમાઇઝેશન સ્પર્ધાત્મક પરિણામો મેળવવા માટે અંતરને એટલું ઘટાડી શકે છે કે કામ થઈ જાય. તે સંપૂર્ણ સમાનતા કરતા ઘણો નીચો સ્તર છે, અને એવું લાગે છે કે આ સ્તર પાર કરી લેવામાં આવ્યો છે.
વૈશ્વિક AI સપ્લાય ચેઇન માટે, તેની અસરો સ્પષ્ટ છે. એવી ધારણા કે તમામ ગંભીર તાલીમ NVIDIA હાર્ડવેર દ્વારા જ થવી જોઈએ, તે હવે ભૂતકાળ બની ગઈ છે. આ બાબત AI વિકાસમાં રાષ્ટ્રીય સાર્વભૌમત્વ તરફ શક્તિનું સ્થાનાંતર કરે છે. સાઇડલાઇન્સમાંથી જોતા દેશો અને કંપનીઓ હવે ફ્રન્ટિયર ક્ષમતા માટે સિંગલ ચોકપોઈન્ટ સપ્લાયરને એકમાત્ર માર્ગ તરીકે જોતા નથી. તેઓ એક વિભાજન, અને કદાચ એક બહુધ્રુવીય હાર્ડવેર લેન્ડસ્કેપને, મોટાભાગના લોકોના અનુમાન કરતા વધુ ઝડપથી ઉભરી આવતા જોઈ રહ્યા છે.
વાસ્તવિક નિષ્કર્ષ
LongCat 2.0 એ માત્ર એક ટેકનિકલ રિલીઝ નથી. તે એક રાજકીય પૂર્વધારણાની કસોટી છે, અને તે પૂર્વધારણા હમણાં જ નિષ્ફળ ગઈ છે. Meituan એ સાબિત કર્યું છે કે યોગ્ય ડેટા, યોગ્ય એન્જિનિયરિંગ ટીમ અને યોગ્ય હાર્ડવેર ધરાવતી કન્ઝ્યુમર ટેક કંપની કોઈપણ પ્રતિબંધિત પશ્ચિમી GPU ને અડ્યા વગર 1.6-ટ્રિલિયન-પેરામીટર ધરાવતું ઓપન મોડલ તાલીમ આપી શકે છે.
ડેવલપર્સ માટે, આનો અર્થ ચીની ભાષા અને લોંગ-કોન્ટેક્સ્ટ કાર્યોમાં વાસ્તવિક ઊંડાઈ સાથેનો નવો ઓપન-વેઇટ વિકલ્પ છે. નીતિ નિર્માતાઓ માટે, તેનો અર્થ એ છે કે હાર્ડવેરના અનામત પર આધારિત પ્રતિબંધોએ માત્ર સંપાદન નહીં, પણ અનુકૂલન પણ ધ્યાનમાં લેવું જોઈએ. ઉદ્યોગના બાકીના લોકો માટે, તેનો અર્થ એ છે કે કોણ શું બનાવી શકે છે અને કયા સાધનો સાથે, તેનો નકશો રીઅલ-ટાઇમમાં ફરીથી તૈયાર થઈ રહ્યો છે.
નિકાસ પ્રતિબંધોએ કદાચ સમય ખરીદ્યો હશે. પરંતુ તે એક વૈકલ્પિક માર્ગ પણ ખરીદી લાવ્યા હોય તેવું લાગે છે.
