Alibaba નું Qwen2.5-Max અને DeepSeek નું V3-Flash આ અઠવાડિયે બજારમાં આવ્યા છે, જેઓ સસ્તા AI inference માટે અલગ-અલગ માર્ગ અપનાવે છે. Alibaba તેના 2.4 ટ્રિલિયન-પેરામીટર mixture-of-experts (MoE) ડિઝાઇન સાથે દરેક ક્વેરી દીઠ માત્ર આશરે 95 અબજ પેરામીટર્સ સક્રિય કરે છે; DeepSeek ટોકન દીઠ કિંમત ઘટાડવા માટે આર્કિટેક્ચરને ટ્રીમ કરે છે. AI ની આ સ્પર્ધા હવે માત્ર મોડેલના કદથી નહીં, પણ ડોલર પ્રતિ ટોકન દ્વારા માપવામાં આવે છે.
“વધારે પેરામીટર્સ” થી “ઓછી કિંમત” તરફ
વર્ષો સુધી, large-language-model (LLM) ડેવલપમેન્ટમાં મુખ્ય માપદંડ પેરામીટરની સંખ્યા હતી. OpenAI, Google અને અન્ય કંપનીઓએ ટ્રિલિયન-પેરામીટરના અવરોધને તોડવાનો ગર્વ સાથે અહેવાલ આપ્યો હતો, એવું માનીને કે મોટું એટલે વધુ સ્માર્ટ. Alibaba અને DeepSeek બતાવે છે કે હવે ગણતરી બદલાઈ ગઈ છે.
Alibaba નું Qwen2.5-Max હજુ પણ સ્કેલ પર આધારિત છે, પરંતુ તે ખર્ચ બચાવવાની એક યુક્તિ ઉમેરે છે. એક dense model માં દરેક inference વખતે દરેક પેરામીટર ચાલે છે, જે 2.4 ટ્રિલિયન-પેરામીટર નેટવર્કને ઊર્જાનો ભૂખ્યો રાક્ષસ બનાવી દે છે. MoE નેટવર્કને ઘણા “experts” માં વિભાજિત કરે છે અને દરેક વિનંતીને તેના પેટા-સેટ (subset) તરફ મોકલે છે. Qwen2.5-Max નું router કોઈપણ prompt માટે આશરે 95 અબજ પેરામીટર્સ પસંદ કરે છે, જે લેટન્સી (latency) અને ઊર્જાને નિયંત્રણમાં રાખીને ટ્રિલિયન-પેરામીટર સિસ્ટમ જેવી તર્કશક્તિ (reasoning power) પૂરી પાડે છે.
DeepSeek ટ્રિલિયન-પેરામીટરની મહત્વાકાંક્ષાને સંપૂર્ણપણે છોડી દે છે. તેનું V3-Flash મોડેલ સસ્તું, ઝડપી અને મોટા પાયે ચલાવવા માટે બનાવવામાં આવ્યું છે. કંપની આ મોડેલને “ultra-low inference pricing” ના આસપાસ માર્કેટ કરે છે, જે એવા ડેવલપર્સને લક્ષ્ય બનાવે છે જેઓ દરરોજ લાખો ટોકન્સ પ્રોસેસ કરે છે અને મોટો ખર્ચ કરવા માંગતા નથી. ચોક્કસ કિંમત જાહેર કરવામાં આવી નથી, પરંતુ સંદેશ સ્પષ્ટ છે: જો કોઈ સ્ટાર્ટઅપ પશ્ચિમી (Western) પ્રતિ-ટોકન દરો પરફોર્મ કરી શકતું નથી, તો V3-Flash એક વ્યવહારુ વિકલ્પ બની જાય છે.
Inference Cost શા માટે સ્પર્ધાત્મક લાભ બની રહ્યું છે
જ્યારે મોડેલ્સ લેબમાંથી બહાર નીકળીને પ્રોડક્શનમાં આવે છે ત્યારે inference cost મહત્વની બની જાય છે. એન્ટરપ્રાઇઝ જેઓ LLMs ને ચેટબોટ્સ, ડોક્યુમેન્ટ-એનાલિસિસ પાઇપલાઇન્સ અથવા રેકમેન્ડેશન એન્જિનમાં ઇમ્બેડ કરે છે, તેઓ ઝડપથી અનુભવે છે કે ટોકન-લેવલ પ્રાઇસિંગ ઓપરેટિંગ ખર્ચ પર પ્રભુત્વ ધરાવે છે. જે મોડેલ પ્રતિ ટોકન અડધી કિંમતે મળે છે, તે અન્ય પહેલો માટે બજેટ બમણું કરી શકે છે—વધારે ડેટા, વધુ ટ્રાફિક અથવા વધારાના ફીચર્સ.
આ બંને ચીની કંપનીઓ અલગ-અલગ માર્કેટ સેગમેન્ટને લક્ષ્ય બનાવે છે. Alibaba નું MoE જટિલ અને તર્ક-લક્ષી કાર્યો માટે ઉચ્ચ પ્રદર્શનનું વચન આપે છે, જ્યારે પ્રતિ-વિનંતી કમ્પ્યુટ બજેટને મધ્યમ રાખે છે. બીજી તરફ, DeepSeek નું લિગર (leaner) મોડેલ એવા હાઈ-વોલ્યુમ અને લેટન્સી-સેન્સિટિવ વર્કલોડ માટે આકર્ષક છે જ્યાં કાચી શક્તિ (raw horsepower) કરતા અનુમાનિત ખર્ચ વધુ મહત્વનો છે.
આ બંને વ્યૂહરચનાઓ પશ્ચિમી પ્રદાતાઓ (Western providers) ના બજારને અસર કરી શકે છે જેઓ મોટા મોડેલ્સને પ્રીમિયમ પ્રાઇસિંગ સાથે જોડે છે. જો ડેવલપર્સ સસ્તા ટોકન ભાવ સાથે સમાન પરિણામો મેળવી શકે છે, તો મોંઘી APIs સાથે જોડાયેલા રહેવાની પ્રેરણા નબળી પડી જાય છે.
વૈશ્વિક AI ઇકોસિસ્ટમ માટેના જોખમો અને તકો
- Startups અને SMEs: નીચલા inference costs AI-સંચાલિત ઉત્પાદનો માટેના અવરોધો ઘટાડે છે. જે ટીમોને અગાઉ API બિલ માટે વધારાના મૂડીની જરૂર પડતી હતી, તેઓ હવે ઓછા બજેટમાં પ્રોટોટાઇપ બનાવી શકે છે અને લોન્ચ કરી શકે છે.
- Enterprises: આંતરિક AI સેવાઓ ચલાવતી મોટી કોર્પોરેશનો ઓપરેટિંગ ખર્ચ ઘટાડી શકે છે, જેનાથી ડેટા એક્વિઝિશન, મોડેલ fine-tuning અથવા વધારાના કમ્પ્યુટ માટે ભંડોળ મુક્ત થાય છે.
- Western Providers: તેમના રેવન્યુ મોડેલ્સ પ્રતિ-ટોકન ચાર્જ પર આધારિત છે. ખર્ચ-કેન્દ્રિત વિકલ્પો તરફનું વલણ તેમને કિંમતો ઘટાડવા અથવા એવી ક્ષમતાઓ પર ધ્યાન કેન્દ્રિત કરવા માટે મજબૂર કરે છે જે સસ્તા મોડેલ્સ હજુ સુધી મેચ કરી શકતા નથી.
- Regulators અને Policymakers: વધુ સસ્તું AI વિવિધ ક્ષેત્રોમાં તેનો સ્વીકાર ઝડપી બનાવી શકે છે, જે દેખરેખ, ડેટા પ્રાઇવસી અને ઓટોમેશનની ગતિ વિશે પ્રશ્નો ઉભા કરે છે.
ટ્રેડ-ઓફ્સ અને વિરોધી દલીલો
Qwen2.5-Max જેવા MoE મોડેલ્સ મફત નથી મળતા. Routing logic એન્જિનિયરિંગ જટિલતા વધારે છે, અને sparse activation ક્વેરીના પ્રકારો મુજબ અસમાન પ્રદર્શન કરી શકે છે. જો router ખોટી રીતે કામ કરે, તો વિનંતી બિન-આદર્શ (sub-optimal) experts ને સક્રિય કરી શકે છે, જેનાથી આઉટપુટની ગુણવત્તા ઘટી શકે છે. વધુમાં, હાર્ડવેર હજુ પણ dense compute ને અનુકૂળ છે; MoE inference માટેના વિશિષ્ટ એક્સિલરેટર્સ હજુ સુધી વ્યાપક નથી, જે વાસ્તવિક વિશ્વમાં કાર્યક્ષમતાના ફાયદાઓને મર્યાદિત કરી શકે છે.
DeepSeek ની ખર્ચ-પ્રથમ ફિલોસોફીમાં જોખમો પણ છે. આક્રમક પ્રાઇસિંગનો અર્થ ઘણીવાર મોડેલનું કદ અને તાલીમ ડેટા (training data) પર કડક મર્યાદાઓ હોય છે, જે સંભવિત રીતે પ્રદર્શનને મર્યાદિત કરી શકે છે. જે એપ્લિકેશન્સમાં સૂક્ષ્મ તર્ક (nuanced reasoning) ની જરૂર હોય છે, ત્યાં સસ્તું મોડેલ નિષ્ફળ જઈ શકે છે, જેનાથી વપરાશકર્તાઓ ફરીથી મોટા અને વધુ મોંઘા વિકલ્પો તરફ વળે છે.
અંતે, "ડોલર દીઠ બુદ્ધિ" (intelligence per dollar) એ સ્પર્ધાનો માત્ર એક જ પાસા છે. લેટન્સી, વિશ્વસનીયતા, ઇકોસિસ્ટમ સપોર્ટ અને પ્રાદેશિક નિયમોનું પાલન નિર્ણાયક રહેશે. જે કંપનીઓ આ તમામ પરિમાણોમાં સંતુલિત પેકેજ આપશે તેઓ કદાચ પ્રભુત્વ જમાવશે, માત્ર તેઓ નહીં જેઓ ભાવ યુદ્ધ જીતે છે.
આગળ શું જોવું
- બેન્ચમાર્ક રિલીઝ: Qwen2.5-Max ની MoE રાઉટિંગ કાર્યક્ષમતા અને V3-Flash ના ટોકન ખર્ચના સ્વતંત્ર મૂલ્યાંકનો એ દર્શાવશે કે શું આ હાઈપ ખરેખર માપી શકાય તેવી બચત માં પરિણમે છે.
- હાર્ડવેર વિકાસ: સ્પાર્સ એક્ટિવેશન માટે ઓપ્ટિમાઇઝ કરેલા એક્સિલરેટર્સનો ઉપયોગ MoE ના ફાયદાઓને વધારી શકે છે, જ્યારે જનરલ-પર્પઝ GPU ડેન્સ મોડલ્સને સ્પર્ધાત્મક બનાવી શકે છે.
- કિંમત પ્રતિક્રિયાઓ: પશ્ચિમી પ્રદાતાઓ તેમના ટિયર્સમાં ફેરફાર કરી શકે છે અથવા બેચ ઇન્ફરન્સ ડિસ્કાઉન્ટ અથવા ઓન-પ્રેમિસ લાયસન્સિંગ જેવી ખર્ચ બચાવતી સુવિધાઓ ઉમેરી શકે છે.
- નિયમનકારી પગલાં: જેમ જેમ સસ્તું AI ફેલાશે, તેમ સરકારો પારદર્શિતા અને સુરક્ષા માટેના ધોરણો લાવી શકે છે જે આ મોડલ્સને મોટા પાયે કેવી રીતે તૈનાત કરવામાં આવે છે તેને અસર કરી શકે છે.
મુખ્ય તારણ
Alibaba નું MoE-સંચાલિત Qwen2.5-Max અને DeepSeek નું ઓછી કિંમતનું V3-Flash એ દર્શાવે છે કે AI ની રેસ હવે પેરામીટર કાઉન્ટ જેટલી જ બજેટ સ્પ્રેડશીટ પર પણ ચાલે છે. જે કંપનીઓ પ્રતિ-ટોકન બિલ ઓછું રાખીને અત્યાધુનિક ભાષાકીય ક્ષમતાઓ પ્રદાન કરશે, તેઓ AI ને વપરાશકર્તાઓના વ્યાપક સમૂહ માટે ખુલ્લું પાડશે, જે લાંબા સમયથી સૌથી મોટા અને સૌથી મોંઘા મોડલ્સના પક્ષમાં રહેલી સ્પર્ધાત્મક ગતિશીલતાને નવું સ્વરૂપ આપશે.
