અલીબાબાએ (Alibaba) ૩ ઓગસ્ટના રોજ Qwen3.8-Max લોન્ચ કર્યું. તે એક mixture-of-experts મોડેલ છે જે ૨.૪ ટ્રિલિયન પેરામીટર્સ સુધી વિસ્તરે છે પરંતુ ઇન્ફરન્સ (inference) સમયે માત્ર ૯૫ અબજ પેરામીટર્સ જ સક્રિય કરે છે. આ મોડેલ QwenCloud gateway દ્વારા ઈમેજ અને ટેક્સ્ટ સ્વીકારે છે, અને અલીબાબાનું કહેવું છે કે તેના weights આવતા અઠવાડિયે સાર્વજનિક રીતે ઉપલબ્ધ થશે.

આ આકર્ષક હેડલાઇન એક અઘરો પ્રશ્ન છુપાવે છે: જ્યારે તે નિર્ભર સાધનો (tools) અટકે ત્યારે શું મોડેલનું એજન્ટ (agent) વિશ્વસનીય રીતે કોડ લખી શકશે? વેન્ડરના ડેમોમાં દસ દિવસના સંપૂર્ણ સ્વાયત્ત કોડિંગ સ્પ્રીન્ટનું પ્રદર્શન કરવામાં આવ્યું છે જેણે શૂન્યથી પ્રોજેક્ટ બનાવ્યો હતો, પરંતુ તે રન અલીબાબાના પોતાના ઇન્ફ્રાસ્ટ્રક્ચર પર અને આદર્શ પરમિશન હેઠળ કરવામાં આવ્યા હતા. વાસ્તવિક દુનિયાના ડેવલપર્સ એ જાણવા માંગે છે કે જ્યારે ટોકન લિમિટ (token limits) આવે, ટૂલ કોલ્સ (tool calls) નિષ્ફળ જાય અથવા રાઈટ એક્સેસ (write access) મર્યાદિત હોય ત્યારે સિસ્ટમ કેવી રીતે વર્તે છે.

આ હાઈપ (hype) કેમ મહત્વની છે

Mixture-of-experts ડિઝાઇન વિશાળ પેરામીટર પૂલને ત્યાં સુધી નિષ્ક્રિય રાખે છે જ્યાં સુધી કોઈ ચોક્કસ "expert" ને બોલાવવામાં ન આવે, જેનાથી સમાન કદના ડેન્સ મોડેલ (dense model) કરતા ઇન્ફરન્સ ખર્ચ ઓછો રહે છે. મલ્ટિમોડલ ઇનપુટ સામાન્ય કોડ જનરેશનથી આગળ વધીને ઉપયોગના કિસ્સાઓને વિસ્તૃત કરે છે, જેનાથી ડેવલપર્સ એક જ પ્રોમ્પ્ટમાં ડાયાગ્રામ અથવા સ્ક્રીનશોટ આપી શકે છે.

પરંતુ આ વચન એ એજન્ટ લેયર (agent layer) પર નિર્ભર છે જે ફાઇલ એડિટર્સ, કમ્પાઇલર્સ, ટેસ્ટ રનર્સ અને વર્ઝન-કંટ્રોલ કમાન્ડ્સનું સંચાલન કરે છે. જો તે લેયર નિષ્ફળ ટૂલ કોલમાંથી રિકવર ન કરી શકે, તો આખું કોડિંગ સેશન પડી ભાંગશે.

ખૂટતો ભાગ: reasoning effort નોબ (knob)

Qwen3.8-Max ત્રણ "reasoning effort" પ્રીસેટ્સ—low, medium, અને xhigh સાથે આવે છે. આ સેટિંગ્સ ઝડપના બદલામાં જવાબની ગુણવત્તા અને સૌથી મહત્વનું, મોડેલ દ્વારા જનરેટ કરવામાં આવતા ટોકન્સની સંખ્યા વચ્ચે સંતુલન બનાવે છે.

એક પુનરાવર્તિત કરી શકાય તેવી ટેસ્ટ પ્લાન (reproducible test plan)

માર્કેટિંગ દાવાઓને પારખવા માટે, નિશ્ચિત ટોકન બજેટ સાથે નીચે મુજબના હેન્ડ્સ-ઓન પ્રોટોકોલનો પ્રયાસ કરો:

  1. નવું રિપોઝિટરી (repository) બનાવો: કોઈપણ ભાષામાં સાદા "hello world" સ્કેફોલ્ડ (scaffold) સાથે.
  2. એજન્ટને પ્રોમ્પ્ટ આપો: નવું ફીચર (દા.ત., એક REST endpoint) ઉમેરવા માટે અને તે જે પણ પ્લાન આઉટપુટ કરે, દરેક ટૂલ કોલ કરે અને દરેક ફાઇલને સ્પર્શે તે રેકોર્ડ કરો.
  3. પ્રથમ નિષ્ફળતા પર અટકાવો: ઉદાહરણ તરીકે, જ્યારે કમ્પાઈલેશન એરર (compilation error) આવે ત્યારે, મોડેલની આંતરિક સ્થિતિ (internal state) સેવ કરો, અને પછી તે ચેકપોઈન્ટથી ફરી શરૂ કરો.
  4. દરેક reasoning effort સેટિંગ હેઠળ રનનું પુનરાવર્તન કરો: કુલ ટોકન્સ, સમય (wall-clock time) અને કોઈપણ ટૂલ-લેવલની ભૂલોની નોંધ લો.
  5. પરમિશન મર્યાદિત કરો: એક વખતે ફક્ત વાંચવાની પરમિશન (read-only access) આપો અને બીજી વાર સંપૂર્ણ રાઈટ એક્સેસ (write access) આપો, જેથી એજન્ટ કેવી રીતે અનુકૂલન સાધે છે તે જોઈ શકાય.
  6. રીટ્રાય્સ (retries) લોગ કરો: મોડેલ નિષ્ફળ ટૂલને ફરીથી બોલાવવામાં કેટલી વાર સફળ થાય છે અથવા તેને રદ કરે છે?

આ મેટ્રિક્સ એકત્રિત કરવાથી તમે કાચા કોડિંગ આઉટપુટની સરખામણી એરર હેન્ડલિંગના છુપા ખર્ચ સાથે કરી શકો છો. જો એજન્ટ વારંવાર ખામીયુક્ત લિન્ટર (linter) ને ફરીથી ટ્રાય કરે છે, તો અંતિમ કોડ યોગ્ય દેખાતો હોવા છતાં ટોકન બિલ વધી જશે.

આ આંકડા શું છુપાવે છે

95B એક્ટિવ-પેરામીટરનો આંકડો સીધો ડોલરની રકમમાં રૂપાંતરિત થતો નથી. ભૂલો આપતા ટૂલ કોલ્સ મોડેલને સુધારાત્મક પ્રોમ્પ્ટ્સ જનરેટ કરવા માટે મજબૂર કરે છે, જેનાથી ટોકનનો વપરાશ વધે છે. ટકાઉ સ્ટેટ (durable state)—સમયાંતરે ચેકપોઈન્ટ્સ જે તમને ક્રેશ પછી ફરી શરૂ કરવા દે છે—ના અભાવે, એકલ નિષ્ફળતાનો ખર્ચ પણ વધી શકે છે.

ઓપન-વેઇટ્સ (Open-weights) અંગેની ચેતવણી

આવતા અઠવાડિયે weights રિલીઝ કરવાની અલીબાબાની વચન ઓન-પ્રેમ (on-prem) ડિપ્લોયમેન્ટ માટે આમંત્રણ આપે છે, પરંતુ બે વ્યવહારિક અવરોધો બાકી છે. પ્રથમ, લાયસન્સ વ્યાપારી ઉપયોગને મર્યાદિત કરી શકે છે અથવા એટ્રિબ્યુશન (attribution) ની જરૂરિયાત રાખી શકે છે; ડેવલપર્સે મોડેલને પ્રોડક્ટમાં ઇન્ટિગ્રેટ કરતા પહેલા તેને વાંચવું જોઈએ. બીજું, 2.4 T-પેરામીટરવાળી mixture-of-experts સિસ્ટમ ચલાવવા માટે હજુ પણ હાઈ-એન્ડ GPUs અથવા સ્પેશિયલાઇઝ્ડ એક્સિલરેટર્સની જરૂર પડે છે. પ્રારંભિક વપરાશકર્તાઓએ "લોકલ ડિપ્લોયમેન્ટ" ના દાવાઓને ત્યાં સુધી કામચલાઉ ગણવા જોઈએ જ્યાં સુધી વાસ્તવિક હાર્ડવેર જરૂરિયાતો અને પરફોર્મન્સ આંકડાઓ ચકાસાયવામાં ન આવે.

વિરોધ પક્ષ: વેન્ડરનો દ્રષ્ટિકોણ

અલીબાબાના આંતરિક પરીક્ષણો દર્શાવે છે કે મોડેલ દસ દિવસના સ્વાયત્ત કોડિંગ મેરેથોન પૂર્ણ કરે છે, જેમાં માનવ ઇનપુટ વગર ઇશ્યુ ટ્રાયેજ (issue triage), કોડ જનરેશન અને ટેસ્ટ એક્ઝિક્યુશન સંભાળવામાં આવે છે. તે પરિણામો બતાવે છે કે ટીમ તમને શું બતાવવા માંગે છે, પરંતુ તે વાસ્તવિક દુનિયાના પરીક્ષણોમાં વિશ્વસનીયતા સાબિત કરતા નથી.

આગળ શું જોવું

  • લાયસન્સનું અંતિમ સ્વરૂપ: ઓપન-વેઇટ્સ રિલીઝની ચોક્કસ શરતો નક્કી કરશે કે સ્ટાર્ટઅપ્સ Qwen3.8-Max દ્વારા સંચાલિત પ્રોડક્ટ્સ મોકલી શકશે કે હોસ્ટેડ API પર જ રહેવું પડશે.
  • હાર્ડવેરની ઉપલબ્ધતા: જો ક્લાઉડ પ્રોવાઇડર્સ mixture-of-experts મોડેલ્સ માટે પ્રી-કોન્ફિગર્ડ ઇન્સ્ટન્સ ઓફર કરવાનું શરૂ કરશે, તો ઓન-પ્રેમ ટેસ્ટિંગનો અવરોધ નોંધપાત્ર રીતે ઘટી જશે.

મુખ્ય વાત (Takeaway)

Qwen3.8-Max નું સમાચારમાં ચર્ચામાં રહેતું કદ અને તેની મલ્ટિમોડલ ક્ષમતા એ માત્ર અડધી વાત છે; ડેવલપર્સ માટે સાચું માપદંડ એ છે કે તેનું એજન્ટ હાર્નેસ ટૂલ નિષ્ફળતાઓ, ટોકન બજેટ અને પરમિશન મર્યાદાઓને કેવી રીતે સંભાળે છે. તર્કબદ્ધ પ્રયાસ અને એક્સેસ અધિકારોમાં વિવિધતા લાવીને કરવામાં આવેલું એક શિસ્તબદ્ધ, પુનરાવર્તિત પરીક્ષણ એ દર્શાવશે કે મોડેલ તેના માર્કેટિંગ વચનો પર ખરા ઉતરે છે કે માત્ર કોડિંગ પાઇપલાઇનમાં વધુ એક ખર્ચાળ સ્તર ઉમેરે છે.