Alibaba એ Qwen3.8-Max રજૂ કર્યું: AI એજન્ટ્સ માટે 2.4 ટ્રિલિયન પેરામીટર ધરાવતું એક વિશાળ મોડેલ

Alibaba ની Qwen ટીમે Qwen3.8-Max ની જાહેરાત કરી છે, જે એક વિશાળ 2.4 ટ્રિલિયન પેરામીટર ધરાવતું ફ્લેગશિપ મોડેલ છે. તેને સાદા ચેટ પ્રોમ્પ્ટ્સથી આગળ વધીને લાંબા ગાળાના સ્વાયત્ત તર્ક (long-horizon autonomous reasoning) તરફ લઈ જવા માટે ડિઝાઇન કરવામાં આવ્યું છે. મલ્ટી-ડે વર્કફ્લો અને જટિલ કાર્યોના અમલીકરણ પર ધ્યાન કેન્દ્રિત કરીને, આ મોડેલ રિએક્ટિવ LLMs થી પ્રોએક્ટિવ AI એજન્ટ્સ તરફનું એક મહત્વપૂર્ણ પરિવર્તન દર્શાવે છે.

સ્વાયત્ત બુદ્ધિ માટે પેરામીટર્સનું સ્કેલિંગ

Qwen3.8-Max એક ટેકનિકલ પાવરહાઉસ છે, જે કુલ 2.4 ટ્રિલિયન પેરામીટર્સનો ઉપયોગ કરે છે અને દરેક ક્વેરી દીઠ 95 બિલિયન એક્ટિવ પેરામીટર્સ ધરાવે છે. Qwen3.5 આર્કિટેક્ચર પર આધારિત, આ મોડેલ ખાસ કરીને "long-horizon" કાર્યો માટે ઓપ્ટિમાઇઝ કરવામાં આવ્યું છે—એવા જટિલ ઉદ્દેશ્યો જેમાં AI એ દિવસો અથવા અઠવાડિયા સુધી સ્વતંત્ર રીતે કાર્ય કરવાની જરૂર હોય છે.

ઓપન-સોર્સ સમુદાય માટે એક મહત્વપૂર્ણ પગલામાં, Alibaba એ પુષ્ટિ કરી છે કે Qwen-Max ક્લાસના weights આવતા અઠવાડિયે સાર્વજનિક રીતે ઉપલબ્ધ કરાવવામાં આવશે, જે GPT અને Claude જેવા ફ્રન્ટિયર મોડેલ્સના બંધ દરવાજાવાળા વર્ચસ્વને પડકાર ફેંકે છે.

કોડિંગ અને સંશોધન દ્વારા સ્વાયત્તતા સાબિત કરવી

તેની એજન્ટિક ક્ષમતાઓને પ્રદર્શિત કરવા માટે, Alibaba એ કેટલાક ઉચ્ચ-જોખમવાળા કેસ સ્ટડીઝ રજૂ કર્યા છે જ્યાં મોડેલે માનવીય હસ્તક્ષેપ વિના કાર્ય કર્યું હતું:

  • Software Engineering: 16 દિવસના સમયગાળા દરમિયાન, Qwen3.8-Max એ સ્વાયત્ત રીતે oh-my-cli કમાન્ડ-લાઇન ટૂલ વિકસાવ્યું. તેણે તેના પોતાના GitHub issues સંભાળ્યા, કોડ લખ્યો, ટેસ્ટ ચલાવ્યા અને 265 commits તથા 127 pull requests પૂર્ણ કર્યા.
  • Scientific Reproduction: "Unified Data Selection for LLM Reasoning" પેપરના પરિણામોનું પુનરાવર્તન કરવાના કાર્યમાં, મોડેલે 7,600 લાઇન્સનો કોડ લખવા માટે 125 કલાકનો કમ્પ્યુટ સમય વિતાવ્યો. તેણે માત્ર મૂળ સંશોધનનું પુનરાવર્તન જ નથી કર્યું, પરંતુ AIME24 મેથ બેન્ચમાર્ક સ્કોરમાં 2.7 પોઈન્ટ્સનો સુધારો પણ કર્યો છે.
  • Competitive Data Science: WWW2025 Multimodal Dialogue Intent Recognition Challenge માં, મોડેલે 526 માનવ ટીમોમાંથી 458 ટીમોને પાછળ છોડી દીધી હતી, અને 24 કલાકની અંદર તેની ચોકસાઈ (accuracy) 0.60 થી વધારીને 0.853 કરી હતી.

સોફ્ટવેરથી આગળ: ચિપ ડિઝાઇન અને નાણાકીય સિમ્યુલેશન

Qwen3.8-Max ની તર્કશક્તિ હાર્ડવેર અને અર્થશાસ્ત્ર સુધી વિસ્તરેલી છે. એક ક્રિપ્ટોગ્રાફિક સર્કિટ ડિઝાઇન કાર્યમાં, મોડેલે 8,298 લોજિક ગેટ્સ ધરાવતા "bloated" ડિઝાઇનને ક્રમશઃ ઘટાડીને માત્ર 678 ગેટ્સ કરી દીધી. OpenROAD ટૂલનો ઉપયોગ કરીને, આના પરિણામે ફિઝિકલ ચિપ એરિયામાં 81% નો ઘટાડો થયો.

E-Commerce-Bench તરીકે ઓળખાતા એક જટિલ રિટેલ સિમ્યુલેશનમાં, મોડેલે એક સિમ્યુલેટેડ નાણાકીય વર્ષ દરમિયાન અનેક ઓનલાઇન સ્ટોર્સનું સંચાલન કર્યું. 100,000 yuan થી શરૂ કરીને, તેણે સપ્લાયર સાથેની વાટાઘાટો કરી, 152 સ્કેમર્સને ઓળખ્યા અને સપ્લાય ચેઇનમાં આવતા અવરોધોનું સંચાલન કર્યું, જેના પરિણામે તે 416,252 yuan સાથે સમાપ્ત થયું—જે તેની પ્રારંભિક મૂડી કરતાં ચાર ગણું હતું અને તે રનર-અપ GLM 5.2 કરતા નોંધપાત્ર રીતે શ્રેષ્ઠ સાબિત થયું.

મલ્ટિમોડલ સીમાઓ અને બેન્ચમાર્ક વર્ચસ્વ

આ મોડેલ મલ્ટિમોડલ પ્રોસેસિંગની સીમાઓને પણ વિસ્તારતું છે, જે 200 પાનાના દસ્તાવેજો અને 100 કલાકથી વધુ લાંબા વીડિયો હેન્ડલ કરવામાં સક્ષમ છે. Alibaba RecreationBench પણ રજૂ કરી રહ્યું છે, જે એક એજન્ટની સોર્સ કોડ વગર, માત્ર વિઝ્યુઅલ અને કીબોર્ડ ઇન્ટરેક્શન દ્વારા ચાલતી એપ્લિકેશન્સ (Windows, macOS, Android વગેરે પર) ને ફરીથી બનાવવા (reconstruct) કરવાની ક્ષમતાનું પરીક્ષણ કરે છે.

આંતરિક બેન્ચમાર્ક મુજબ, Qwen3.8-Max સીધા જ ટોપ-ટિયર મોડેલ્સ સાથે સ્પર્ધા કરે છે, જે PaperBench પર 93 ના અગ્રણી સ્કોર સહિત અનેક કેટેગરીમાં Claude Opus 4.8 અને GPT-5.6 Sol ની નજીક અથવા તેનાથી ઉપર પહોંચે છે.

મુખ્ય મુદ્દાઓ

  • Massive Scale: Qwen3.8-Max માં કુલ 2.4 ટ્રિલિયન પેરામીટર્સ અને 95 બિલિયન એક્ટિવ પેરામીટર્સ છે, જે મલ્ટી-ડે સ્વાયત્ત વર્કફ્લો માટે ઓપ્ટિમાઇઝ કરવામાં આવ્યા છે.
  • Agentic Mastery: મોડેલે જટિલ સોફ્ટવેર એન્જિનિયરિંગ, ચિપ ડિઝાઇન ઓપ્ટિમાઇઝેશન અને સંપૂર્ણ સ્કેલના નાણાકીય સંચાલનને સ્વાયત્ત રીતે સંભાળવાની ક્ષમતા દર્શાવી છે.
  • Open-Weight Impact: ઘણા ફ્રન્ટિયર મોડેલ્સથી વિપરીત, Alibaba Qwen-Max ક્લાસ માટેના weights રિલીઝ કરવાની યોજના ધરાવે છે, જે ડેવલપર્સને ઉચ્ચ સ્તરની એજન્ટિક ઇન્ટેલિજન્સ સુધી અભૂતપૂર્વ પહોંચ પૂરી પાડશે.