Alibaba ने Qwen3.8-Max सादर केले: AI Agents साठी २.४ ट्रिलियन पॅरामीटर्सचा एक महाकाय मॉडेल

Alibaba च्या Qwen टीमने Qwen3.8-Max ची घोषणा केली आहे, जे २.४ ट्रिलियन पॅरामीटर्सचे एक प्रचंड फ्लॅगशिप मॉडेल आहे. हे मॉडेल साध्या चॅट प्रॉम्प्ट्सच्या पलीकडे जाऊन 'long-horizon autonomous reasoning' (दीर्घकालीन स्वायत्त तर्कशक्ती) कडे वळण्यासाठी डिझाइन केलेले आहे. अनेक दिवसांच्या वर्कफ्लो आणि जटिल कार्य अंमलबजावणीवर लक्ष केंद्रित करून, हे मॉडेल रिअॅक्टिव्ह LLMs कडून प्रोअॅक्टिव्ह AI agents कडे होणाऱ्या महत्त्वपूर्ण बदलाचे प्रतीक आहे.

स्वायत्त बुद्धिमत्तेसाठी पॅरामीटर्सचे स्केलिंग

Qwen3.8-Max हे तांत्रिकदृष्ट्या अत्यंत शक्तिशाली मॉडेल आहे, ज्यामध्ये एकूण २.४ ट्रिलियन पॅरामीटर्सचा वापर केला असून प्रत्येक क्वेरीसाठी ९५ अब्ज सक्रिय पॅरामीटर्स उपलब्ध आहेत. Qwen3.5 आर्किटेक्चरवर आधारित, हे मॉडेल विशेषतः "long-horizon" कामांसाठी ऑप्टिमाइझ केलेले आहे—अशी जटिल उद्दिष्टे ज्यासाठी AI ला दिवस किंवा आठवडे स्वतंत्रपणे काम करणे आवश्यक असते.

ओपन-सोर्स समुदायासाठी एक महत्त्वपूर्ण पाऊल उचलत, Alibaba ने पुष्टी केली आहे की Qwen-Max क्लासचे weights पुढील आठवड्यात सार्वजनिकरित्या उपलब्ध करून दिले जातील, ज्यामुळे GPT आणि Claude सारख्या 'closed-door' फ्रंटियर मॉडेल्सच्या वर्चस्वतेला आव्हान मिळेल.

कोडिंग आणि संशोधनाद्वारे स्वायत्ततेची सिद्धता

आपली 'agentic' क्षमता प्रदर्शित करण्यासाठी, Alibaba ने काही उच्च-स्तरीय केस स्टडीज सादर केल्या, जिथे मॉडेलने मानवी हस्तक्षेपाशिवाय काम केले:

  • Software Engineering: १६ दिवसांच्या कालावधीत, Qwen3.8-Max ने oh-my-cli हे कमांड-लाइन टूल स्वायत्तपणे विकसित केले. त्याने स्वतःचे GitHub issues व्यवस्थापित केले, कोड लिहिला, टेस्ट्स चालवल्या आणि २६५ commits आणि १२७ pull requests कार्यान्वित केले.
  • Scientific Reproduction: "Unified Data Selection for LLM Reasoning" या शोधनिबंधाचे निकाल पुन्हा मिळवण्याचे (reproducing) काम सोपवल्यानंतर, मॉडेलने ७,६०० ओळींचा कोड लिहिण्यासाठी १२५ तास कम्प्युट टाइम खर्च केला. त्याने केवळ मूळ संशोधन पुनरुत्पादित केले नाही, तर AIME24 गणित बेंचमार्क स्कोअरमध्ये २.७ गुणांची सुधारणा केली.
  • Competitive Data Science: WWW2025 Multimodal Dialogue Intent Recognition Challenge मध्ये, मॉडेलने ५२६ मानवी टीम्सपैकी ४५८ टीम्सना मागे टाकले आणि २४ तासांच्या आत आपली अचूकता ०.६० वरून ०.८५३ पर्यंत वाढवली.

सॉफ्टवेअरच्या पलीकडे: चिप डिझाइन आणि आर्थिक सिम्युलेशन

Qwen3.8-Max ची तर्कशक्ती हार्डवेअर आणि अर्थशास्त्रामध्येही विस्तारलेली आहे. एका क्रिप्टोग्राफिक सर्किट डिझाइन टास्कमध्ये, मॉडेलने 'bloated' (अनावश्यकरीत्या मोठे) डिझाइन ८,२९८ लॉजिक गेट्सपासून कमी करून केवळ ६७८ गेट्सपर्यंत आणले. OpenROAD टूलचा वापर करून, यामुळे फिजिकल चिप क्षेत्रात (physical chip area) ८१% घट झाली.

E-Commerce-Bench नावाच्या एका जटिल रिटेल सिम्युलेशनमध्ये, मॉडेलने सिम्युलेटेड आर्थिक वर्षात अनेक ऑनलाइन स्टोअर्सचे व्यवस्थापन केले. १,००,००० युआनपासून सुरुवात करून, त्याने पुरवठादार वाटाघाटी केल्या, १५२ स्कॅमर्सना ओळखले आणि सप्लाय चेनमधील व्यत्यय व्यवस्थापित केले, ज्यामुळे शेवटी ४,१६,२५२ युआन जमा झाले—याचा अर्थ सुरुवातीच्या भांडवलाची चौपट वाढ झाली आणि त्याने उपविजेता GLM 5.2 ला मागे टाकले.

मल्टीमोडल सीमा आणि बेंचमार्क वर्चस्व

हे मॉडेल मल्टीमोडल प्रोसेसिंगच्या सीमा देखील विस्तारते, जे २०० पानांचे दस्तऐवज आणि १०० तासांपेक्षा जास्त लांबीचे व्हिडिओ हाताळण्यास सक्षम आहे. Alibaba RecreationBench देखील सादर करत आहे, जो एक असा बेंचमार्क आहे जो सोर्स कोडशिवाय केवळ व्हिज्युअल आणि कीबोर्ड इंटरअॅक्शनद्वारे चालू असलेल्या ॲप्लिकेशन्सना (Windows, macOS, Android, इत्यादींवर) पुनर्रचित करण्याची एजंटची क्षमता तपासतो.

अंतर्गत बेंचमार्कनुसार, Qwen3.8-Max थेट उच्च-स्तरीय मॉडेल्सशी स्पर्धा करते, आणि PaperBench वर ९३ या अग्रगण्य स्कोअरसह, अनेक श्रेणींमध्ये Claude Opus 4.8 आणि GPT-5.6 Sol च्या जवळ किंवा त्यांच्या वर आहे.

मुख्य मुद्दे

  • Massive Scale: Qwen3.8-Max मध्ये एकूण २.४ ट्रिलियन पॅरामीटर्स आणि ९५ अब्ज सक्रिय पॅरामीटर्स आहेत, जे बहु-दिवसीय स्वायत्त वर्कफ्लोसाठी ऑप्टिमाइझ केलेले आहेत.
  • Agentic Mastery: मॉडेलने जटिल सॉफ्टवेअर इंजिनिअरिंग, चिप डिझाइन ऑप्टिमायझेशन आणि पूर्ण-स्तरीय आर्थिक व्यवस्थापन स्वायत्तपणे हाताळण्याची क्षमता प्रदर्शित केली आहे.
  • Open-Weight Impact: अनेक फ्रंटियर मॉडेल्सच्या उलट, Alibaba Qwen-Max क्लासचे weights रिलीज करण्याची योजना आखत आहे, ज्यामुळे डेव्हलपर्सना उच्च-स्तरीय 'agentic intelligence' चा अभूतपूर्व प्रवेश मिळेल.