علی بابا نے Qwen3.8-Max کا انکشاف کیا: AI ایجنٹس کے لیے 2.4 ٹریلین پیرامیٹر کا ایک عظیم الشان ماڈل
علی بابا کی Qwen ٹیم نے Qwen3.8-Max کا اعلان کیا ہے، جو کہ ایک بہت بڑا 2.4 ٹریلین پیرامیٹر والا فلیگ شپ ماڈل ہے جسے سادہ چیٹ پرامپٹس سے آگے بڑھ کر طویل مدتی خود مختار استدلال (long-horizon autonomous reasoning) کے لیے ڈیزائن کیا گیا ہے۔ کئی دنوں پر محیط ورک فلو اور پیچیدہ کاموں کی تکمیل پر توجہ مرکوز کرتے ہوئے، یہ ماڈل ری ایکٹیو (reactive) LLMs سے پرو ایکٹیو (proactive) AI ایجنٹس کی طرف ایک اہم تبدیلی کی نشاندہی کرتا ہے۔
خود مختار ذہانت کے لیے پیرامیٹرز کی توسیع
Qwen3.8-Max ایک تکنیکی پاور ہاؤس ہے، جو کل 2.4 ٹریلین پیرامیٹرز کا استعمال کرتا ہے جس میں فی کوئری 95 ارب فعال (active) پیرامیٹرز شامل ہیں۔ Qwen3.5 آرکیٹیکچر پر مبنی، یہ ماڈل خاص طور پر "long-horizon" کاموں کے لیے موزوں بنایا گیا ہے—یعنی وہ پیچیدہ مقاصد جن کے لیے AI کو کئی دنوں یا ہفتوں تک آزادانہ طور پر کام کرنے کی ضرورت ہوتی ہے۔
اوپن سورس کمیونٹی کے لیے ایک اہم پیش رفت میں، علی بابا نے تصدیق کی ہے کہ Qwen-Max کلاس کے ویٹس (weights) اگلے ہفتے عوامی طور پر دستیاب کر دیے جائیں گے، جو GPT اور Claude جیسے فرنٹیر ماڈلز کے بند دروازوں کے پیچھے چھپے غلبے کو چیلنج کرے گا۔
کوڈنگ اور تحقیق کے ذریعے خود مختاری کا ثبوت
اپنی ایجنٹک صلاحیتوں کو ظاہر کرنے کے لیے، علی بابا نے کئی اہم کیس اسٹڈیز پیش کیں جہاں ماڈل نے انسانی مداخلت کے بغیر کام کیا:
- Software Engineering: 16 دنوں کے عرصے کے دوران، Qwen3.8-Max نے خود مختارانہ طور پر کمانڈ لائن ٹول
oh-my-cliتیار کیا۔ اس نے اپنے GitHub ایشوز کو خود سنبھالا، کوڈ لکھا، ٹیسٹ کیے، اور 265 کمٹس (commits) اور 127 پل ریکویسٹس (pull requests) مکمل کیں۔ - Scientific Reproduction: "Unified Data Selection for LLM Reasoning" پیپر کے نتائج کو دوبارہ حاصل کرنے کے کام کے دوران، ماڈل نے 7,600 لائنوں کا کوڈ لکھنے میں 125 گھنٹے کا کمپیوٹ ٹائم صرف کیا۔ اس نے نہ صرف اصل تحقیق کو دہرایا بلکہ AIME24 ریاضی بینچ مارک اسکور میں 2.7 پوائنٹس کا اضافہ بھی کیا۔
- Competitive Data Science: WWW2025 Multimodal Dialogue Intent Recognition Challenge میں، ماڈل نے 526 انسانی ٹیموں میں سے 458 کو پیچھے چھوڑ دیا، اور 24 گھنٹوں کے اندر اپنی درستگی (accuracy) کو 0.60 سے بڑھا کر 0.853 تک پہنچا دیا۔
سافٹ ویئر سے آگے: چپ ڈیزائن اور مالیاتی سیمولیشن
Qwen3.8-Max کی استدلال کی صلاحیت ہارڈ ویئر اور معاشیات تک پھیلی ہوئی ہے۔ ایک کرپٹوگرافک سرکٹ ڈیزائن کے کام میں، ماڈل نے مرحلہ وار ایک "بھرے ہوئے" (bloated) ڈیزائن کو 8,298 لاجک گیٹس سے کم کر کے صرف 678 گیٹس تک پہنچا دیا۔ OpenROAD ٹول کا استعمال کرتے ہوئے، اس کے نتیجے میں فزیکل چپ ایریا میں 81% کمی واقع ہوئی۔
E-Commerce-Bench نامی ایک پیچیدہ ریٹیل سیمولیشن میں، ماڈل نے ایک فرضی مالی سال کے دوران متعدد آن لائن اسٹورز کا انتظام کیا۔ 100,000 یوآن سے آغاز کرتے ہوئے، اس نے سپلائر کے ساتھ مذاکرات کیے، 152 دھوکہ بازوں کی نشاندہی کی، اور سپلائی چین کی رکاوٹوں کو سنبھالا، جس کا اختتام 416,252 یوآن پر ہوا—یعنی اپنے ابتدائی سرمائے کو چار گنا بڑھا دیا اور دوسرے نمبر پر آنے والے GLM 5.2 کو نمایاں طور پر پیچھے چھوڑ دیا۔
ملٹی موڈل سرحدیں اور بینچ مارک پر غلبہ
یہ ماڈل ملٹی موڈل پروسیسنگ کی حدود کو بھی آگے بڑھاتا ہے، جو 200 صفحات کی دستاویزات اور 100 گھنٹوں سے زیادہ کی ویڈیوز کو سنبھالنے کی صلاحیت رکھتا ہے۔ علی بابا RecreationBench بھی متعارف کروا رہا ہے، جو ایک ایسا بینچ مارک ہے جو کسی ایجنٹ کی چلنے والی ایپلی کیشنز (Windows، macOS، Android وغیرہ پر) کو صرف بصری (visual) اور کی بورڈ کے ذریعے دوبارہ ترتیب دینے کی صلاحیت کا امتحان لیتا ہے، بغیر کسی سورس کوڈ تک رسائی کے۔
اندرونی بینچ مارکس کے مطابق، Qwen3.8-Max براہ راست اعلیٰ درجے کے ماڈلز کا مقابلہ کرتا ہے، اور کئی زمروں میں Claude Opus 4.8 اور GPT-5.6 Sol کے قریب یا ان سے اوپر ہے، بشمول PaperBench پر 93 کا صف اول کا اسکور۔
اہم نکات
- Massive Scale: Qwen3.8-Max میں کل 2.4 ٹریلین پیرامیٹرز اور 95 ارب فعال پیرامیٹرز ہیں، جو کئی دنوں کے خود مختار ورک فلو کے لیے موزوں بنائے گئے ہیں۔
- Agentic Mastery: ماڈل نے پیچیدہ سافٹ ویئر انجینئرنگ، چپ ڈیزائن کی بہتری، اور مکمل پیمانے پر مالیاتی انتظام کو خود مختارانہ طور پر سنبھالنے کی صلاحیت کا مظاہرہ کیا ہے۔
- Open-Weight Impact: بہت سے فرنٹیر ماڈلز کے برعکس، علی بابا Qwen-Max کلاس کے ویٹس (weights) جاری کرنے کا منصوبہ رکھتا ہے، جس سے ڈویلپرز کو اعلیٰ درجے کی ایجنٹک ذہانت تک بے مثال رسائی حاصل ہوگی۔
