علی بابا نے Qwen3.8-Max متعارف کرایا ہے، جو کہ 2.4 ٹریلین پیرامیٹر والا Mixture-of-Experts (MoE) ماڈل ہے جس نے OSWorld-Verified بینچ مارک پر 86.1% کامیابی کی شرح حاصل کی ہے—علی بابا کا کہنا ہے کہ یہ اسکور GPT-5.6، Sol Max اور Fable 5 سے بہتر ہے۔ یہ بینچ مارک ایک AI کی آپریٹنگ سسٹم کے ساتھ بات چیت کرنے، سافٹ ویئر انسٹال کرنے اور کوڈ ڈی بگ (debug) کرنے کی صلاحیت کی پیمائش کرتا ہے، یہ وہ مہارتیں ہیں جو خود مختار سافٹ ویئر انجینئرنگ ایجنٹس کی بنیاد بنتی ہیں۔
خود مختار ایجنٹس کی دوڑ
بڑے لینگویج ماڈلز اب چیٹ اسٹائل اسسٹنٹس سے آگے بڑھ کر ایسے ٹولز بن چکے ہیں جو کوڈ لکھ سکتے ہیں، ٹیسٹ کر سکتے ہیں اور یہاں تک کہ اسے ڈیپلائے (deploy) بھی کر سکتے ہیں۔ وہ کمپنیاں جو روٹین انجینئرنگ کے کام قابلِ اعتماد طریقے سے AI کے سپرد کر سکتی ہیں، وہ عملے کے اخراجات میں کمی اور پروڈکٹ سائیکلز کو تیز کرنے کے قابل ہوں گی۔ OSWorld-Verified بینچ مارک "ایجنٹک" (agentic) صلاحیت کے لیے ایک ڈی فیکٹو (de-facto) معیار بن گیا ہے کیونکہ اس کے لیے محض ساکن متن کی تخلیق سے زیادہ، ایک سسٹم کے ساتھ حقیقی دنیا میں بات چیت کی ضرورت ہوتی ہے۔
Qwen3.8-Max کیا لاتا ہے
- 2.4 ٹریلین پیرامیٹرز کے ساتھ MoE آرکیٹیکچر – ہر ٹوکن کے لیے 64 تک ماہر سب نیٹ ورکس سے رجوع کیا جا سکتا ہے، ایک ایسا ڈیزائن جس کے بارے میں علی بابا کا دعویٰ ہے کہ یہ کمپیوٹ اخراجات میں تقریباً 40% کمی کرتا ہے۔
- ملٹی موڈل پرامپٹ ہینڈلنگ – یہ ماڈل متن، تصاویر اور منظم ڈیٹا کو ایک ساتھ قبول کرتا ہے، جس سے ایک ہی درخواست کے ذریعے UI کی وضاحت کرنا، اسکرین شاٹ دکھانا اور کنفیگریشن فائلیں فراہم کرنا ممکن ہو جاتا ہے۔
- 64k ٹوکن کانٹیکسٹ ونڈو – مکمل کوڈ بیسز، لاگ فائلز یا طویل تکنیکی رپورٹوں کو ٹکڑوں میں تقسیم کیے بغیر رکھنے کے لیے کافی جگہ۔
یہ خصوصیات ان "اینڈ ٹو اینڈ" (end-to-end) ورک فلو کو نشانہ بناتی ہیں جن پر سافٹ ویئر ٹیمیں گھنٹوں صرف کرتی ہیں: جیسے کہ ڈیپینڈنسیز (dependencies) حاصل کرنا، لاگز اسکین کرنا، بگ پچ کرنا اور دستاویزات تیار کرنا۔
اعداد و شمار کا باریک بینی سے جائزہ
| ٹاسک | رپورٹ شدہ میٹرک |
|---|---|
| OSWorld-Verified (ایجنٹک OS تعامل) | 86.1% کامیابی |
| Code generation (HumanEval-Plus) | 78.4% پاس |
| Multimodal reasoning (MM-Bench) | 84.3% |
| Long-context summarization (50k-token ٹیسٹ) | 90.2% |
تمام اعداد و شمار علی بابا کی اندرونی ٹیسٹنگ سے لیے گئے ہیں۔ اگر یہ درست ثابت ہوتے ہیں، تو یہ ماڈل اداروں کو ایک ایسا واحد API فراہم کرے گا جو کوڈ، تصاویر اور بڑے دستاویزات کو سنبھال سکتا ہے، جبکہ انفرنس (inference) کے اخراجات کو بہت سے ڈینس ماڈل (dense-model) حریفوں کے مقابلے میں کم رکھ سکتا ہے۔
خطرات اور آزادانہ تصدیق کی ضرورت
تیسرے فریق کی تصدیق کی عدم موجودگی سب سے فوری انتباہ ہے۔ بینچ مارکس کو کسی خاص آرکیٹیکچر کے حق میں ٹیون کیا جا سکتا ہے، پرامپٹس کو بہتر بنایا جا سکتا ہے یا ٹیسٹ سیٹس کو فلٹر کیا جا سکتا ہے۔ بیرونی نقل (replication) کے بغیر، یہ دعویٰ کہ Qwen3.8-Max، GPT-5.6 کو "ہرا دیتا ہے" عارضی ہے۔ مزید برآں، MoE ماڈلز غیر یکساں کارکردگی دکھا سکتے ہیں: کچھ ٹوکنز کم تربیت یافتہ ماہرین (experts) کی طرف بھیجے جا سکتے ہیں، جس سے کبھی کبھار ہالوسینیشن (hallucinations) یا غیر مستقل نتائج نکل سکتے ہیں—یہ وہ مسائل ہیں جو اس وقت اہمیت رکھتے ہیں جب ایک AI سے پروڈکشن سسٹم میں ترمیم کرنے کی توقع کی جاتی ہے۔
آگے کیا دیکھنا ہے
- آزادانہ نقل (Independent replication) – محققین اور کلاؤڈ صارفین ممکنہ طور پر عوامی طور پر دستیاب ہارڈ ویئر پر وہی OSWorld-Verified سوٹ اور HumanEval-Plus ٹیسٹ چلائیں گے۔
- قیمت اور لیٹنسی (Latency) – علی بابا کلاؤڈ کی API قیمتیں یہ ظاہر کریں گی کہ آیا 40% کمپیوٹ کی بچت ڈویلپرز کے لیے ٹھوس لاگت کا فائدہ ثابت ہوتی ہے یا نہیں۔
- حفاظت کے لیے ٹولنگ – جیسے جیسے خود مختار ایجنٹس انفراسٹرکچر پر زیادہ کنٹرول حاصل کریں گے، ایکو سسٹم کو مانیٹرنگ، رول بیک (rollback) اور آڈٹ میکانزم کی ضرورت ہوگی جو ابھی ابتدائی مراحل میں ہیں۔
اگر Qwen3.8-Max اپنے اہم اعداد و شمار پر پورا اترتا ہے، تو ایک بات چیت کرنے والے اسسٹنٹ اور ایک خود کفیل انجینئرنگ بوٹ کے درمیان فرق تیزی سے کم ہو جائے گا۔ اگلے چند مہینے یہ ظاہر کریں گے کہ آیا ماڈل کی کارکردگی جانچ پڑتال پر پورا اترتی ہے اور آیا ادارے اسے اپنے خودکار ڈویلپمنٹ پائپ لائنز کی ریڑھ کی ہڈی کے طور پر اپناتے ہیں۔
