علی بابا نے 3 اگست کو Qwen3.8-Max جاری کیا۔ یہ ایک mixture-of-experts ماڈل ہے جو 2.4 ٹریلین پیرامیٹرز تک پھیلتا ہے لیکن انفرنس کے وقت صرف 95 بلین فعال ہوتے ہیں۔ یہ ماڈل QwenCloud گیٹ وے کے ذریعے تصاویر اور متن قبول کرتا ہے، اور علی بابا کا کہنا ہے کہ اس کے weights اگلے ہفتے عوامی طور پر دستیاب ہوں گے۔
یہ پرجوش سرخی ایک مشکل سوال کو چھپاتی ہے: کیا ماڈل کا ایجنٹ اس وقت قابل اعتماد طریقے سے کوڈ لکھ سکتا ہے جب وہ ٹولز جن پر وہ انحصار کرتا ہے، ناکام ہو جائیں؟ وینڈر ڈیمو دس دن کے مکمل طور پر خود مختار کوڈنگ اسپرنٹ کو دکھاتے ہیں جس نے شروع سے ایک پروجیکٹ بنایا، لیکن وہ تجربات علی بابا کے اپنے انفراسٹرکچر پر اور مثالی اجازتوں کے تحت کیے گئے تھے۔ حقیقی دنیا کے ڈویلپرز کو یہ جاننے کی ضرورت ہے کہ جب ٹوکن کی حدود تنگ ہوں، ٹول کالز ناکام ہوں، یا رائٹ ایکسیس (write access) محدود ہو، تو سسٹم کیسا برتاؤ کرتا ہے۔
یہ ہائپ کیوں اہم ہے
Mixture-of-experts ڈیزائن ایک بڑے پیرامیٹر پول کو اس وقت تک غیر فعال رہنے دیتے ہیں جب تک کہ کسی مخصوص "ایکسپرٹ" کو بلایا نہ جائے، جس سے انفرنس کی لاگت اسی سائز کے ڈینس (dense) ماڈل کے مقابلے میں کم رہتی ہے۔ ملٹی موڈل ان پٹ کوڈ جنریشن سے آگے کے استعمال کے کیسز کو وسعت دیتا ہے، جس سے ڈویلپرز ایک ہی پرامپٹ میں ڈائیگرام یا اسکرین شاٹس دے سکتے ہیں۔
لیکن یہ وعدہ اس ایجنٹ لیئر پر منحصر ہے جو فائل ایڈیٹرز، کمپائلرز، ٹیسٹ رنرز اور ورژن کنٹرول کمانڈز کو منظم کرتی ہے۔ اگر وہ لیئر کسی ناکام ٹول کال سے ریکور نہیں کر سکتی، تو کوڈنگ کا پورا سیشن تباہ ہو جاتا ہے۔
وہ حصہ جو غائب ہے: reasoning effort knob
Qwen3.8-Max تین "reasoning effort" پری سیٹس کے ساتھ آتا ہے—low، medium، اور xhigh۔ یہ سیٹنگز رفتار کے بدلے جواب کے معیار اور، سب سے اہم بات، ان ٹوکنز کی تعداد کے درمیان توازن پیدا کرتی ہیں جو ماڈل جاری کرے گا۔
ایک قابلِ اعادہ ٹیسٹ پلان
مارکیٹنگ کے دعووں کی حقیقت جاننے کے لیے، ایک مقررہ ٹوکن بجٹ کے ساتھ درج ذیل عملی پروٹوکول آزمائیں:
- ایک نئی ریپوزٹری بنائیں جس میں کسی بھی زبان میں ایک سادہ "hello world" اسکیفولڈ ہو۔
- ایجنٹ کو پرامپٹ دیں تاکہ وہ ایک نیا فیچر (مثلاً، ایک REST endpoint) شامل کرے اور اس کے ذریعے تیار کردہ ہر پلان، اس کی ہر ٹول کال، اور اس کی چھوئی گئی ہر فائل کو ریکارڈ کریں۔
- پہلی ناکامی پر روک دیں—مثال کے طور پر، جب کمپلیشن ایرر ظاہر ہو—ماڈل کی اندرونی حالت (internal state) کو محفوظ کریں، پھر اسی چیک پوائنٹ سے دوبارہ شروع کریں۔
- ہر reasoning effort سیٹنگ کے تحت رن کو دہرائیں، اور کل ٹوکنز، گزرے ہوئے وقت (wall-clock time)، اور کسی بھی ٹول لیول کی غلطیوں کو نوٹ کریں۔
- ایک بار میں اجازتوں کو محدود کریں (صرف پڑھنے کی رسائی/read-only access) اور دوسری بار مکمل رائٹ ایکسیس دیں، تاکہ دیکھا جا سکے کہ ایجنٹ کیسے مطابقت پیدا کرتا ہے۔
- ری ٹرائیز (retries) کو لاگ کریں: ماڈل کتنی بار ناکام ٹول کو دوبارہ کال کرتا ہے بمقابلہ اسے منسوخ کرنے کے؟
یہ میٹرکس جمع کرنے سے آپ خام کوڈنگ آؤٹ پٹ کا غلطیوں کو سنبھالنے کی پوشیدہ لاگت کے ساتھ موازنہ کر سکتے ہیں۔ اگر ایجنٹ بار بار ایک غیر مستحکم (flaky) linter کو دوبارہ کوشش کرتا ہے، تو ٹوکن کا بل بڑھ جائے گا چاہے حتمی کوڈ ٹھیک ہی کیوں نہ نظر آئے۔
اعداد و شمار کیا چھپاتے ہیں
95B ایکٹو پیرامیٹر کا ہندسہ براہ راست ڈالر کی رقم میں تبدیل نہیں ہوتا۔ وہ ٹول کالز جو غلطیاں واپس کرتی ہیں، ماڈل کو اصلاحی پرامپٹس تیار کرنے پر مجبور کرتی ہیں، جس سے ٹوکن کا استعمال بڑھ جاتا ہے۔ پائیدار اسٹیٹ (durable state)—یعنی وقتاً فوقتاً چیک پوائنٹس جو آپ کو کریش کے بعد دوبارہ شروع کرنے کی اجازت دیں—کے بغیر، ایک ناکامی کی لاگت بڑھتی جا سکتی ہے۔
اوپن ویٹس (Open-weights) کی احتیاطی تدبیر
اگلے ہفتے ویٹس جاری کرنے کا علی بابا کا وعدہ آن پریم ڈیپلائمنٹ (on-prem deployment) کی دعوت دیتا ہے، لیکن دو عملی رکاوٹیں باقی ہیں۔ پہلا، لائسنس تجارتی استعمال کو محدود کر سکتا ہے یا ایٹریبیوشن (attribution) کا تقاضا کر سکتا ہے؛ ڈویلپرز کو ماڈل کو کسی پروڈکٹ میں شامل کرنے سے پہلے اسے پڑھنا چاہیے۔ دوسرا، 2.4 T-پیرامیٹر والے mixture-of-experts سسٹم کو چلانے کے لیے اب بھی ہائی اینڈ GPUs یا خصوصی ایکسلیریٹرز کی ضرورت ہوتی ہے۔ ابتدائی صارفین کو "لوکل ڈیپلائمنٹ" کے دعووں کو عارضی سمجھنا چاہیے جب تک کہ اصل ہارڈ ویئر کی ضروریات اور کارکردگی کے اعداد و شمار کی تصدیق نہ ہو جائے۔
جوابی دلیل: وینڈر کا نقطہ نظر
علی بابا کے اندرونی ٹیسٹ ماڈل کو دس دن کے خود مختار کوڈنگ میراتھن کو مکمل کرتے ہوئے دکھاتے ہیں، جس میں انسانی مداخلت کے بغیر ایشو ٹریاج (issue triage)، کوڈ جنریشن، اور ٹیسٹ ایگزیکیوشن شامل ہے۔ وہ نتائج وہی دکھاتے ہیں جو ٹیم آپ کو دکھانا چاہتی ہے، لیکن وہ حقیقی دنیا کے ٹیسٹ میں قابل اعتماد ہونے کا ثبوت نہیں دیتے۔
آگے کیا نظر آئے گا
- لائسنس کی حتمی شکل: اوپن ویٹس ریلیز کی درست شرائط یہ فیصلہ کریں گی کہ آیا اسٹارٹ اپس Qwen3.8-Max سے چلنے والی مصنوعات لانچ کر سکتے ہیں یا انہیں ہوسٹڈ API پر ہی رہنا ہوگا۔
- ہارڈ ویئر کی دستیابی: اگر کلاؤڈ فراہم کنندگان mixture-of-experts ماڈلز کے لیے پہلے سے کنفیگر شدہ انسٹنس پیش کرنا شروع کر دیتے ہیں، تو آن پریم ٹیسٹنگ کی رکاوٹ نمایاں طور پر کم ہو جائے گی۔
خلاصہ
Qwen3.8-Max کا شہرت یافتہ سائز اور ملٹی موڈل صلاحیتیں کہانی کا صرف آدھا حصہ ہیں؛ ڈویلپرز کے لیے اصل پیمانہ یہ ہے کہ اس کا agent harness ٹول کی ناکامیوں، ٹوکن بجٹ اور اجازت کی حدود کو کس طرح سنبھالتا ہے۔ ایک منظم اور قابلِ اعادہ ٹیسٹ—جس میں استدلال کی کوشش اور رسائی کے حقوق میں تبدیلی کی جائے—یہ ظاہر کرے گا کہ آیا یہ ماڈل اپنی مارکیٹنگ کے وعدوں پر پورا اترتا ہے یا محض کوڈنگ پائپ لائن میں ایک اور مہنگا مرحلہ شامل کر دیتا ہے۔
