ایک RTX 5090 پر مقامی طور پر چلائے گئے پانچ LLM ایجنٹس کے بینچ مارک سے پتہ چلتا ہے کہ 35 بلین پیرامیٹر والے mixture-of-experts (MoE) ماڈل نے ایک حقیقی کوڈنگ ٹاسک میں اپنے ساتھیوں کو پیچھے چھوڑ دیا۔ اس ٹیسٹ میں، جس میں کسی بھی کلاؤڈ API کے بغیر ایک موجودہ ایڈمن پینل میں Tag Manager شامل کیا گیا، Qwen 3.6 35B-A3B کو واضح فاتح قرار دیا گیا۔
یہ ٹیسٹ کیوں اہم ہے
ذاتی ہارڈ ویئر پر بڑے لینگویج ماڈلز چلانے سے ڈویلپرز API فیس اور ڈیٹا پرائیویسی کی चि ہوئی سے بچ سکتے ہیں۔ پھر بھی "لوکل ایجنٹس" (local agents) ایک محض اصطلاح (buzzword) بنے ہوئے ہیں: کیا وہ واقعی انسانی مداخلت کے بغیر فائلیں ایڈٹ کر سکتے ہیں، کمانڈ لائن ٹولز چلا سکتے ہیں، اور پروڈکشن کے قابل کوڈ تیار کر سکتے ہیں؟ کلاؤڈ سروسز کے بغیر یہ عملی موازنہ ڈویلپرز کو یہ ٹھوس اندازہ دیتا ہے کہ ٹیکنالوجی اس وقت کہاں کھڑی ہے۔
ہارڈ ویئر اور ٹاسک
پانچوں ماڈلز ایک ہی ورک اسٹیشن پر چلے: ایک RTX 5090 GPU، جو کہ ایک عام ہائی اینڈ کنزیومر کارڈ ہے، اور کوئی بیرونی سروسز استعمال نہیں کی گئیں۔ ٹاسک جان بوجھ کر سادہ لیکن نمائندہ رکھا گیا تھا – ایک پہلے سے بنے ہوئے ایڈمن سیکشن میں Tag Manager کمپوننٹ شامل کرنا۔ کامیابی کے لیے ضروری تھا کہ ماڈل درست سورس فائلیں تلاش کرے، انہیں ایڈٹ کرے، اور اس بات کی تصدیق کرے کہ نیا فیچر موجودہ فنکشنلٹی کو خراب کیے بغیر انٹیگریٹ ہو گیا ہے۔
ماڈل کی کارکردگی
- Qwen 3.6 35B-A3B (MoE) – کام کو خود مختارانہ طور پر مکمل کیا، وہ معقول بہتری بھی شامل کی جس کی درخواست نہیں کی گئی تھی، اور اسے رن ہونے کے بعد کسی پیچ (patch) کی ضرورت نہیں پڑی۔
- Qwen 3.6 27B (dense) – ٹاسک مکمل کیا لیکن اس میں تقریباً دوگنا انٹرایکشن اسٹیپس لگے اور کبھی کبھار ہدایات کا غلط مطلب نکالا۔
- GLM-4.7-Flash (dense) – ایک کام کرنے والا امپلیمنٹیشن تیار کیا لیکن غلط فائل میچنگ پیٹرنز استعمال کیے اور سیکیورٹی چیکز کو نظر انداز کر دیا، جس سے کوڈ غیر محفوظ ہو گیا۔
- Qwythos-9B – کوئی بھی حقیقی ٹول استعمال نہیں کیا؛ یہ ناکامی خود ماڈل یا لوکل سیٹ اپ کی وجہ سے ہو سکتی ہے، لیکن ٹیسٹ اس کی وجہ کا تعین نہیں کر سکا۔
- Nemotron-3-Nano (hybrid) – ایک لوپ میں پھنس گیا، ایک ایسے فولڈر کو تلاش کرنے میں 40 ٹرنز ضائع کیے جسے وہ پہلے ہی تلاش کر چکا تھا، اور اس سے آگے کبھی نہیں بڑھ سکا۔
نتائج کیا ظاہر کرتے ہیں
آرکیٹیکچر ایک قابل اعتماد پیشگوئی کرنے والا عنصر نہیں ہے
MoE ماڈل، جو اپنے پیرامیٹرز کو متعدد ایکسپرٹ سب نیٹ ورکس میں تقسیم کرتا ہے، مکمل طور پر جیت گیا، جبکہ ڈینس (dense) اور ہائبرڈ (hybrid) ورژنز کامیابی اور مکمل ناکامی کے درمیان تقسیم رہے۔ اس سے پتہ چلتا ہے کہ محض آرکیٹیکچر کے انتخاب سے ٹول استعمال کرنے کی مہارت کی ضمانت نہیں ملتی۔
ٹول کا استعمال اب بھی ایک بڑا مسئلہ ہے
پانچوں ایجنٹس میں سے کسی نے بھی ٹیسٹ کے لیے فراہم کردہ مخصوص اسکرین شاٹ ٹول کا استعمال نہیں کیا۔ سب نے یا تو فائل کے ناموں کا اندازہ لگا کر یا بالواسطہ طریقوں (workarounds) کی کوشش کر کے خود سے کام کرنے کی کوشش کی۔ "کوڈ تیار کر سکتا ہے" اور "بیرونی یوٹیلیٹیز کو منظم کر سکتا ہے" کے درمیان فرق اب بھی بہت زیادہ ہے۔
مقامی طور پر چلانے کا مطلب صرف ماڈل نہیں بلکہ پورے اسٹیک کی ڈیبگنگ کرنا ہے
دو ماڈلز کے لیے ٹیسٹ شروع ہونے سے پہلے ہی ان کے پرامپٹ ٹیمپلیٹس میں فوری طور پر پیچ (patches) لگانے کی ضرورت پڑی۔ ماڈل سے متعلق مخصوص بگ (bugs) کو ٹھیک کرنے میں لگنے والی محنت اصل Tag Manager کوڈ لکھنے کے وقت سے زیادہ تھی، جو یہ ظاہر کرتی ہے کہ موجودہ لوکل ڈیپلائمنٹس کتنی نازک ہیں۔
احتیاطی نوٹ
یہ بینچ مارک ایک ہی ہارڈ ویئر کنفیگریشن، ایک ہی کوڈنگ منظر نامے اور ماڈلز کے ایک چھوٹے سے مجموعے کی عکاسی کرتا ہے۔ Qwen 3.6 35B-A3B پچھلے ایک راؤنڈ میں ناکام رہا تھا؛ اس کی پچھلی ناکامی محض ایک اتفاق تھی۔ لہذا، یہ نتائج اشارہ کرنے والے ہیں، حتمی نہیں۔
آگے کیا دیکھنا ہے
مستقبل کے راؤنڈز میں ٹاسک سیٹ کو وسعت دینے، مزید متنوع ٹول چینز شامل کرنے اور ہارڈ ویئر کی وسیع رینج پر ٹیسٹ کرنے کی ضرورت ہوگی۔ مبصرین کو اس بات پر نظر رکھنی چاہیے کہ آیا MoE ماڈلز مستقل طور پر ڈینس اور ہائبرڈ ڈیزائنز سے بہتر کارکردگی دکھاتے ہیں، اور کیا ڈویلپرز ایسے قابل اعتماد ریپرز (wrappers) بنا سکتے ہیں جو دستی طور پر بگ پیچنگ کی ضرورت کو ختم کر دیں۔
خلاصہ: ایک 35B MoE ماڈل پہلے سے ہی ایک ماہر مقامی کوڈنگ اسسٹنٹ کے طور پر کام کر سکتا ہے، لیکن وسیع تر ایکو سسٹم—ٹول انٹیگریشن، پرامپٹ انجینئرنگ، اور مستحکم رن ٹائم—اب بھی پیچھے ہے۔ جب تک یہ تمام حصے ایک ساتھ نہیں جڑ جاتے، ڈویلپرز کو "پلگ اینڈ پلے" لوکل ایجنٹس کے بارے میں اپنی توقعات کو حقیقت پسندانہ رکھنا چاہیے۔
