SWE-Prime یہ ظاہر کرتا ہے کہ "pass" رنز کے احتیاط سے منتخب کردہ 10 فیصد پر تربیت دینے سے ہر کامیاب ٹریجیکٹری (trajectory) کو ماڈل میں ڈالنے کے مقابلے میں زیادہ طاقتور AI ایجنٹس تیار ہوتے ہیں، جو کہ "pass" لیبل کو معیار کے ایک قابلِ اعتماد فلٹر کے طور پر استعمال کرنے کی دیرینہ عادت پر سوال اٹھاتا ہے۔

یہ نتیجہ ان تمام لوگوں کے لیے اہم ہے جو کوڈ جنریشن (code-generation) یا خودکار ڈیبگنگ (automated debugging) ایجنٹس بنا رہے ہیں: زیادہ ڈیٹا کا مطلب خود بخود بہتر کارکردگی نہیں ہے، اور صرف pass/fail کے سادہ فلگ پر سادہ لوحی سے بھروسہ کرنا درحقیقت ماڈلز کو بھٹکنے، فضول ٹول کالز کو دہرانے، اور استدلال (reasoning) کے بجائے قسمت پر انحصار کرنے کا طریقہ سکھا سکتا ہے۔

"pass" فلگ پر بھروسہ کیوں کیا جاتا رہا ہے

زیادہ تر reinforcement-learning-from-human-feedback پائپ لائنز میں، انجینئرز ایک ٹریجیکٹری (trajectory)—جو مشاہدات، اقدامات اور ٹول کے استعمال کا ایک مکمل تسلسل ہوتی ہے—کو اس وقت "pass" کے طور پر لیبل کرتے ہیں جب حتمی نتیجہ ٹیسٹ کے معیار پر پورا اترتا ہے۔ مفروضہ سادہ ہے: اگر ایجنٹ کامیاب رہا، تو اس پورے ایپی سوڈ (episode) میں مفید طرزِ عمل ہونا چاہیے۔ چنانچہ وہ ہر کامیاب رن کو ٹریننگ پول میں ڈال دیتے ہیں، اس امید کے ساتھ کہ ماڈل ان پیٹرنز کو جذب کر لے گا جو کامیابی کا باعث بنے تھے۔

یہی مفروضہ مہینوں سے سافٹ ویئر انجینئرنگ (SWE) ایجنٹس کے لیے بڑے پیمانے پر ڈیٹا اکٹھا کرنے کی رہنمائی کر رہا ہے۔ منطق ٹھوس نظر آتی ہے: ایک "pass" اس بات کی نشاندہی کرتا ہے کہ ایجنٹ نے مسئلہ حل کر لیا ہے، لہذا اس ایپی سوڈ کو ان پالیسیوں کو تقویت دینی چاہیے جنہوں نے اسے ممکن بنایا۔

SWE-Prime نے کیا مختلف کیا

SWE-Prime کے مطالعے نے اس صورتحال کو بدل کر رکھ دیا۔ محققین نے کوڈ لکھنے کے کاموں کے ایک معیاری بینچ مارک (benchmark) کو لیا اور کامیاب رنز کو دو گروہوں میں تقسیم کر دیا:

  1. تمام pass ٹریجیکٹریز – روایتی ٹریننگ سیٹ، جس میں ٹیسٹ پاس کرنے والا ہر ایپی سوڈ شامل ہے۔
  2. ایک منتخب کردہ 10 فیصد ذیلی سیٹ (subset) – مکمل سیٹ میں سے ہاتھ سے منتخب کردہ۔

دونوں گروہوں کے لیے ایک جیسی ماڈل آرکیٹیکچر پر fine-tuning کی گئی۔ جب انہیں نئے مسائل پر پرکھا گیا، تو منتخب کردہ ذیلی سیٹ پر تربیت یافتہ ماڈل نے مکمل pass سیٹ پر تربیت یافتہ ماڈل کے مقابلے میں بہتر کارکردگی دکھائی۔

وہ پیٹرنز جو "pass" لیبل کو خراب کرتے ہیں

مطالعے میں pass فلگ کے پیچھے چھپے ہوئے کئی بار بار ہونے والے ناکامی کے طریقوں (failure modes) کی فہرست بنائی گئی:

  • ٹولز کا بار بار بے جا استعمال (Repeated tool spamming) – ایک ایجنٹ درست آؤٹ پٹ حاصل کرنے سے پہلے درجنوں بار ایک ہی کمپائلر یا لنٹر (linter) کا استعمال کر سکتا ہے۔ حتمی کامیابی اس نااہلی کو چھپا دیتی ہے۔
  • طویل بھٹکنے والے مراحل (Long meandering phases) – ایجنٹس کبھی کبھی صحیح حل تک پہنچنے سے پہلے پانچ یا اس سے زیادہ غیر متعلقہ اقدامات کرتے ہیں۔ ایپی سوڈ پھر بھی "pass" پر ختم ہوتا ہے، لیکن ٹریجیکٹری کا زیادہ تر حصہ کوئی تعلیمی اہمیت نہیں رکھتا۔
  • معمولی ٹیسٹ (Trivial tests) – کچھ بینچ مارکس اتنے آسان ہوتے ہیں کہ ایک ایجنٹ محض ایک اندازے یا کسی خامی (loophole) کا فائدہ اٹھا کر کامیاب ہو سکتا ہے۔ "pass" لیبل حقیقی استدلال اور قسمت کے درمیان فرق نہیں کر پاتا۔

جب ایسے ایپی سوڈز دوبارہ ٹریننگ لوپ میں شامل ہوتے ہیں، تو ماڈل بے مقصد بھٹکنے اور ٹولز کے ضرورت سے زیادہ استعمال کو کامیابی کے ساتھ جوڑنا سیکھ لیتا ہے۔ درحقیقت، ایجنٹ "تب تک کوشش کرتے رہیں جب تک کچھ کام نہ کر جائے" والا ایک ایسا اصول (heuristic) اپنا لیتا ہے جو کہ پروڈکشن گریڈ سسٹمز کے لیے ناپسندیدہ ہے، کیونکہ انہیں کارکردگی اور وضاحت (interpretability) کی ضرورت ہوتی ہے۔

سیگمنٹ لیول کی کوالٹی بمقابلہ ٹریجیکٹری لیول کا نتیجہ

SWE-Prime سے حاصل ہونے والی ایک اہم بصیرت ٹریجیکٹری کے مجموعی نتیجے اور اس کے اجزاء (segments) کی کوالٹی کے درمیان فرق ہے۔ ٹریجیکٹری ایک غیر واضح (coarse) لیبل ہے: یہ آپ کو بتاتی ہے کہ حتمی جواب درست تھا یا نہیں، لیکن یہ اندرونی فیصلہ سازی کے عمل کو چھپا دیتی ہے۔ مطالعے میں یہ دیکھا گیا:

  • اچھی ٹریجیکٹریز میں برے سیگمنٹس ہو سکتے ہیں – ایک مؤثر حل میں چند ایسے ضائع شدہ اقدامات شامل ہو سکتے ہیں جو حتمی جواب میں کوئی حصہ نہیں ڈالتے۔
  • ناکام ٹریجیکٹریز میں بہترین سیگمنٹس چھپے ہو سکتے ہیں – ایک ایجنٹ کسی غیر متعلقہ غلطی کی وجہ سے ٹیسٹ میں ناکام ہونے سے پہلے ایک مکمل طور پر منطقی منصوبہ تیار کر سکتا ہے۔

پورے رن کے بجائے سیگمنٹس کو اسکور کر کے، محققین نے ان ایپی سوڈز کو برقرار رکھا جہاں ایجنٹ نے پہلے قدم سے ہی مقصد کے ساتھ کام کیا اور باقی کو مسترد کر دیا۔ اس سے ٹریننگ سگنل ان استدلال کے پیٹرنز کے مطابق ہو جاتا ہے جن کی ہم درحقیقت ماڈلز سے توقع رکھتے ہیں۔

لاگت اور رفتار کے فوائد

ڈیٹا کے دسویں حصے پر تربیت دینے سے کمپیوٹنگ کے اخراجات میں بھی نمایاں کمی آئی۔ ٹیم کو بہت کم GPU گھنٹوں کی ضرورت پڑی، اور پائپ لائن مکمل ہونے میں اس وقت کا محض ایک چھوٹا سا حصہ لگا جو مکمل pass سیٹ کے لیے درکار تھا۔ یہ ایک حیران کن تضاد ہے: انہوں نے کم کمپیوٹنگ اخراجات میں زیادہ بہتر کارکردگی حاصل کی۔ ان اداروں کے لیے جن کے بجٹ محدود ہیں یا جن کے بڑے پیمانے پر تعیناتی (deployment) کے اہداف ہیں، یہ بچت بہت اہمیت رکھتی ہے۔

کیوریٹیشن (Curation) کا چیلنج

اس طریقہ کار کو اپنانے میں سب سے بڑی رکاوٹ یہ ہے کہ "اچھا سیگمنٹ" کسے کہا جائے، اس کی تعریف کرنا۔ SWE-Prime کی ٹیم نے نوٹ کیا کہ کسی مہنگے ریوارڈ ماڈل کے بغیر سیگمنٹس کو اسکور کرنا مشکل ہے اور اس کے لیے ایک ذہین اور ہلکے پھلکے (lightweight) میٹرک کی ضرورت ہے۔

خلاصہ

SWE-Prime یہ ثابت کرتا ہے کہ ٹریننگ ڈیٹا کے لیے بائنری "passed the test" کا فلیگ ایک غیر قابل اعتماد فلٹر ہے۔ غیر ضروری واقعات، زائد ٹول کالز، اور انتہائی آسان رنز کو نکال کر، ڈویلپرز کمپیوٹ لاگت میں کمی لاتے ہوئے زیادہ باصلاحیت اور کارآمد ایجنٹس کو ٹرین کر سکتے ہیں۔ سبق واضح ہے: مقدار سے زیادہ معیار اہمیت رکھتا ہے، اور ذہین AI ایجنٹس کی طرف جانے والا راستہ اس بات کے باریک بینی سے جائزے میں ہے کہ ہر قدم حقیقت میں کیا حصہ ڈالتا ہے۔