SWE-bench کے اسکور دو سال سے بھی کم عرصے میں 1.96% سے بڑھ کر 72.7% ہو گئے، ایک ایسا اضافہ جسے شہ سرخیوں نے AI کوڈنگ کی صلاحیت میں 37 گنا چھلانگ کے طور پر پیش کیا ہے۔ شہ سرخی توجہ تو حاصل کرتی ہے، لیکن یہ اعداد و شمار دو مختلف امتحانات کا موازنہ کرتے ہیں، نہ کہ سافٹ ویئر انجینئرنگ کی مہارت میں کسی ایک، مستقل بہتری کا۔
اصل اعداد و شمار
2023 میں اصل SWE-bench نے 2,294 حقیقی GitHub issues پر AI ایجنٹس کا جائزہ لیا۔ یہ ٹاسک مختلف قسم کے تھے: مبہم تفصیلات، ٹوٹے ہوئے ٹیسٹ، اور بہت سے ایسے مسائل جنہیں حل کرنے میں انسان بھی جدوجہد کر سکتا ہے۔ 2025 تک اسی بینچ مارک کا نام 72.7% کے اسکور کے ساتھ سامنے آیا، لیکن ٹیسٹ کو صرف 500 ٹاسک کے ایک "Verified" ذیلی سیٹ تک محدود کر دیا گیا تھا جنہیں انسانوں نے وضاحت اور حل کرنے کے قابل ہونے کے لیے جانچ پڑتال کے بعد منتخب کیا تھا۔
ٹیسٹ کیسے بدلا
مکمل کیٹلاگ سے Verified سیٹ کی طرف منتقلی پہلا اور سب سے واضح بدلاؤ ہے۔ اصل مجموعہ اوپن سورس شراکت داری کی افراتفری والی حقیقت کو ظاہر کرنے کی کوشش کرتا تھا—ایسے issues جو نامکمل ہیں، جن کی دستاویز سازی ناقص ہے، یا جو اضافی سیاق و سباق کے بغیر محض ناممکن ہیں۔ اس کے برعکس، Verified ورژن جان بوجھ کر اس افراتفری کو فلٹر کر دیتا ہے۔ یہ مسائل کا ایک صاف ستھرا اور زیادہ قابلِ عمل سیٹ پیش کرتا ہے جہاں زیادہ اسکور حقیقت پسندانہ طور پر حاصل کیے جا سکتے ہیں۔
چونکہ دونوں ورژن مسئلے کے دائرہ کار کے مختلف حصوں کی پیمائش کرتے ہیں، اس لیے فیصد کا براہ راست موازنہ گمراہ کن ہے۔ 1.96% کا ہندسہ غیر فلٹر شدہ اور خام کام پر کارکردگی کو ظاہر کرتا ہے؛ جبکہ 72.7% کا ہندسہ ایک منتخب نمونے پر کارکردگی کو ظاہر کرتا ہے جہاں کامیابی کے امکانات بہت زیادہ ہوتے ہیں۔
ہدف شدہ انجینئرنگ
دوسرا اور باریک تر بدلاؤ اس بات میں آیا کہ ڈویلپرز نے بینچ مارک کے حوالے سے کیا طریقہ اپنایا۔ 2023 میں، کسی نے خاص طور پر SWE-bench میں کامیابی حاصل کرنے کے لیے ایجنٹس نہیں بنائے تھے؛ ٹیسٹ دنیا کے کوڈنگ چیلنجز کے ایک بے ترتیب نمونے کے طور پر کام کرتا تھا۔ 2025 تک، ٹیموں نے بینچ مارک کو ایک اسکور بورڈ میں بدل دیا۔ انہوں نے Verified سیٹ پر اچھا اسکور کرنے کے واضح مقصد کے ساتھ scaffolding، prompting حکمت عملیوں، اور fine-tuned ماڈلز تیار کیے۔
جب انجینئرز کسی خاص ٹیسٹ کو پاس کرنے کے لیے سسٹم ڈیزائن کرتے ہیں، تو اسکور یہ ظاہر کرتا ہے کہ سسٹم اس ٹیسٹ کے مطابق کتنا موزوں ہے، نہ کہ یہ کہ وہ کتنا وسیع پیمانے پر باصلاحیت ہے۔ بینچ مارک اس لمحے حقیقی دنیا کے کام کے نمائندہ نمونے کے طور پر رہنا چھوڑ گیا جب اسے "مرمت" کر کے ایک ہدف میں بدل دیا گیا۔
اس چھلانگ کا اصل مطلب کیا ہے
شہ سرخیوں میں نظر آنے والی بہتری اس لحاظ سے حقیقی ہے کہ موجودہ کوڈنگ ایجنٹس Verified ٹاسک پر اصل سیٹ کے مقابلے میں بہت بہتر کارکردگی دکھاتے ہیں۔ یہ بہتری ان مقابلوں، تحقیقی مقالوں، اور پروڈکٹ ڈیمو کے لیے اہم ہے جو اسی منتخب بینچ مارک پر انحصار کرتے ہیں۔
تاہم، یہ چھلانگ اس بات کا ثبوت نہیں ہے کہ AI ایجنٹس اب روزمرہ کی سافٹ ویئر ڈویلپمنٹ کی پیچیدگیوں کو سنبھال سکتے ہیں۔ اصل 2,294-issue والا سیٹ اب بھی موجود ہے، اور اس ورژن پر اسکور اب بھی کم ہیں۔
پوچھنے کے لیے سوالات
جب بھی آپ بینچ مارک کے نتائج میں کوئی بڑا اتار چڑھاؤ دیکھیں، تو ان تین چیزوں کو ذہن میں رکھیں:
- کون سا ورژن رپورٹ کیا جا رہا ہے؟ Original، Lite، یا Verified؟ ایک جیسے نام بہت مختلف ٹاسک پولز کو چھپا سکتے ہیں۔
- کیا فلٹر کیا گیا؟ شور والے یا ناممکن ٹاسک کو ہٹانے سے کسی بھی سسٹم کی حد (ceiling) بڑھ جاتی ہے؛ یہ ان چیلنجز کو بھی ختم کر دیتا ہے جو پروڈکشن میں اہمیت رکھتے ہیں۔
- کیا سسٹم کو خاص طور پر اس ٹیسٹ کو پاس کرنے کے لیے بنایا گیا تھا؟ اگر ڈویلپرز نے بینچ مارک کے لیے ماڈلز یا پائپ لائنز کو ٹیون کیا ہے، تو اسکور optimization کی پیمائش کرتا ہے، خام صلاحیت کی نہیں۔
مستقبل کی طرف نظر
جب تک ایسے حفاظتی اقدامات معیاری نہیں بن جاتے، AI کوڈر کی افادیت کا بہترین پیمانہ اب بھی ان افراتفری والے، حقیقی دنیا کے issues پر اس کی کارکردگی ہوگی جن کا سامنا ڈویلپرز کو روزانہ کرنا پڑتا ہے۔
خلاصہ: ایک مرمت شدہ اور ہدف شدہ بینچ مارک پر زیادہ اسکور خود بخود یہ ثابت نہیں کرتا کہ AI ایجنٹس حقیقی دنیا کے کوڈ کی پیچیدگیوں کے لیے تیار ہیں؛ اصل امتحان اب بھی وہی غیر فلٹر شدہ مسائل ہیں جن سے انجینئرز روزانہ لڑتے ہیں۔
