یونیورسٹی آف الینوائے اربانا-شیمپین کی ایک تحقیقی ٹیم نے دریافت کیا ہے کہ وسیع پیمانے پر استعمال ہونے والے BIRD Text-to-SQL بینچ مارک میں نصف سے زیادہ اینوٹیشنز (annotations) غلط ہیں، جس سے ان درستگی کے اسکورز پر سوالات اٹھتے ہیں جن پر بہت سے ڈویلپرز بھروسہ کرتے ہیں۔

یہ بینچ مارک کیوں اہم ہے

BIRD اس بات کی پیمائش کے لیے ڈی فیکٹو (de-facto) معیار ہے کہ ایک ماڈل قدرتی زبان کے سوال کو SQL کوئری میں کتنی اچھی طرح تبدیل کر سکتا ہے۔ تحقیقی مقالے، پروڈکٹ شیٹس اور بھرتی کے ٹیسٹ BIRD اسکورز کا حوالہ دیتے ہیں۔ اگر "گولڈ" (gold) SQL سٹیٹمنٹس، جو درستگی کا تعین کرتے ہیں، ناقص ہوں، تو ایک بہتر کوئری لکھنے والے ماڈل کو سزا دی جا سکتی ہے، جبکہ ایک غلط گولڈ جواب کی نقل کرنے والے ماڈل کو انعام دیا جا سکتا ہے۔

غلطی کی شرح کیسے معلوم ہوئی

UIUC ٹیم نے BIRD-dev اسپلٹ سے 238 ناکامیوں کا جائزہ لیا۔ اس کے بجائے کہ وہ اندازہ لگائیں کہ ہر ماڈل کا آؤٹ پٹ کیوں غلط قرار دیا گیا، انہوں نے ماڈل کے تیار کردہ SQL اور گولڈ ریفرنس کے درمیان ہر فرق کو دستی طور پر ٹیگ کیا۔ ان کے آڈٹ سے پتہ چلا کہ 52.8% کیسز میں اینوٹیشن کی غلطی ہے—غلط SQL، غلط اسکیمہ، یا یہاں تک کہ ایک ناقص قدرتی زبان کا سوال۔

ایک پیٹرن نے نشان زد کردہ غلطیوں کے 19% حصے کی نشاندہی کی: ماڈل نے DISTINCT کا استعمال کیا جبکہ گولڈ کوئری میں ایسا نہیں تھا۔ تصور کریں کہ ایک صارف غیر معمولی لیب نتائج والے مریضوں کی تعداد پوچھ رہا ہے۔ گولڈ جواب COUNT(ID) کے ساتھ روز (rows) کو گنتا ہے۔ اگر ایک ہی مریض کے پانچ غیر معمولی لیب نتائج ہوں، تو گولڈ کوئری ایک کے بجائے پانچ رپورٹ کرتی ہے۔ ماڈل کا COUNT(DISTINCT ID) ہر مریض کو صحیح طریقے سے ایک بار گنتا ہے۔ ان معاملات میں، بینچ مارک ماڈل کی غلطی ریکارڈ کرتا ہے حالانکہ ماڈل کا جواب مطلوبہ معنی (semantics) کے زیادہ مطابق ہوتا ہے۔

ماڈل کی ترقی پر حقیقی دنیا کے اثرات

ڈویلپرز اکثر کم BIRD اسکورز پر پرامپٹس (prompts) کو تبدیل کر کے، "don't use DISTINCT" جیسی پابندیاں لگا کر، یا بینچ مارک ڈیٹا پر دوبارہ تربیت دے کر ردعمل دیتے ہیں۔ وہ تبدیلیاں رپورٹ شدہ اسکور کو بڑھا سکتی ہیں، جس سے ترقی کا ایک وہم پیدا ہوتا ہے۔ UIUC کا تجزیہ ظاہر کرتا ہے کہ یہ "بہتری" محض غلط جواب کی کلید (answer key) کے ساتھ اوور فٹنگ (overfitting) ہو سکتی ہے، جو ممکنہ طور پر ان اصل ڈیٹا بیسز پر کارکردگی کو کم کر سکتی ہے جہاں درست منطق کی ضرورت ہوتی ہے۔

محققین نے اس کے برعکس منظر نامہ بھی دکھایا۔ ماڈل اور گولڈ دونوں کوئریز کا تجزیہ کرنے کے بعد، انہوں نے سات ایسے کیسز کی نشاندہی کی جہاں ماڈل نے غلطی سے دو الگ الگ کالمز کو ایک میں ضم کر دیا تھا۔ ان معاملات میں گولڈ SQL درست تھا۔ صرف ان حقیقی غلطیوں کو ایک بہتر پرامپٹ کے ذریعے نشانہ بنا کر، انہوں نے بینچ مارک اسکور کو بڑھائے بغیر ماڈل کی کارکردگی کو بہتر بنایا۔

متعلقہ فریقین کے لیے ان نتائج کے معنی

  • محققین (Researchers): BIRD اسکورز پر مبنی اشاعت کے دعووں میں اینوٹیشن کے معیار کے بارے میں ایک تنبیہ کی ضرورت ہے۔ مقالوں کے درمیان موازنہ حقیقی طریقہ کار کی پیش رفت کے بجائے بینچ مارک کے شور (noise) کے خلاف مختلف برداشت کی عکاسی کر سکتا ہے۔
  • پروڈکٹ ٹیمیں (Product teams): ریلیز کی تیاری کے لیے واحد میٹرک کے طور پر BIRD پر بھروسہ کرنے سے ایسے ماڈلز بھیجنے کا خطرہ ہے جنہوں نے ناقص کوئریز کو دوبارہ پیدا کرنا سیکھ لیا ہو۔ پراپرائٹری اسکیمہ (proprietary schemas) پر حقیقی دنیا کی ٹیسٹنگ ضروری ہو جاتی ہے۔
  • بینچ مارک کیوریٹرز (Benchmark curators): غلطی کی بلند شرح یہ بتاتی ہے کہ باقاعدہ نظرثانی کا وقت آ گیا ہے۔ گولڈ سیٹ کی صفائی یا ایک ثانوی "تصدیق شدہ" (verified) اسپلٹ فراہم کرنے سے اعتماد بحال ہو سکتا ہے۔

ایک عملی آڈٹ ورک فلو

UIUC ٹیم ایک ہلکا پھلکا عمل تجویز کرتی ہے جسے کسی بھی Text-to-SQL بینچ مارک پر لاگو کیا جا سکتا ہے:

  1. Parse دونوں ماڈل کے تیار کردہ اور گولڈ SQL سٹیٹمنٹس کو ایبسٹریکٹ سنٹیکس ٹریز (abstract syntax trees) میں تبدیل کریں۔
  2. Align منتخب کردہ کالمز، فلٹرز، جوائنز اور ایگریگیشن فنکشنز میں فرق ظاہر کرنے کے لیے ڈھانچوں کو ہم آہنگ کریں۔
  3. Tag ہر فرق کو ٹیگ کریں (مثلاً اضافی کالم، مفقود فلٹر، غلط ایگریگیشن)۔
  4. Summarize غالب غلطی کی اقسام کو پہچاننے کے لیے ٹیگز کا ہسٹوگرام میں خلاصہ کریں۔
  5. Validate پرامپٹ انجینئرنگ کے لیے ہدف کے طور پر استعمال کرنے سے پہلے ہر زیادہ فریکوئنسی والے ٹیگ کے لیے گولڈ کوئری کی تصدیق کریں۔

پرامپٹ کی اصلاحات کو صرف ان کیسز پر مرکوز کر کے جہاں گولڈ جواب بلا شبہ درست ہے، ڈویلپرز "ٹوٹے ہوئے میٹرک کے لیے آپٹیمائزیشن" کے جال سے بچ سکتے ہیں۔

حتمی نتیجہ

ایک بینچ مارک جو اپنے نصف سے زیادہ مثالوں کو غلط لیبل کرتا ہے، وہ ایک قابل اعتماد پیمانے کے طور پر کام نہیں کر سکتا۔ UIUC کا مطالعہ ظاہر کرتا ہے کہ BIRD کے ذریعے نشان زد کردہ بہت سی "غلطیاں" دراصل ماڈل کی کامیابیاں ہیں، جبکہ حقیقی غلطیاں درست گولڈ جوابوں کے پیچھے چھپی ہوئی ہیں۔ گولڈ سیٹ کا آڈٹ کرنا، ایویلیوایشن پائپ لائنز کو بہتر بنانا، اور بینچ مارک اسکورز کو وسیع تر تصدیقی حکمت عملی کے ایک حصے کے طور پر دیکھنا ہی اس بات کو یقینی بنانے کے واحد طریقے ہیں کہ کاغذ پر ہونے والی بہتری حقیقی دنیا کی قابل اعتمادگی میں تبدیل ہو جائے۔