یک تیم تحقیقاتی در دانشگاه ایلینوی اوربانا-شیمپانی دریافت که بیش از نیمی از حاشیه‌نویسی‌ها (annotations) در بنچمارک پرکاربرد BIRD Text-to-SQL اشتباه هستند، که این امر اعتبار امتیازهای دقتی را که بسیاری از توسعه‌دهندگان به آن‌ها تکیه می‌کنند، زیر سوال می‌برد.

چرا این بنچمارک اهمیت دارد

BIRD استاندارد عملی (de-facto) برای سنجش میزان توانایی یک مدل در تبدیل یک پرسش به زبان طبیعی به یک پرس‌وجوی SQL است. مقالات، برگه مشخصات محصول و آزمون‌های استخدامی به امتیازهای BIRD استناد می‌کنند. اگر دستورات SQL «طلایی» (gold) که تعیین‌کننده درستی هستند دارای نقص باشند، مدلی که پرس‌وجوی بهتری می‌نویسد ممکن است جریمه شود، در حالی که مدلی که پاسخ طلایی اشتباه را کپی می‌کند، پاداش بگیرد.

چگونه نرخ خطا کشف شد

تیم UIUC تعداد ۲۳۸ مورد شکست را از بخش BIRD-dev بررسی کرد. آن‌ها به جای حدس زدن دلیل اشتباه بودن خروجی هر مدل، هر اختلاف بین SQL تولید شده توسط مدل و مرجع طلایی را به صورت دستی برچسب‌گذاری کردند. بازرسی آن‌ها نشان داد که ۵۲.۸٪ از موارد حاوی خطای حاشیه‌نویسی هستند؛ از جمله SQL نادرست، طرح‌واره (schema) نامناسب یا حتی یک پرسش به زبان طبیعی با ساختار ناقص.

یک الگو عامل ۱۹٪ از اشتباهات شناسایی شده بود: مدل از DISTINCT استفاده می‌کرد در حالی که پرس‌وجوی طلایی از آن استفاده نمی‌کرد. تصور کنید کاربری تعداد بیماران دارای نتایج آزمایش غیرطبیعی را می‌پرسد. پاسخ طلایی با استفاده از COUNT(ID) ردیف‌ها را می‌شمارد. اگر یک بیمار پنج آزمایش غیرطبیعی داشته باشد، پرس‌وجوی طلایی به جای یک، عدد پنج را گزارش می‌کند. اما COUNT(DISTINCT ID) مدل، هر بیمار را به درستی یک بار می‌شمارد. در این موارد، بنچمارک یک خطای مدل ثبت می‌کند، در حالی که پاسخ مدل با معنای مورد نظر مطابقت بیشتری دارد.

تأثیر در دنیای واقعی بر توسعه مدل

توسعه‌دهندگان اغلب با امتیازهای پایین BIRD، با تغییر پرامپت‌ها (prompts)، افزودن محدودیت‌هایی مانند «از DISTINCT استفاده نکن» یا بازآموزی روی داده‌های بنچمارک واکنش نشان می‌دهند. این تنظیمات می‌تواند امتیاز گزارش‌شده را بالا ببرد و توهم پیشرفت ایجاد کند. تحلیل UIUC نشان می‌دهد که این «بهبود» ممکن است صرفاً بیش‌برازش (overfitting) روی کلید پاسخ اشتباه باشد که پتانسیل کاهش عملکرد در پایگاه‌های داده واقعی را دارد، جایی که منطق اصلاح‌شده مورد نیاز است.

محققان سناریوی معکوس را نشان دادند. آن‌ها پس از تجزیه (parsing) هر دو پرس‌وجوی مدل و طلایی، هفت مورد را شناسایی کردند که در آن‌ها مدل به اشتباه دو ستون مجزا را در یک ستون ادغام کرده بود. در این موارد، SQL طلایی درست بود. آن‌ها با هدف قرار دادن تنها همان خطاهای واقعی از طریق یک پرامپت اصلاح‌شده، عملکرد مدل را بدون متورم کردن امتیاز بنچمارک افزایش دادند.

یافته‌ها برای ذینفعان چه معنایی دارد

  • محققان: ادعاهای منتشر شده بر اساس امتیازهای BIRD نیازمند ذکر نکته‌ای درباره کیفیت حاشیه‌نویسی هستند. مقایسه مقالات مختلف ممکن است به جای پیشرفت‌های روش‌شناختی واقعی، نشان‌دهنده میزان تحمل متفاوت نسبت به نویزهای بنچمارک باشد.
  • تیم‌های محصول: تکیه بر BIRD به عنوان تنها معیار برای آمادگی جهت عرضه، خطر عرضه مدل‌هایی را دارد که یاد گرفته‌اند پرس‌وجوهای ناقص را بازتولید کنند. آزمایش در دنیای واقعی روی طرح‌واره‌های اختصاصی (proprietary schemas) ضروری می‌شود.
  • گردانندگان بنچمارک: نرخ بالای خطا نشان می‌دهد که یک بازبینی سیستماتیک بسیار لازم است. پاکسازی مجموعه طلایی یا ارائه یک بخش «تأیید شده» (verified) ثانویه می‌تواند اعتماد را بازگرداند.

یک گردش کار عملی برای بازرسی

تیم UIUC یک فرآیند سبک پیشنهاد می‌کند که می‌تواند برای هر بنچمارک Text-to-SQL اعمال شود:

  1. تجزیه (Parse) هر دو دستور SQL تولید شده توسط مدل و طلایی به درخت‌های نحو انتزاعی (abstract syntax trees).
  2. تراز کردن (Align) ساختارها برای آشکارسازی تفاوت‌ها در ستون‌های انتخاب‌شده، فیلترها، Joinها و توابع تجمیع (aggregation).
  3. برچسب‌گذاری (Tag) هر تفاوت (مثلاً ستون اضافی، فیلتر مفقود، تجمیع اشتباه).
  4. خلاصه‌سازی (Summarize) برچسب‌ها در یک هیستوگرام برای شناسایی دسته‌های اصلی خطا.
  5. اعتبارسنجی (Validate) پرس‌وجوی طلایی برای هر برچسب با فراوانی بالا، پیش از استفاده از آن به عنوان هدفی برای مهندسی پرامپت.

با تمرکز اصلاحات پرامپت تنها بر مواردی که پاسخ طلایی بدون شک درست است، توسعه‌دهندگان می‌توانند از تله‌ی «بهینه‌سازی برای یک معیار خراب» دوری کنند.

خلاصه کلام

بنچمارکی که بیش از نیمی از نمونه‌های خود را اشتباه برچسب‌گذاری می‌کند، نمی‌تواند به عنوان یک معیار قابل اعتماد عمل کند. مطالعه UIUC نشان می‌دهد که بسیاری از «اشتباهات» شناسایی شده توسط BIRD در واقع موفقیت‌های مدل هستند، در حالی که خطاهای واقعی پشت پاسخ‌های طلایی درست پنهان شده‌اند. بازرسی مجموعه طلایی، اصلاح خط لوله‌های ارزیابی (evaluation pipelines) و در نظر گرفتن امتیازهای بنچمارک به عنوان بخشی از یک استراتژی اعتبارسنجی گسترده‌تر، تنها راه‌های تضمین این است که بهبودهای روی کاغذ به قابلیت اطمینان در دنیای واقعی تبدیل شوند.