ٹیسٹ کیسے ترتیب دیا گیا

مصنف نے ادائیگی کے دو قواعد نامے (payment-rulebook) کے دستاویزات پر مبنی ایک چھوٹا سا retrieval-augmented generation (RAG) سسٹم بنایا اور دو چیک کیے:

  • Recall test – کیا درست صفحہ پہلے پانچ نتائج میں شامل تھا؟ نتیجہ: 60%۔
  • Answer test – کیا جنریٹر کے ذریعے تیار کردہ حتمی جواب درست تھا؟ نتیجہ: 90%۔

40% کا فرق ناممکن لگ رہا تھا۔ اگر ریٹریور (retriever) دس میں سے چار بار صحیح صفحہ تلاش کرنے میں ناکام رہا، تو ماڈل دس میں سے نو بار درست جواب کیسے دے سکتا تھا؟

ریٹریور کو "ٹھیک" کرنے کی پہلی کوششیں

ڈویلپر نے دو عام طریقے آزمائے:

  • Hybrid search – lexical اور vector سگنلز کا امتزاج۔ Recall میں کوئی تبدیلی نہیں آئی۔
  • Reranker – حاصل کردہ پانچ صفحات کی دوبارہ ترتیب سازی۔ Recall بڑھ کر 70% ہو گئی لیکن پھر بھی 90% جواب کی درستگی (answer accuracy) سے بہت پیچھے تھی۔

یہ دونوں ٹولز صرف اسی چیز کی دوبارہ ترتیب کرتے ہیں جو پہلے ہی حاصل کی جا چکی ہو؛ یہ ایسا صفحہ نہیں لا سکتے جو کینڈیڈیٹ سیٹ (candidate set) میں شامل ہی نہ ہوا ہو۔ مسئلہ کہیں اور تھا۔

مسئلہ ماڈل میں نہیں بلکہ میٹرک (metric) میں تھا

کامیابی کا فیصلہ صفحے کے لیبل سے کرنے کے بجائے، مصنف نے حاصل کردہ چنکس (chunks) میں موجود اصل حقائق کا معائنہ کیا۔ چار میں سے تین "ناکامیوں" میں، درست حقیقت موجود تھی، لیکن وہ اس صفحے پر نہیں تھی جس کی ٹیسٹ اسکرپٹ توقع کر رہا تھا۔ ایویلیوایشن (evaluation) نے ریٹریور کو اس لیے سزا دی کیونکہ اس نے ایک غیر متوقع صفحے پر درست جواب تلاش کر لیا تھا۔

جب میٹرک کو تبدیل کر کے یہ کر دیا گیا کہ "کیا کسی بھی حاصل کردہ چنک میں مطلوبہ حقیقت موجود ہے؟" تو recall بڑھ کر 90% ہو گئی، جو کہ جواب کی درستگی کے برابر تھی۔ ریٹریور صحیح کام کر رہا تھا؛ مسئلہ ایویلیوایشن فریم ورک میں تھا۔

روایتی recall کیوں گمراہ کن ہو سکتا ہے

  • صفحہ کی سطح پر لیبلنگ سے فرضی ناکامیاں پیدا ہوتی ہیں۔ ایک ہی حقیقت کئی صفحات پر موجود ہو سکتی ہے۔ صرف ایک صفحے کو 'گراؤنڈ ٹرتھ' (ground truth) کے طور پر ٹیگ کرنے سے دیگر تمام درست نتائج کو غلطیوں کے طور پر شمار کیا جاتا ہے۔
  • چھوٹے کارپوری (corpora) اس اثر کو بڑھا دیتے ہیں۔ کم دستاویزات کی صورت میں، ایک غلط لیبل شدہ صفحہ recall کو تیزی سے بدل سکتا ہے جبکہ جواب کی درستگی مستحکم رہتی ہے۔
  • ایمبیڈنگ شور (embedding noise) حقائق کو چھپا دیتا ہے۔ ویکٹر پورے صفحات کو اسکور کرتا ہے؛ ارد گرد کا قانونی یا تکنیکی متن مطلوبہ جملے کے متعلقہ سگنل کو کمزور کر دیتا ہے، جس سے وہ صفحہ رینکنگ میں نیچے چلا جاتا ہے حالانکہ حقیقت وہاں موجود ہوتی ہے۔

RAG ماہرین کے لیے عملی نکات

  • رینکنگ کو ریٹریول کی ناکامیوں سے الگ رکھیں۔ Rerankers صرف پہلی چیز (رینکنگ) کو درست کرتے ہیں؛ اگر درست چنک کینڈیڈیٹ سیٹ میں شامل ہی نہ ہو، تو دوبارہ ترتیب دینے سے کوئی فائدہ نہیں ہوتا۔
  • ٹیسٹ ڈیٹا کو حقیقت کی سطح پر لیبل کریں۔ ہر سوال (query) کو اس کی ضرورت کے مطابق مخصوص معلومات سے جوڑیں، نہ کہ صرف کسی ایک دستاویز کے شناختی نمبر (identifier) سے۔
  • چھوٹے ڈیٹا سیٹس کے لیے بڑے پیمانے کے بینچ مارکس پر بھروسہ نہ کریں۔ چھوٹے اور مخصوص شعبے کے کارپوری مختلف طریقے سے کام کرتے ہیں، اور عام recall اسکورز دھوکہ دے سکتے ہیں۔
  • ایمبیڈنگ کی باریکی (granularity) پر نظر رکھیں۔ ایک صفحے کے برابر چنک میں بہت سے الفاظ ہوتے ہیں، اور ارد گرد کا قانونی متن آپ کی مطلوبہ حقیقت کے رینک کو کم کر سکتا ہے۔

خلاصہ: جب ایویلیوایشن ٹاسک کے مطابق نہ ہو، تو جواب کی درستگی کا بلند اسکور اور روایتی recall کا کم اسکور ایک ساتھ ہو سکتے ہیں۔ ماڈل کے بجائے میٹرک کو درست کرنے سے وقت بچتا ہے، غلط الرٹ کم ہوتے ہیں، اور زیادہ قابل اعتماد RAG سسٹم تیار ہوتے ہیں۔