كيف تم إعداد الاختبار

قام المؤلف ببناء نظام توليد معزز بالاسترجاع (RAG) مصغر حول وثيقتين لقواعد الدفع، وأجرى فحصين:

  • اختبار الاستدعاء (Recall test) – هل ظهرت الصفحة الصحيحة ضمن أفضل خمس نتائج؟ النتيجة: 60%.
  • اختبار الإجابة (Answer test) – هل كانت الإجابة النهائية التي أنتجها المولد صحيحة؟ النتيجة: 90%.

بدا وجود فجوة بنسبة 40% أمراً مستحيلاً. فإذا كان نظام الاسترجاع (retriever) قد أخطأ في العثور على الصفحة الصحيحة أربع مرات من أصل عشر، فكيف تمكن النموذج من الإجابة بشكل صحيح تسع مرات من أصل عشر؟

المحاولات الأولى لـ "إصلاح" نظام الاسترجاع

جرب المطور حيلتين شائعتين:

  • البحث الهجين (Hybrid search) – دمج الإشارات اللفظية (lexical) والمتجهة (vector). ظل الاستدعاء كما هو.
  • إعادة الترتيب (Reranker) – إعادة ترتيب الصفحات الخمس المسترجعة. ارتفع الاستدعاء إلى 70%، لكنه ظل متأخراً كثيراً عن دقة الإجابة التي بلغت 90%.

تقوم كلتا الأداتين فقط بإعادة ترتيب ما تم استرجاعه بالفعل؛ ولا يمكنهما استحضار صفحة لم تدخل أبداً في مجموعة المرشحين. كانت المشكلة تكمن في مكان آخر.

المشكلة كانت في المقياس، وليس في النموذج

بدلاً من الحكم على النجاح بناءً على تسمية الصفحة، فحص المؤلف الحقائق الفعلية في الأجزاء (chunks) المسترجعة. في ثلاث من أصل أربع حالات "فشل"، كانت الحقيقة الصحيحة موجودة، ولكنها كانت في صفحة مختلفة عما توقعه نص الاختبار. لقد عاق التقييم نظام الاسترجاع بسبب العثور على إجابة صحيحة في صفحة غير متوقعة.

عندما تحول المقياس إلى "هل يحتوي أي جزء مسترجع على الحقيقة المطلوبة؟"، قفز الاستدعاء إلى 90%، ليتطابق مع دقة الإجابة. لقد كان نظام الاسترجاع يعمل بشكل جيد، لكن إطار التقييم هو الذي لم يكن يعمل.

لماذا يمكن للاستدعاء التقليدي أن يكون مضللاً

  • التوسيم على مستوى الصفحة يخلق إخفاقات وهمية. قد تظهر حقيقة واحدة في عدة صفحات. وتؤدي عملية وسم صفحة واحدة فقط كحقيقة مرجعية (ground truth) إلى اعتبار جميع النتائج الصحيحة الأخرى أخطاءً.
  • المجموعات النصية الصغيرة تضخم التأثير. مع وجود عدد قليل من المستندات، يمكن لصفحة واحدة موسومة بشكل خاطئ أن تغير نسبة الاستدعاء بشكل كبير بينما تظل دقة الإجابة ثابتة.
  • ضجيج التضمين (Embedding noise) يخفي الحقائق. تقوم المتجهات بتقييم صفحات كاملة؛ مما يؤدي إلى تخفيف إشارة الصلة للجملة المستهدفة بسبب النص القانوني أو التقني المحيط بها، مما يدفع الصفحة إلى أسفل الترتيب رغم وجود الحقيقة.

دروس عملية لممارسي RAG

  • افصل بين فشل الترتيب وفشل الاسترجاع. تعمل أدوات إعادة الترتيب (Rerankers) على إصلاح الأول فقط؛ فإذا لم يدخل الجزء الصحيح أبداً في مجموعة المرشحين، فلن تفيد إعادة الترتيب في شيء.
  • قم بتوسيم بيانات الاختبار على مستوى الحقيقة. اربط كل استعلام بالمعلومة المحددة التي يحتاجها، وليس بمعرف مستند واحد.
  • لا تثق في المعايير المرجعية واسعة النطاق عند التعامل مع مجموعات بيانات صغيرة. تتصرف المجموعات النصية الصغيرة والمتخصصة بشكل مختلف، ويمكن أن تكون درجات الاستدعاء العامة مضللة.
  • انتبه لدقة التضمين (embedding granularity). يحتوي الجزء (chunk) بحجم الصفحة على كلمات كثيرة، ويمكن للنص القانوني المحيط أن يخفض ترتيب الحقيقة التي تهمك.

الخلاصة: يمكن أن يتعايش سجل دقة إجابة مرتفع مع رقم استدعاء تقليدي منخفض عندما لا يتوافق التقييم مع المهمة. إن إصلاح المقياس، وليس النموذج، يوفر الوقت، ويقلل من الإنذارات الكاذبة، ويؤدي إلى عمليات نشر RAG أكثر موثوقية.