يُروج للاسترجاع القائم على الوكلاء (Agentic retrieval) باعتباره الخطوة التالية بعد خطوط أنابيب التوليد المعزز بالاسترجاع (RAG) التقليدية، حيث يعد بأنظمة ذكاء اصطناعي في بيئات الإنتاج تتوقف عن "الهلوسة" وتبدأ في "التفكير" في كيفية جلب المعلومات. ويقول المؤيدون إن هذا النهج يمكن أن يقلل تكلفة الإجابة على الاستعلام في مجموعات الوثائق الضخمة بما يصل إلى 82 ضعفاً مقارنة بتغذية كامل المدونة (corpus) في نافذة سياق النموذج، وهو توفير يهم أي شركة تسعى لتوسيع نطاق الذكاء الاصطناعي التوليدي.
لماذا تقصر خطوط أنابيب RAG القديمة عن تلبية الاحتياجات
سير عمل RAG الكلاسيكي هو تسلسل ثابت: تقسيم الوثائق إلى أجزاء (chunks)، وتضمين (embed) كل جزء في فضاء متجهي كثيف، ثم سحب المتجهات الأعلى تقييماً لاستعلام المستخدم. في العروض التوضيحية، تبدو الطريقة منظمة؛ حيث يتلقى النموذج بضع فقرات "ذات صلة" ويجيب بثقة. ومع ذلك، في بيئات الإنتاج، غالباً ما تكون هذه الثقة في غير محلها.
هناك ثلاثة عيوب نظامية تؤدي إلى هذه المشكلة:
- التشابه المتجهي لا يعني بالضرورة الصلة. يمكن أن تكون فقرتان متقاربتين رياضياً بينما تعبران عن حقائق متناقضة، مما يؤدي بالنموذج إلى الاستشهاد بادعاء خاطئ.
- التجزئة تكسر الحقائق. يؤدي التقسيم الثابت إلى أجزاء (chunking) بشكل روتيني إلى قطع جملة واحدة من المنتصف. إذا تلقى النموذج نصفاً واحداً فقط، فلن يتمكن من إعادة بناء الجزء المفقود.
- الاستعلامات غير المنظمة. تختلف الأسئلة في العالم الحقيقي عن بيانات التدريب لمعظم نماذج التضمين (embedding models)، لذا فإن البحث عن التشابه يعيد أجزاءً غير ذات صلة.
عندما تعيد خطوط الأنابيب السياق الخاطئ، لا يزال النموذج اللغوي في المراحل اللاحقة ينتج إجابة، غالباً بيقين عالٍ، ولا يرفع النظام أي خطأ. والنتيجة هي الهلوسة الصامتة — وهو فشل صامت يصعب اكتشافه في الخدمة المباشرة.
الاسترجاع الهجين: إصلاح تدريجي
الاستجابة الشائعة هي إضافة البحث بالكلمات المفتاحية فوق المتجهات الكثيفة، مما يخلق مسترجعاً هجيناً (hybrid retriever) يمكنه التقاط تطابقات المصطلحات الدقيقة التي تفوتها عمليات التضمين. كما أن إضافة نموذج إعادة الترتيب (reranker) — وهو نموذج ثانٍ يعيد ترتيب القائمة المسترجعة بناءً على درجة صلة متعلمة — يحسن الدقة بشكل أكبر.
ومع ذلك، لا يزال الاسترجاع الهجين يتبع نصاً ثابتاً: كل استعلام يطلق نفس سلسلة الخطوات، بغض النظر عن الصعوبة أو عدم اليقين. لا يمكن لخط الأنابيب أن يقرر ما إذا كان بحاجة إلى مزيد من البيانات، أو كيفية تقسيم سؤال معقد إلى أسئلة فرعية، أو متى تكون المقتطفات المسترجعة غير كافية.
الاسترجاع القائم على الوكلاء يعامل البحث كعملية اتخاذ قرار
يعيد الاسترجاع القائم على الوكلاء (Agentic retrieval) صياغة المشكلة كسلسلة من القرارات التي يتخذها "وكيل" (agent) مستقل يحاكي الباحث البشري. يمكن للوكيل أن يقوم بـ:
- إعادة صياغة الاستعلام. يقوم بتطبيع الصياغات العامية أو الغامضة قبل البحث، مما يحسن فرص فهم نماذج الاسترجاع للقصد.
- التساؤل عما إذا كان الاسترجاع مطلوباً. بالنسبة للاستعلامات المباشرة، يجيب الوكيل مباشرة، مما يوفر التوكنز (tokens) ويتجنب الضجيج غير الضروري.
- التخطيط لبحث متعدد الخطوات. يتم تفكيك الأسئلة المعقدة إلى أسئلة فرعية أصغر، ويتم البحث في كل منها بشكل مستقل، ثم إعادة دمجها.
- التصحيح الذاتي. إذا بدت النتيجة الأولية ضعيفة — على سبيل المثال، درجات ثقة منخفضة أو أدلة متناقضة — يعيد الوكيل إصدار الاستعلام بصياغة مختلفة أو يوسع نطاق البحث.
الحجج المتعلقة بالتكلفة: السياق الطويل مقابل الاسترجاع
يجادل بعض المعلقين بأن نوافذ السياق المتزايدة باستمرار تجعل الاسترجاع أمراً عفا عليه الزمن. لكن الرد المقابل هو رد عملي: تغذية مدونة ضخمة في سياق النموذج تكلف أضعافاً مضاعفة مقارنة بالاسترجاع المركز. تشير التقديرات إلى أن الاسترجاع أرخص بمقدار 8 إلى 82 مرة لمجموعات البيانات الكبيرة، مع الاستمرار في تقديم الأساس السياقي اللازم للإجابات الدقيقة. تظل نوافذ السياق الطويلة مفيدة للاستنتاج الدقيق عبر مجموعة صغيرة ومنسقة من الوثائق، لكنها لا يمكن أن تحل محل البحث القابل للتوسع.
الشفافية والتحقق
يجب أن يكشف مساعد الذكاء الاصطناعي في بيئة الإنتاج عن مصادره. يمكن للاسترجاع القائم على الوكلاء إرفاق استشهاد بكل ادعاء، مما يسمح للمراجع البشري بالتحقق من مسار فحص الحقائق. نهج "إظهار العمل" هذا يبني الثقة ويكشف مسارات الاسترجاع الضعيفة التي يمكن للوكيل أن يتعلم تجنبها في التفاعلات المستقبلية.
ما يجب مراقبته لاحقاً
- الأدوات (Tooling).
- معايير التقييم.
- المشاريع التجريبية للمؤسسات.
الخلاصة
يتجاوز الاسترجاع القائم على الوكلاء خطوط أنابيب RAG الثابتة والمعرضة للخطأ التي تهيمن على العديد من العروض التوضيحية. من خلال السماح لنظام الذكاء الاصطناعي بتقرير متى وكيف يبحث، فإنه يقلل من استخدام التوكنز، ويخفض التكاليف بشكل كبير، والأهم من ذلك، يوفر مصادر قابلة للتحقق لكل إجابة.
