تنتقل الفرق التي تعمل على نقل توليد النصوص المعزز بالاسترجاع (RAG) من مجرد عرض تجريبي إلى خدمة إنتاجية عبر اتخاذ مجموعة من القرارات التي تفصل بين المساعد المفيد والمساعد المليء بالضجيج. تتحكم خمسة خيارات تصميمية — التقطيع (chunking)، ونموذج التضمين (embedding model)، ومخزن المتجهات (vector store)، والبحث الهجين (hybrid search)، والتقييم (evaluation) — في الدقة، والاستدعاء (recall)، وزمن الاستجابة (latency) الذي يختبره المستخدمون الحقيقيون.
لماذا تهم القفزة من النموذج الأولي إلى الإنتاج
تنجح معظم الشروحات التعليمية في تشغيل مسار RAG ببضعة أسطر من الكود، ثم تتوقف قبل الوصول إلى الدقة الهندسية المطلوبة للتعامل مع حركة المرور الحية (live traffic).
1. استراتيجية التقطيع (Chunking) – بوابة الجودة الأولى
حجم القطعة (Chunk size) هو الأهم. فالقطع الكبيرة تغرق الإشارة بنصوص غير ذات صلة؛ والقطع الصغيرة جدًا تجرد السياق المحيط الذي يحتاجه النموذج لتوليد إجابات متماسكة. كما أن التقسيم ذو الحجم الثابت يتجاهل البنية الطبيعية للمادة المصدر.
قاعدة عملية تقريبية
- التقسيم عند الحدود المنطقية: العناوين في المستندات، فواصل الفقرات في المقالات، تعريفات الدوال في الكود.
- حافظ على صغر حجم القطع بما يكفي لاسترجاع دقيق، مع الاحتفاظ بالقسم الأب الأكبر لخطوة التوليد الخاصة بالنموذج اللغوي الكبير (LLM). يتيح نمط "الأب والابن" (parent-child) للمسترجع إظهار مقتطف دقيق بينما يرى المولد سياقًا كافيًا للبقاء واقعيًا.
2. نماذج التضمين (Embedding models) – كيف يتم الحكم على التشابه
يقوم نموذج التضمين بتحويل النص إلى متجهات (vectors) يقارنها محرك بحث التشابه. يوفر النموذج القوي متعدد الأغراض، مثل text-embedding-3-large من OpenAI، أساسًا متينًا لمعظم المجالات. أما إذا كانت مجموعة البيانات (corpus) في مجال متخصص للغاية — مثل الآراء القانونية، أو السجلات الطبية، أو المواصفات الفنية — فقم باختبار نموذج متخصص في هذا المجال، ولكن فقط بعد قياس تحسن ملموس على بياناتك الخاصة.
متى تقوم بالتبديل
- قم بالتبديل فقط إذا لاحظت مكسبًا ملموسًا في درجات الصلة (relevance scores) التي تهم تطبيقك (مثل دقة السياق العالية).
3. قاعدة بيانات المتجهات (Vector database) – توسيع نطاق التخزين
اختر مخزن متجهات يتناسب مع بنيتك التحتية الحالية والعدد المتوقع من المتجهات.
- pgvector يعمل داخل PostgreSQL ويتعامل مع ما يصل إلى مليون متجه تقريبًا بكل سهولة. وهو مثالي للفرق التي تدير بالفعل قاعدة بيانات علاقية وتحتاج إلى حل منخفض الصيانة.
- Qdrant يتألق في النطاق من 1 مليون إلى 100 مليون متجه، حيث يوفر إنتاجية أعلى وزمن استجابة أقل للمجموعات الكبيرة.
- Pinecone يوفر خدمة سحابية مدارة بالكامل، مما يزيل عبء التشغيل الذاتي.
4. البحث الهجين وإعادة التصنيف – الموازنة بين المعنى والدقة
يتفوق البحث المتجهي الصرف في التشابه الدلالي (semantic similarity) ولكنه قد يفتقد تطابقات الكلمات المفتاحية الدقيقة التي يتوقعها المستخدمون. يقوم البحث الهجين بوضع طبقة من فهرس الكلمات المفتاحية التقليدي BM25 فوق فهرس المتجهات، ثم يدمج قائمتي النتائج. تقوم تقنية دمج الرتب المتبادلة (Reciprocal Rank Fusion - RRF) بمنح كل مرشح درجة بناءً على رتبته في كلتا القائمتين وتجمعهما، مما يعزز العناصر التي تظهر في مرتبة عالية في أي منهما.
تضيف إعادة التصنيف (Reranking) مرشح دقة نهائي. فبعد الاسترجاع الهجين، قم بتغذية أفضل N من المرشحين (عادةً 50) إلى cross-encoder — وهو نموذج يقيم زوج (الاستعلام-المستند) بشكل مشترك. تحل درجات الـ cross-encoder محل أرقام التشابه الأصلية، مما يتيح لك اختيار القطعة الأكثر صلة قبل تمريرها إلى الـ LLM. غالبًا ما تؤدي هذه الخطوة الإضافية إلى قفزة ملحوظة في جودة الإجابة، خاصة في المجموعات النصية الطويلة أو المليئة بالضجيج.
5. التقييم والامتناع – قياس ما يهم حقًا
لا يمكنك تحسين نظام لا تقيس أداءه. يقترح إطار عمل RAGAS أربعة مقاييس تلخص معًا صحة مسار RAG:
- دقة السياق (Context Precision) – نسبة القطع المسترجعة التي تحتوي بالفعل على الإجابة.
- استدعاء السياق (Context Recall) – حصة جميع القطع ذات الصلة التي تم استرجاعها.
- الأمانة (Faithfulness) – مدى التزام الإجابة المولدة بالسياق المسترجع، وتجنب الهلوسة.
- صلة الإجابة (Answer Relevance) – مدى تلبية الإجابة النهائية للاستعلام الأصلي.
تتبع هذه المقاييس على مجموعة اختبار مستمرة تحاكي حركة المرور في بيئة الإنتاج.
هناك ضمان أخير غالبًا ما يتم إغفاله وهو الامتناع عن الإجابة (abstention). بدلاً من إجبار النموذج على الإجابة بثقة منخفضة، ضع حدًا أدنى لدرجة الأمانة أو الصلة يؤدي إلى تفعيل استجابة "لا أعرف". يفضل المستخدمون الاعتراف الواضح بعدم اليقين على الإجابة الواثقة ولكن الخاطئة، كما أن هذا الحل البديل يقلل من تكاليف الدعم الفني اللاحقة.
تعامل مع كل مجال من هذه المجالات الخمسة كنقطة اتخاذ قرار بدلاً من مجرد إعدادات "اضبطها وانساها"، وستتمكن من نقل RAG من مجرد عرض تجريبي مبهر إلى خدمة إنتاجية موثوقة. النتيجة: نظام يجيب بسرعة، ويلتزم بالموضوع، ويعرف متى يصمت.
