نمَت النماذج اللغوية الكبيرة عبر ثلاثة أبعاد مألوفة. نحن نوسع نطاق التدريب المسبق (pre-training) عبر تزويدها بمزيد من النصوص. ونقوم بتحسينها عبر التدريب اللاحق (post-training) لتعزيز قدرتها على اتباع التعليمات. ونستثمر في قدرات الحوسبة أثناء وقت الاختبار (test-time compute) لتسريع الإجابات. كل من هذه الأبعاد يدفع النموذج لإنتاج نصوص أفضل وأسرع وأكثر تماسكاً. لكن لا أحد منها يعالج بشكل مباشر مشكلة أصعب: معرفة ما إذا كان هذا النص صحيحاً بالفعل.

هذه الفجوة بدأت تصبح خطيرة. يمكن للنموذج أن يُنتج نصاً برمجياً بلغة Python بإزاحة مثالية وبنية منطقية، ولكنه يتسبب في خطأ بمجرد تشغيله. ويمكنه شرح عرض طبي بهدوء وثقة تامة، ثم يعطي تشخيصاً معكوساً. بالنسبة لروبوتات الدردشة، تُعد هذه أخطاءً محرجة، أما بالنسبة للوكلاء المستقلين (autonomous agents) الذين يعملون دون إشراف بشري، فهي إخفاقات ذات عواقب حقيقية. إن القدرة على التوليد ليست هي نفسها القدرة على قول الحقيقة، وإدراك هذا الفرق هو الخطوة الأولى نحو بناء أنظمة يمكننا الاعتماد عليها.

فخ التوليد

تعمل مسارات التوسع الثلاثة القياسية على تحسين الطلاقة وإتمام المهام، وليس الدقة المعرفية (epistemic accuracy). يبني التدريب المسبق أنماطاً إحصائية واسعة عبر تريليونات الرموز (tokens). ويقوم التدريب اللاحق بمواءمة النموذج مع التفضيلات البشرية، وهو ما يكافئ غالباً اللباقة والثقة على حساب الصحة الدقيقة. وتمنح الحوسبة أثناء وقت الاختبار النموذج المزيد من "رموز التفكير" (thinking tokens) لكل طلب، مما يحسن التنسيق والبنية المتسلسلة، لكنها لا تزال تتعامل مع المخرج النهائي كخطاب أحادي بدلاً من إجابة مدققة.

والنتيجة هي "فخ الطلاقة"؛ فالكود يبدو نظيفاً، والشروحات تبدو موثوقة، والحقائق تبدو صحيحة، لكن اللمعان السطحي يخفي أخطاءً جوهرية. فالمطور الذي ينسخ الكود المولد ويضعه في بيئة الإنتاج دون تدقيق يخاطر بتوقف النظام. والطبيب الذي يستخدم مساعداً يعمل بالذكاء الاصطناعي يواجه مسؤولية قانونية جسيمة إذا خلط النموذج بين تفاعلين دوائيين متشابهين. لقد دربنا النماذج على الأداء، لا على تدقيق نفسها.

التحقق كمحور للتوسع

يعيد إطار عمل يسمى LLM-as-a-Verifier صياغة المشكلة بالكامل. فبدلاً من التعامل مع التحقق كفكرة لاحقة أو كخطوة مراجعة بشرية منفصلة، فإنه يعامل التقييم الذاتي كمحور توسع رابع إلى جانب التدريب المسبق، والتدريب اللاحق، وتسريع الاستدلال (inference acceleration).

الفكرة تكمن في استخدام قدرة النموذج الحالية على الاستنتاج للحكم على مخرجاته الخاصة. فبعد توليد إجابة مرشحة، يتراجع النموذج نفسه ليقوم بتقييمها. وهذا يخلق حلقة مغلقة: توليد، تقييم، مراجعة، ثم تكرار. لا يتم إعادة تدريب النموذج بأوزان أو مجموعات بيانات جديدة، بل يطبق ببساطة الذكاء الذي يمتلكه بالفعل على قالب مطالبة (prompt template) مختلف، وهو قالب الناقد بدلاً من المؤلف.

هذا التحول مهم لأنه يفصل بين القدرة والموثوقية. فالنموذج الأصغر الذي يتحقق جيداً يمكنه التفوق على نموذج أكبر لا يفعل ذلك. أنت هنا تقوم بتوسيع نطاق "الحكم والتقدير"، وليس مجرد عدد المعلمات (parameters)، وهذا يغير ما يمكن للنظام القيام به بأمان.

قوة التقييم الاحتمالي

تفشل معظم محاولات التحقق لأنها تتطلب حكماً ثنائياً: هل كانت هذه الإجابة صحيحة؟ نعم أم لا. هذه الإشارة البدائية تهدر الكثير من المعلومات. فقد تكون الاستجابة صحيحة في معظمها ولكنها تحتوي على خطأ واحد قاتل، أو خاطئة في معظمها ولكنها تتضمن رؤية واحدة قيمة. الدرجة الثنائية تختزل كل هذا التباين في بت (bit) واحد.

يستبدل إطار LLM-as-a-Verifier ذلك بالتقييم الاحتمالي. فبدلاً من إشارة "أعجبني" أو "لم يعجبني"، يعيد النموذج رقماً مستمراً، مثل 0.92. وهذا الرقم العشري يحمل معنىً؛ فهو يخبرك أن النموذج شبه متأكد من صحة الإجابة، أو أنه يشعر بوجود خطأ ما عند درجة 0.34. يمكن للبشر الذين يديرون النظام وضع عتبات (thresholds) محددة؛ فأي شيء أقل من 0.60 قد يؤدي إلى إعادة توليد تلقائية، والنطاق بين 0.60 و0.85 قد يستدعي المراجعة البشرية، أما ما فوق 0.90، فيعمل النظام بشكل مستقل.

كما تتيح الدرجات المستمرة إجراء عمليات حسابية على مستوى الثقة؛ حيث يمكنك حساب متوسط عمليات تحقق متعددة، أو ترجيحها بناءً على تنوع المطالبات، أو مقارنة الدرجات عبر إجابات مرشحة مختلفة لاختيار الأفضل بينها. الأحكام الثنائية لا تدعم هذا النوع من اتخاذ القرار الدقيق.

ثلاث مزايا عملية

يستمد إطار العمل قوته من ثلاث خصائص محددة.

الدقة. تعبر الدرجة 0.82 عن شيء لا تعبر عنه كلمة "صحيح"؛ فهي توحي بيقين شبه تام مع وجود شك متبقٍ. في هندسة البرمجيات، قد يعني ذلك أن الكود يتم تجميعه ويتعامل مع الحالة الرئيسية ولكنه قد يغفل عن حالة استثنائية. وفي الاستنتاج الطبي، قد تشير إلى تشخيص مرجح لا يزال يتطلب اختباراً تأكيدياً. تتيح الدرجات التفصيلية للأنظمة اللاحقة معايرة استجابتها بدلاً من معاملة جميع النجاحات على أنها متساوية.

التكرار. نظرًا لأن عملية التحقق رخيصة مقارنة بعملية التوليد، يمكنك تشغيلها عدة مرات مع تغييرات طفيفة في الأوامر أو إعدادات درجة الحرارة. إذا أعطت ثلاثة فحوصات مستقلة نتائج 0.91 و0.89 و0.93، فلديك إجماع. أما إذا تشتتت النتائج بشكل كبير، مثل 0.91 و0.42 و0.87، فستعرف أن النموذج غير متأكد وأن الإجابة تحتاج إلى تحسين. إن التصويت بالأغلبية بين الحكام الثنائيين هو أسلوب فج، بينما يكشف متوسط الدرجات المستمرة عن الغموض.

التفكيك. المهام المعقدة نادراً ما تفشل في كل جوانبها دفعة واحدة. فقد تنقسم مهمة في مجال الروبوتات إلى الإدراك، والتخطيط، والتنفيذ الحركي. وقد تنقسم مهمة في هندسة البرمجيات إلى تصميم الخوارزمية، والتنفيذ، وتغطية الاختبار. يتيح التقييم الاحتمالي للمحقق تقييم كل مكون فرعي على حدة، مما يجعلك تدرك ليس فقط أن الإجابة ضعيفة، بل وأين تكمن نقطة الضعف. هذه الدقة التشخيصية تجعل عملية الإصلاح أسرع وأكثر استهدافاً.

النتائج في المجالات الصعبة

تظهر فائدة الإطار العملي