وجد المؤلف أن وكلاء الذكاء الاصطناعي يتعافون بشكل مذهل عندما تمنحهم إذنًا صريحًا لإعادة تشغيل أدواتهم؛ حيث أدى تغيير بسيط في الصياغة إلى رفع معدل نجاح الإصلاح من 0.16 إلى 1.00. وتُظهر هذه النتيجة، التي أُطلق عليها اسم "ترخيص الإجراء" (action-licensing)، أن توجيه الوكيل للتحقق من عمله يمكن أن يكون أكثر فعالية بكثير من مجرد إعادة ذكر الهدف.

لماذا يهم هذا الإصلاح

يُستخدم المساعدون الذين يعملون بالذكاء الاصطناعي والذين يمكنهم استدعاء أدوات خارجية (قواعد البيانات، الآلات الحاسبة، واجهات برمجة التطبيقات APIs) بشكل متزايد في سير عمل الأعمال. وعندما يخطئ هؤلاء الوكلاء، غالبًا ما ينتشر الخطأ بصمت، مما يؤدي إلى إنتاج إجابات خاطئة دون إشارات فشل واضحة. إن وجود طريقة موثوقة للتدخل دون إعادة كتابة المطالبة (prompt) بالكامل يمكن أن يوفر وقت المطورين ويمنع الأخطاء المكلفة في أنظمة الإنتاج.

كيف تظهر حالات الفشل

لاحظ المؤلف نمطين شائعين من الفشل منخفض الرؤية:

  • تخطي البحث (Skipped Lookup) – يعرف الوكيل أنه يجب عليه استرداد معلومة ما (مثل اسم مدير من معرف ID) ولكنه ببساطة يختلق إجابة بدلاً من استدعاء أداة البحث. تبدو الاستجابة السطحية منطقية، ومع ذلك فإن الأساس الواقعي مفقود.

  • هراء مُصادق عليه (Validated Nonsense) – يغذي الوكيل أداةً ببيانات مشوهة أو غير صحيحة. تعيد الأداة نتيجة دون إثارة خطأ، ويتعامل الوكيل مع تلك النتيجة كأنها تأكيد، مما يعني فعليًا المصادقة على خطئه الخاص.

يترك كلا النمطين المستخدم مع إجابة واثقة ولكنها خاطئة، ولا يؤديان إلى إطلاق العلامات المعتادة للحلقات المفرغة أو الاستجابات المفقودة التي يراقبها المطورون.

التجربة

لقياس كيفية تأثير المطالبات المختلفة على الإصلاح، أجرى المؤلف اختبارًا مضبوطًا باستخدام إجابات حقيقية مؤكدة (بدون تقييم يعتمد على LLM). تمت مقارنة نوعين من التوجيه:

  1. توجيه الهدف فقط (Goal-only nudge) – "يجب أن تكون الإجابة هي اسم المدير". معدل التعافي: 0.16.

  2. توجيه ترخيص الإجراء (Action-licensing nudge) – "يجب أن تكون الإجابة هي اسم المدير. استخدم الأدوات للتحقق". معدل التعافي: 1.00 (تم تصحيح جميع عمليات التشغيل الفاشلة).

كان الفرق الوحيد هو الإذن الصريح بإعادة تنفيذ الأداة. سمح الأمر الثاني للوكيل بمعرفة أنه يمكنه العودة، وجلب البيانات المفقودة، وتجاوز تخمينه السابق. حول هذا الإذن التوجيه غير الفعال إلى إصلاح مضمون للحالات المختبرة.

ماذا تعني الأرقام

تشير القفزة من 0.16 إلى 1.00 إلى أن العائق أمام التصحيح لم يكن فهم الوكيل للهدف، بل حريته المتصورة في التصرف. عندما تخبر المطالبة النموذج "يمكنك المحاولة مرة أخرى"، فإنه يعامل الموقف كمهمة فرعية جديدة بدلاً من طريق مسدود، مما يسمح لسلسلة استدعاء الأدوات بإعادة التشغيل.

حدود الإصلاحات المعتمدة على المطالبات فقط

سلطت التجربة الضوء أيضًا على سيناريوهات لا يمكن فيها للمطالبات وحدها إنقاذ الوكيل:

  • إذا قبلت أداة لاحقة مدخلات سيئة بصمت وأعادت قيمة، فلن يكون لدى الوكيل أي إشارة إلى أن بياناته كانت خاطئة. لن تجعل أي إعادة صياغة للمطالبة الوكيل يكتشف الخلل؛ يجب على الأداة نفسها فرض التحقق من صحة المدخلات أو إثارة خطأ.

  • الوكلاء الذين يواجهون صعوبة في استدعاء الأدوات على الإطلاق لن يستفيدوا أبدًا من تعليمات "استخدم الأدوات"، لأن القدرة الأساسية مفقودة. إن اختبار الإصلاح في مثل هذه النماذج يخلط بين تقييم المطالبة وقدرة النموذج الأساسية على استدعاء الأدوات.

نصائح عملية للمطورين

  • امنح الإذن – عندما تتدخل، أخبر الوكيل صراحةً أنه يمكنه تكرار استدعاء الأداة أو إعادة الحساب. مجرد إعادة ذكر النتيجة المرجوة غالبًا ما يترك الوكيل عالقًا في مساره الأصلي الخاطئ.

  • احمِ الأدوات – قم ببناء فحوصات للمدخلات ورسائل خطأ واضحة داخل الأدوات التي يستخدمها الوكيل. هذا يمنع "الهراء المُصادق عليه" من المرور.

  • اكتشف الخطأ مبكرًا – كلما تم اكتشاف الخطأ في وقت مبكر، كان من الأسهل لطلب إعادة التنفيذ أن ينجح. يمكن لمراقبة عدم التطابق بين استخدام الأدوات المتوقع والفعلي أن يؤدي إلى إطلاق مطالبة الإصلاح في اللحظة المناسبة.

  • تحقق من قدرات النموذج – قبل الاعتماد على الإصلاح القائم على المطالبات، تأكد من أن النموذج يمكنه استدعاء الأدوات بشكل موثوق في المقام الأول. وإلا فقد تكون تقيس فعالية المطالبة على أساس هش.

الخلاصة: يمكن لمنح وكيل الذكاء الاصطناعي إذنًا صريحًا لإعادة عمله أن يحول الإصلاح الهزيل إلى تعافٍ كامل. يجب على مصممي المطالبات التعامل مع "استخدم الأدوات للتحقق" كصمام أمان، وليس كمجرد إضافة اختيارية.