لماذا تفشل وكلاء البحث بالذكاء الاصطناعي: المشكلة الحرجة للغموض
بينما يركز المطورون على تحسين عمق الاستدلال لوكلاء الذكاء الاصطناعي، فإن العائق الحقيقي في البحث المستقل ليس القدرة على البحث، بل عدم القدرة على التعامل مع الغموض. تكشف دراسة جديدة أن أكثر النماذج اللغوية الكبيرة (LLMs) تقدماً تعاني من صعوبة في التوقف وطلب التوضيح، مما يؤدي غالباً إلى "تسلسل أخطاء" كارثي في سلاسل الاستدلال الطويلة.
طفرة DiscoBench
قدم باحثون من Tencent Hunyuan وجامعة Tsinghua إطار عمل DiscoBench، وهو إطار اختبار متخصص مصمم لتقييم كيفية تعامل النماذج اللغوية مع استفسارات المستخدم الغامضة أو غير المكتملة أو غير الصحيحة. وعلى عكس المعايير السابقة مثل GAIA أو BrowseComp، التي تفترض وجود مطالبات (prompts) مصاغة بشكل مثالي، يحاكي DiscoBench الفوضى في العالم الحقيقي.
يتكون إطار العمل من 211 مهمة عبر أحد عشر مجالاً — بما في ذلك العلوم والسياسة والموسيقى — تحتوي على 463 نقطة غموض محددة. عند كل نقطة تفتيش، يجب على الوكيل أن يقرر ما إذا كان سيستمر في البحث، أو يقدم إجابة، أو — وهو الأهم — يطلب التوضيح من المستخدم. ولمحاكاة التفاعل البشري، استخدم الباحثون Gemini 3 Flash كمحاكي مستخدم يعتمد على LLM لتقديم تلميحات عندما يطرح الوكيل سؤال متابعة عالي الجودة.
تسلسل الأخطاء: لماذا لا يعني البحث الأكثر نتائج أفضل
تحدد الدراسة نمطاً خطيراً: عندما يواجه الوكيل كياناً غامضاً أو مجموعة متضاربة من المعايير، فإنه غالباً ما يختار "البحث بجهد أكبر" بدلاً من طلب المساعدة. يؤدي هذا إلى ظاهرة حيث ينفذ النموذج عمليات بحث نظيفة وصحيحة نحوياً ولكنها موجهة بشكل خاطئ جوهرياً.
تظهر البيانات أن "البحث بشكل أكبر" يمكن أن يقلل في الواقع من الدقة. في ملف "SearchHeavyGuess" — حيث تبحث النماذج بشكل متكرر ولكنها تخمن في النهاية بدلاً من الاستيضاح — انخفضت معدلات النجاح إلى 51.9%. في المقابل، حققت النماذج التي استخدمت استراتيجية "SearchThenAsk" معدل نجاح أعلى بكثير بلغ 93.4%. وهذا يثبت أن الفشل ليس في استرجاع المعلومات، بل في القدرة الحوارية (conversational agency).
معايير أداء النماذج الرائدة
كشف اختبار أحد عشر نموذجاً من الطراز الأول عن واقع صادم: حتى قادة الصناعة يكافحون لكسر حاجز الدقة بنسبة 50% عند مواجهة الغموض.
- Doubao Seed 2.0 Pro تصدر المجموعة بدقة 43.1% من البداية إلى النهاية.
- Gemini 3.1 Pro Preview جاء في المرتبة الثانية بفارق ضئيل بنسبة 40.8%.
- Claude Opus 4.7 وصل إلى 39.8%، رغم امتلاكه معدل اجتياز نقاط تفتيش أعلى (57%).
- Qwen3.6 Max و MiniMax M2.7 تراجعا بشكل ملحوظ بنسبة 12.3% و 16.1% على التوالي.
ومن المثير للاهتمام أنه حتى عندما قدم الباحثون مطالبة نظام "Guided" تخبر النماذج صراحةً بمراقبة الغموض، فإن الدقة من البداية إلى النهاية ارتفعت قليلاً فقط من 28.6% إلى 33.7%. وهذا يشير إلى أن "اكتشاف" الغموض و"معرفة كيفية حله عبر التفاعل" هما مهارتان معرفيتان متميزتان.
التداعيات على مشهد الذكاء الاصطناعي
ينقل هذا البحث التركيز في تطوير الذكاء الاصطناعي الوكيل (agentic AI). لبناء باحثين مستقلين موثوقين حقاً، يجب على الصناعة أن تتجاوز مجرد زيادة وتيرة "استدعاء الأدوات" (tool call) والتركيز على الاستدلال التفاعلي. إن الحدود التالية لتحسين LLM ليست مجرد استرجاع أفضل، بل هي تطوير "منطق استيضاح" أفضل لمنع تراكم الأخطاء أثناء المهام المعقدة والمتعددة الخطوات.
خلاصات رئيسية
- الغموض هو نقطة الفشل الأساسية: تفشل وكلاء الذكاء الاصطناعي ليس لأنها لا تستطيع العثور على المعلومات، بل لأنها تفشل في طلب التوضيح عندما يكون الاستفسار غير محدد بدقة.
- فخ "البحث المكثف" (Search-Heavy): البحث المتكرر عن الكيان الخاطئ يخلق تسلسلاً من الأخطاء يصعب التعافي منه أكثر من مجرد التخمين.
- الاكتشاف $\neq$ الحل: درجات الاكتشاف العالية (تحديد الخطأ) لا تترجم تلقائياً إلى معدلات نجاح عالية، مما يسلط الضوء على فجوة في كيفية تعامل النماذج مع حل المشكلات حوارياً.
