تتسابق الشركات الكبرى لنشر وكلاء الذكاء الاصطناعي المستقلين، ولكن هناك فجوة خطيرة تتسع بين الاختبارات الداخلية والأداء في العالم الحقيقي. تمنح المؤسسات الوكلاء استقلالية أكبر، بينما تفشل أطر الحوكمة في التنبؤ بالأخطاء التي تواجه العملاء.
مشكلة المواءمة مع الواقع
كشف بحث VentureBeat Pulse عن "فجوة تقييم" مذهلة في الذكاء الاصطناعي للمؤسسات. فقد قامت 50% من الشركات بإطلاق وكيل ذكاء اصطناعي أو ميزة تعتمد على النماذج اللغوية الكبيرة (LLM) اجتازت كل التقييمات الداخلية، لتفشل في اللحظة التي يتفاعل فيها عميل حقيقي معها.
والأسوأ من ذلك أن 24% من تلك الشركات شهدت تكرار الفشل نفسه، مما يكشف عن عجز مزمن عن محاكاة الحالات الحدية (edge cases) المعقدة. وغالبًا ما تنبع الأخطاء من سلاسل الاستدلال المكسورة بدلاً من مجرد إجابات خاطئة معزولة، مما يظهر أن المعايير الحالية تغفل عدم القدرة على التنبؤ بسير عمل الوكلاء (agentic workflows).
أزمة الثقة في التقييمات المؤتمتة
تثق 5% فقط من الشركات التي شملها الاستطلاع في التقييمات المؤتمتة بشكل كامل اليوم. وينبع عدم الثقة هذا من خللين تقنيين:
- ضعف المواءمة مع الواقع: يقول 29% من القادة إن تقييماتهم لا تعكس ما يحدث فعليًا في تفاعلات العملاء.
- التحيز وعدم الاتساق: أفاد 21% بوجود نتائج منحازة أو غير مستقرة من أطر الاختبار الخاصة بهم.
إن بنية أدوات التقييم (evaluation stack) مجزأة؛ حيث تعتمد العديد من الشركات فقط على الأدوات الأصلية من مطوري النماذج، بينما لا تملك 17% من الشركات أي أدوات تقييم مخصصة على الإطلاق. وتقوم حوالي الربع بإجراء فحوصات جودة في الوقت الفعلي على حركة المرور المباشرة، مما يترك البقية يكتشفون المشكلات بعد وصولها إلى المستخدمين.
سرعة الاستقلالية مقابل البطء في ضمان الجودة
تتجه ثلثا المؤسسات (66%) نحو النشر دون تدخل بشري (zero-human-in-the-loop). وتسمح 34% منها بالفعل بالنشر المؤتمت بالكامل للوكلاء منخفضي المخاطر، بينما تعمل نسبة 33% أخرى على هندسة مسارات عمل للوصول إلى هذه النقطة في غضون اثني عشر شهرًا.
تكتسب الوكلاء قوة اتخاذ القرار بشكل أسرع من الآليات المصممة لمراقبتها وتصحيحها. ويتطلب السوق الآن منصات متخصصة للمراقبة والتقييم (observability and evaluation) تتحقق من صحة الوكلاء مقابل سلوك المستخدمين المباشر وغير المتوقع، بدلاً من الاعتماد على المعايير الثابتة.
النقاط الرئيسية المستخلصة
- مفارقة النجاح: قامت 50% من الشركات بنشر وكلاء اجتازوا الاختبارات الداخلية لكنهم فشلوا في مرحلة الإنتاج.
- عجز الثقة: تثق 5% فقط بشكل كامل في التقييمات المؤتمتة، ويرجع ذلك أساسًا إلى عدم مواءمة الاختبارات مع نتائج العالم الحقيقي.
- سباق الاستقلالية: تستخدم 66% من الشركات بالفعل أو تخطط لعمليات نشر دون تدخل بشري.
يظهر بحث VentureBeat Pulse أن نصف وكلاء الذكاء الاصطناعي في المؤسسات الذين يجتازون الاختبارات الداخلية يتعثرون بمجرد مواجهة عميل حقيقي، مما يسلط الضوء على اتساع "فجوة التقييم" في الوقت الذي تسرع فيه الشركات نحو عمليات النشر المستقلة بالكامل.
شملت الدراسة الشركات التي أطلقت وكلاء يعتمدون على النماذج اللغوية الكبيرة (LLM) أو تستعد للقيام بذلك. ووجدت أن 50% من المشاركين أطلقوا وكيلًا اجتاز كل المعايير الداخلية ليواجه الفشل في مرحلة الإنتاج. وأفاد 24% إضافيون بتكرار الفشل نفسه أكثر من مرة، مما يؤكد أن المشكلة هي نقطة عمياء متكررة في أنظمة الاختبار الحالية.
لماذا تخفق الاختبارات الداخلية في تحقيق الهدف
لا تتعلق الفجوة بالتغطية فحسب، بل سلط المشاركون الضوء على عدم مواءمة أعمق بين عمليات المحاكاة المختبرية وفوضى التفاعلات في العالم الحقيقي. غالبًا ما تنشأ الأخطاء من سلاسل الاستدلال المكسورة — وهي حالات ينحرف فيها المنطق الداخلي للوكيل عن النتائج المتوقعة — بدلاً من مجرد إجابات خاطئة معزولة.
وتهيمن مشكلتان تقنيتان على الشكاوى:
- ضعف المواءمة مع الواقع – قال 29% من القادة إن تقييماتهم تفشل في عكس ما يحدث فعليًا عندما يتفاعل العميل مع الوكيل.
- التحيز وعدم الاتساق – أشار 21% إلى أن أطر الاختبار الخاصة بهم تنتج نتائج منحازة أو غير مستقرة، مما يؤدي إلى تآكل الثقة في المقاييس التي يعتمدون عليها.
ومما يزيد الأمر سوءًا، أن بنية أدوات التقييم مجزأة للغاية. تعتمد العديد من المؤسسات حصريًا على الأدوات الأصلية التي يوفرها موردو النماذج، بينما تعترف 17% بأنه ليس لديها أي أدوات تقييم مخصصة على الإطلاق. وتقوم حوالي الربع فقط بإجراء فحوصات جودة في الوقت الفعلي على حركة المرور المباشرة، مما يترك البقية يكتشفون المشكلات بعد وصولها بالفعل إلى المستخدمين.
الثقة شحيحة
تقول 5% فقط من الشركات التي شملها الاستطلاع إنها تثق تمامًا في التقييمات المؤتمتة اليوم. ويعد نقص الثقة نتيجة مباشرة لمشكلات المواءمة والتحيز المذكورة أعلاه. فعندما لا تستطيع مجموعة الاختبار التنبؤ بسلوك الإنتاج بشكل موثوق، يتردد المسؤولون التنفيذيون في السماح للوكلاء بالعمل دون إشراف بشري.
الاستقلالية تتجاوز الضمانات
رغم انخفاض الثقة في الاختبارات، فإن السعي نحو الاستقلالية مستمر بلا هوادة. يتجه ثلثا المستجيبين — 66% — نحو عمليات النشر التي لا تتطلب أي تدخل بشري (zero-human-in-the-loop). وضمن هذه المجموعة، تسمح نسبة 34% بالفعل بالنشر الآلي بالكامل للوكلاء منخفضي المخاطر، بينما تعمل نسبة 33% أخرى على هندسة مسارات عمل للوصول إلى النقطة نفسها خلال الاثني عشر شهرًا القادمة.
تكتسب الوكلاء قدرة على اتخاذ القرار بشكل أسرع من الآليات المصممة لمراقبتها وتصحيحها. والتبعات على السوق واضحة: طلب متزايد على منصات المراقبة (observability) والتقييم المتخصصة التي يمكنها التحقق من أداء الوكلاء مقابل سلوك المستخدم الحي وغير المتوقع، بدلاً من الاعتماد على المعايير المرجعية (benchmarks) الثابتة.
