يتيح AgentInspect للمطورين تسجيل إجراءات وكيل الذكاء الاصطناعي (AI agent) خطوة بخطوة في شكل سجلات JSONL، مما يجعل من الممكن التحقق من تشغيل الأدوات المطلوبة - كل ذلك دون الحاجة إلى ربط OpenTelemetry في البنية التحتية (stack).
في اختبار سريع باستخدام مثال للتحقق من الطقس مبني على Vercel AI SDK، رصد AgentInspect "فشلاً صامتاً": كانت الإجابة النهائية صحيحة، لكن استدعاء أداة الطقس (weather-tool) لم يحدث أبداً. لقد اكتشف الفحص على مستوى العملية (process-level check) الذي توفره المكتبة المشكلة التي كان اختبار المخرجات العادي سيتجاهلها.
لماذا يهم مسار التنفيذ
استجابة وكيل الذكاء الاصطناعي هي المنتج النهائي لسلسلة قد تتضمن استدعاءات متعددة للنماذج (model invocations) واستدعاءات لأدوات خارجية. إذا كان من المفترض أن يقوم الأمر (prompt) بجلب بيانات مباشرة، فإن عدم حدوث هذا الجلب يغير ملف المخاطر حتى لو بدا النص صحيحاً. تسمح الاختبارات على مستوى الإجابة بمرور الأخطاء التي تتخطى خطوة حاسمة إلى مرحلة الإنتاج دون ملاحظتها.
ماذا يفعل AgentInspect
- تسجيل خفيف الوزن – يقوم محول TypeScript بالارتباط بكود الوكيل وكتابة كل استدعاء للنموذج، واستدعاء للأداة، وترتيبهما في ملف JSON (JSONL) محدد بالأسطر.
- محرك قواعد – يعلن المطورون عن شروط بسيطة مثل "يجب استدعاء أداة الطقس" أو "يجب عدم استخدام finance API". تقوم المكتبة بتقييم هذه القواعد بعد كل عملية تشغيل.
- فحص عبر واجهة السطر البرمجي (CLI) – يتم حفظ عمليات التشغيل الفاشلة كملفات يمكن لأداة السطر البرمجي المدمجة فتحها لإعادة عرض مسار التنفيذ (execution trace) بشكل قابل للقراءة من قبل البشر.
ولأن السجلات هي ملفات محلية، فلا حاجة لخادم تتبع خلفي (tracing backend)، أو إعدادات شبكة، أو خدمة مراقبة (observability service) منفصلة.
كيف تم إعداد الاختبار
- فحوصات العملية – تحققت قاعدة من أنه تم استدعاء نقطة نهاية weather-tool.
- فحوصات الإجابة – قارن تأكيد (assertion) منفصل النص المُنشأ بالتوصية المتوقعة للأنشطة السياحية الداخلية.
تم تشغيل سيناريوهين:
| السيناريو | فحص الإجابة | فحص العملية |
|---|---|---|
| المسار المثالي (تم جلب الطقس) | ناجح | ناجح |
| تخطي الطقس (لم يتم استدعاء الأداة) | ناجح | فاشل |
يوضح التشغيل الثاني قيمة فحوصات العملية: بدت الإجابة جيدة، لكن عدم استدعاء الأداة أشار إلى وجود خلل خفي.
AgentInspect مقابل Promptfoo
يعد Promptfoo إطار عمل اختبار أكثر رسوخاً، وهو يلتقط المسارات عبر OpenTelemetry. يعمل هذا النهج بشكل جيد للفرق التي ترسل بالفعل بيانات القياس عن بُعد (telemetry data) إلى مجمع بيانات، ولكنه يضيف عبء الإعداد والاعتماد على بنية تحتية للتتبع.
يبدو AgentInspect مناسباً لمراحل التطوير المبكرة، ولكنه بسيط للغاية في الإعداد.
من يجب أن يهتم
- خطوط أنابيب CI – إضافة خطوة واحدة تقوم بتشغيل AgentInspect وتفشل عملية البناء (build) عند انتهاك القواعد يحول الأخطاء الصامتة إلى توقفات حاسمة.
- تصحيح الأخطاء (Debugging) – يمكن فتح سجلات JSONL محلياً لإعادة تشغيل تسلسل الاستدعاءات بدقة، مما يوفر الوقت مقارنة بالبحث في لوحات تحكم التتبع عن بُعد.
- فرق المنتج – معرفة أن عملية جلب البيانات الحرجة قد حدثت بالفعل قبل إطلاق الميزة يقلل من مخاطر شكاوى المستخدمين اللاحقة.
الخلاصة: عندما تعتمد دقة وكيل الذكاء الاصطناعي على الإجراءات التي يتخذها، وليس فقط على النص النهائي، يمكن لمسجل خفيف الوزن مثل AgentInspect تحويل أخطاء العمليات الخفية إلى إخفاقات مرئية وقابلة للاختبار — دون الحاجة إلى عبء بنية تتبع كاملة.
