يمكن الآن لأربعة وكلاء ذكاء اصطناعي مستقلين اكتشاف خلل برمجِي، وتعديل الكود المسبب للخلل، وتأكيد الإصلاح — كل ذلك في أقل من دقيقة، بفضل سير عمل جديد يعتمد على قابلية المراقبة (observability) تم بناؤه من أجل هاكاثون SigNoz.
يقوم النظام، الذي أُطلق عليه اسم AgentOps، بمراقبة SigNoz بحثًا عن طفرات الأخطاء، ويسحب السجلات (logs) والتتبعات (traces) ذات الصلة، ويحدد الملف والسطر المسؤولين بدقة، ثم يعدل المصدر في بيئة معزولة (sandbox)، وبعد ذلك يعيد تشغيل الطلب لإثبات اختفاء الخلل. تنتهي كل دورة كاملة في غضون 30-60 ثانية، وتعمل العملية بأكملها دون الحاجة إلى أي توجيه بشري.
لماذا تهم قابلية المراقبة وكلاء الذكاء الاصطناعي
تتعامل ممارسات SRE التقليدية مع السجلات والمقاييس والتتبعات الموزعة (distributed traces) كأنها "عيون" الخدمة. فعندما يفشل طلب ما، يتتبع المهندس المسار وصولاً إلى المكون المسبب للمشكلة. المبدأ نفسه هو ما يشغل AgentOps الآن، ولكن "الخدمة" التي تتم مراقبتها هي وكيل الذكاء الاصطناعي نفسه.
كل أداة يستدعيها الوكيل — سواء كانت استدعاءً لنموذج لغوي، أو تعديلاً في نظام الملفات، أو مشغلاً للاختبارات — تنشئ نطاقاً (span) في التتبع. يسجل النطاق وقت البدء والمدة وحالة النجاح، بحيث يمكن للوكيل معرفة المدة التي استغرقتها كل خطوة استنتاج وما إذا كانت قد نجحت. ومن خلال ربط هذه النطاقات معاً، يبني الوكيل صورة كاملة لعملية التفكير الخاصة به، تماماً كما يفعل الإنسان عند تصحيح الأخطاء يدوياً.
التحول الجوهري هو الانتقال من "قابلية المراقبة كطبقة تقارير" إلى "قابلية المراقبة كإدراك". يقوم AgentOps بتغذية بيانات التتبع مرة أخرى إلى الوكلاء، مما يسمح لهم بالاستنتاج حول أفعالهم في الوقت الفعلي. والنتيجة هي حلقة لا يكتفي فيها الذكاء الاصطناعي بوضع فرضية فحسب، بل يتحقق من صحتها أيضاً مقابل نفس بيانات القياس عن بُعد (telemetry) التي يستخدمها لاكتشاف المشكلة.
سير العمل المكون من أربع خطوات
- المراقبة (Monitor) – يقوم مراقب خفيف الوزن بمسح SigNoz بحثاً عن الأخطاء المبلغ عنها حديثاً.
- التشخيص (Diagnose) – يسحب الوكيل السجلات والتتبعات المرتبطة، ويستخرج مكدس الأخطاء (stack)، ويعزل ملف المصدر ورقم السطر الذي تسبب في الفشل.
- الإصلاح (Fix) – باستخدام خادم نظام ملفات معزول (sandboxed)، يكتب الوكيل تصحيحاً (patch) للسطر المحدد. تفرض البيئة المعزولة أذونات صارمة وتقوم بالتراجع تلقائياً إذا انتهك التعديل السياسة المتبعة.
- التحقق (Verify) – يعيد الوكيل إرسال الطلب الأصلي مقابل الكود الذي تم إصلاحه. إذا أظهر التتبع تشغيلاً سليماً، يتم اعتماد الإصلاح؛ وإلا، يقوم الوكيل بتكرار العملية.
يتم تنسيق جميع الخطوات بواسطة نفس المجموعة من الوكلاء، حيث يعمل كل منهم كخدمة مصغرة (micro-service) مستقلة. السلسلة بأكملها قابلة للمراقبة من خلال نطاقات (spans) متوافقة مع OpenTelemetry، والتي يقوم SigNoz باستيعابها وتصورها.
دروس مستفادة بشق الأنفس حول الموثوقية
وضوح الخطأ
حالة "فشل" العامة لا تخبرنا بشيء. أضاف الفريق أسباب فشل دقيقة — مثل "فرضية خاطئة" أو "التصحيح أدى لتعطل العملية" — حتى تتمكن الوكلاء اللاحقة من اتخاذ قرار بشأن إعادة المحاولة، أو التراجع، أو الإلغاء. وهذا يحاكي الطريقة التي تحدد بها عمليات تحليل ما بعد الوفاة (post-mortems) البشرية الأسباب الجذرية.
زمن انتقال البيانات
لا تظهر بيانات القياس عن بُعد (telemetry) فوراً. يتضمن الوكلاء الآن وقفة قصيرة وفحصاً منطقياً للتأكد من وصول السجلات المطلوبة قبل تأكيد الإصلاح. وبدون هذه الحماية، قد يتصرف الوكيل بناءً على بيانات غير مكتملة ويؤدي إلى نتيجة إيجابية خاطئة (false positive).
الحدود الأمنية
إن السماح للذكاء الاصطناعي بكتابة الكود يمثل خطراً يتمثل في تصعيد الامتيازات (privilege escalation). تعمل البيئة المعزولة خلف خادم نظام ملفات مخصص يحد من نطاق الكتابة في المستودع المستهدف، ويستعيد الحالة السابقة تلقائياً إذا فشل الاختبار. يحافظ نموذج الاحتواء هذا على ضبط قدرات الذكاء الاصطناعي.
حدود الرموز (Token limits)
تستهلك النماذج اللغوية الكبيرة رموز API، ويمكن استنفاد الحصص اليومية في منتصف عملية التحقيق. يتتبع AgentOps استخدام الرموز لكل حادثة ويقوم بتقنين (throttling) المزيد من الاستدعاءات بمجرد الوصول إلى حد معين، مما يمنع سلسلة من الإصلاحات الفاشلة عند نفاد الحصة.
ما أثبته العرض التجريبي
قام الفريق بحقن خلل جديد تماماً لم يسبق ظهوره في قاعدة الكود. اكتشف AgentOps الشذوذ، وتتبعه وصولاً إلى السطر المحدد، وأنشأ تعديلاً تصحيحياً، وطبق التصحيح في البيئة المعزولة، وتحقق من نجاح الطلب — كل ذلك دون أي تغييرات يدوية في الكود أو مطالبات (prompts) جديدة. ظل الوقت الإجمالي أقل من دقيقة، وهو ما يطابق المدة المبلغ عنها (30-60 ثانية).
وجهة نظر معارضة: الاستقلالية ليست حلاً سحرياً
ما يجب مراقبته لاحقاً
- القياس عن بُعد المستقل عن النموذج – مع قيام المزيد من الموردين بتوفير spans متوافقة مع OpenTelemetry، قد يصبح هذا النهج محايداً للموردين، مما يسهل اعتماده عبر مجموعات تقنية (stacks) غير متجانسة.
- ضوابط قائمة على السياسات – إن دمج سياسات قابلة للتكوين تحدد الملفات التي يمكن للوكيل (agent) تعديلها، أو مجموعات الاختبار التي يجب اجتيازها قبل عملية الالتزام (commit)، سيعالج مخاوف الحوكمة.
- ميزانية الرموز (tokens) المدركة للتكلفة – يمكن أن يؤدي التخصيص الديناميكي للرموز بناءً على شدة الحادث إلى منع استنفاد الحصة المخصصة مع الحفاظ على القدرة على التعامل مع الأخطاء البرمجية عالية التأثير.
تُظهر AgentOps أن دورة إصلاح الأخطاء يمكن أن تستغرق ما بين 30 إلى 60 ثانية. وتُثبت التجربة إثبات المفهوم (proof-of-concept) بأن إمكانية المراقبة (observability) يمكن استخدامها بواسطة المساعدين البرمجيين المستقلين.
