يقوم وكيلان من مهندسي موثوقية الموقع (SRE) يعملان بالذكاء الاصطناعي وبشكل مستقل على منصة SigNoz Managed Cloud Platform (MCP) بتحديد السبب الجذري، ونشر ملخص على Slack، وإنهاء التحقيق بالكامل في أقل من 4 ثوانٍ، بتكلفة تبلغ 0.0013 دولار فقط لكل حادثة. والنتيجة هي التحول من استعلامات روبوتات الدردشة التفاعلية إلى قوة عاملة للمراقبة (observability) ذاتية القيادة، مما يقلل من نفقات التحقيق مع الكشف عن المقاييس المهدرة.
لماذا يهم هذا الأمر
لا تزال العروض التوضيحية التقليدية للمراقبة القائمة على الذكاء الاصطناعي تتطلب من الإنسان كتابة سؤال حول التتبعات (traces) أو السجلات (logs). أما النهج الجديد فيلغي هذه الخطوة: فعندما يتم إطلاق تنبيه، يقوم النظام تلقائيًا بتشغيل دليل إجراءات (playbook) مثبت لمهندسي SRE ويقدم الإجابة.
الهاكاثون الذي أنجب هؤلاء الوكلاء
ظهر هؤلاء الوكلاء من هاكاثون WeMakeDevs × Agents of SigNoz تحت اسم المشروع MIB (Men in Backend). وبدلاً من روبوت دردشة حواري، بنى الفريق "قوة عاملة للمراقبة ذاتية القيادة" تتكون من وكيلين:
- الوكيل J – المستجيب للحوادث – يستمع للتنبيهات، ثم يتبع دليل إجراءات مكونًا من خمس خطوات: تأكيد التنبيه، تحديد التتبعات (traces) المسببة للمشكلة، التعمق في السجلات (logs) ذات الصلة، حساب الفرق (delta)، ونشر بطاقة السبب الجذري على Slack. يستغرق هذا التسلسل في المتوسط 3.7 ثانية.
- الوكيل K – المدقق – يقوم بإجراء عمليات تدقيق مجدولة لاستخدام المقاييس، ويحدد المقاييس التي تتسبب في تكاليف دون وجود استهلاك لها، ويقوم بصياغة تغييرات في لوحة التحكم (dashboard) ليوافق عليها الإنسان.
خلال الهاكاثون، أفاد الوكيل K بأن 38% من أهم المقاييس لم تُقرأ أبدًا، مما كشف عن هدر خفي في بنية المراقبة (observability stack).
كيف يعمل النظام
أدلة إجراءات حتمية، وليست حلقات مفتوحة
يتبع الوكلاء أدلة إجراءات ثابتة وحتمية بدلاً من الاستنتاج "القائم على الوكلاء" (agentic) مفتوح الشكل. تنفذ كل عملية سير عمل معروفة لمهندسي SRE — تأكيد، تتبع، سجل، فرق — مما ينتج مخرجات متسقة ويتجنب عدم القدرة على التنبؤ بنصوص النماذج اللغوية الكبيرة (LLM) غير المقيدة.
ثلاث طبقات للمراقبة
- طبقة التطبيق – يقوم التطبيق المراقب ببث التتبعات (traces) والسجلات (logs) والمقاييس إلى SigNoz.
- طبقة الوكيل – يرسل كل وكيل "نطاقات دلالية" (semantic spans) خاصة به تم إنشاؤها بواسطة الذكاء الاصطناعي التوليدي (GenAI) إلى SigNoz، مما يجعل الوكلاء أنفسهم قابلين للمراقبة.
- طبقة القياس عن بُعد لـ MCP – يقوم خادم MCP بتسجيل بيانات القياس عن بُعد (telemetry) لاستدعاء الأدوات، مما يكمل حلقة التغذية الراجعة حيث تراقب SigNoz الوكلاء الذين يراقبون SigNoz.
محرك تنبؤي للحصول على رؤى ما قبل التنبيه
تقوم عملية في الخلفية بتقييم الاتجاهات كل 25 ثانية. وعندما ترتفع معدلات التأخير (latency) أو الأخطاء، يتنبأ المحرك بوقوع حادثة قبل تجاوز عتبة التنبيه، مما يمنح الوكلاء أفضلية في البدء.
نتائج ملموسة
| المقياس | النتيجة |
|---|---|
| تكلفة التحقيق لكل عملية | $0.0013 |
| الوقت اللازم للتحليل الكامل للسبب الجذري | < 4 ثوانٍ |
| تحديد المقاييس الرئيسية غير المستخدمة | 38% |
دروس مستفادة من الميدان
- إضافة أدوات القياس اليدوية لنطاقات GenAI – تؤدي إضافة أدوات قياس (instrumentation) صريحة لالتقاط المخرجات الدلالية للذكاء الاصطناعي إلى الحفاظ على دقة البيانات وإمكانية البحث فيها.
- إيقاف تشغيل أوضاع "التفكير" – غالبًا ما تقوم النماذج اللغوية الكبيرة (LLMs) التي تحاول أن تكون حوارية باقتطاع ملفات JSON. يؤدي تعطيل هذه الأوضاع إلى فرض مخرجات موجزة وقابلة للقراءة آليًا.
- الإصلاح باستخدام RFC 6902 – سمح تطبيق JSON-Patch (RFC 6902) على منصة Foundry للفريق بإصلاح فحوصات صحة الحاويات (container health-checks) ومعايير التأخير دون الحاجة إلى إعادة نشر الخدمة بالكامل.
من المستفيد، ومن قد يكون حذرًا
يمكن للمؤسسات التي تدفع بالفعل مقابل منصات المراقبة أن ترى وفورات فورية: تقليل وقت المحللين وإلغاء جمع المقاييس غير المستخدمة.
ما الذي يجب مراقبته لاحقًا
الكود المصدري مفتوح المصدر لـ MIB متاح على GitHub، وهناك فيديو توضيحي يستعرض عملية تشغيل حادثة كاملة.
الخلاصة
يوضح دمج وكيلين متخصصين من الذكاء الاصطناعي مباشرة في SigNoz’s MCP أن التحليل الذاتي للسبب الجذري يمكن أن يكون فائق السرعة ومنخفض التكلفة للغاية. يحول هذا النهج المراقبة من أداة تقارير سلبية إلى مشارك نشط يتحرك في اللحظة التي تظهر فيها الحادثة، مما يوفر الوقت والمال والإحباط البشري الحتمي الناتج عن البحث في السجلات بعد وقوع المشكلة.
