دو عامل هوش مصنوعی خودگردان SRE که روی پلتفرم ابری مدیریت‌شده (MCP) شرکت SigNoz در حال اجرا هستند، علت اصلی مشکل را شناسایی کرده، خلاصه‌ای از آن را در Slack منتشر می‌کنند و کل فرآیند بررسی را در کمتر از ۴ ثانیه و با هزینه‌ای تنها معادل ۰.۰۰۱۳ دلار برای هر حادثه به پایان می‌رسانند. نتیجه این کار، گذار از پرس‌وجوهای چت‌بات‌های واکنشی به یک نیروی کار مشاهده‌پذیری خودران است که هزینه‌های بررسی را به شدت کاهش داده و در عین حال، متریک‌های هدررفته را آشکار می‌کند.

چرا این موضوع اهمیت دارد

دموهای سنتی هوش مصنوعی در حوزه مشاهده‌پذیری همچنان نیازمند این هستند که یک انسان سوالی درباره traces یا logs تایپ کند. رویکرد جدید این مرحله را حذف می‌کند: به محض فعال شدن یک هشدار (alert)، سیستم به‌طور خودکار یک دستورالعمل (playbook) اثبات‌شده‌ی SRE را اجرا کرده و پاسخ را ارائه می‌دهد.

هکاتونی که عامل‌ها را متولد کرد

این عامل‌ها در هکاتون WeMakeDevs × Agents of SigNoz تحت نام پروژه MIB (Men in Backend) پدید آمدند. تیم به جای یک چت‌بات مکالمه‌ای، یک «نیروی کار مشاهده‌پذیری خودگردان» متشکل از دو عامل ساخته است:

  • Agent J – پاسخ‌دهنده به حادثه – به هشدارها گوش می‌دهد و سپس یک دستورالعمل پنج مرحله‌ای را دنبال می‌کند: تأیید هشدار، یافتن traces مربوطه، بررسی دقیق لاگ‌های مرتبط، محاسبه اختلاف (delta) و ارسال کارت علت اصلی به Slack. این توالی به‌طور میان ۳.۷ ثانیه زمان می‌برد.
  • Agent K – حسابرس – حسابرسی‌های برنامه‌ریزی‌شده‌ای از میزان استفاده از متریک‌ها انجام می‌دهد، متریک‌هایی که هزینه ایجاد می‌کنند اما مصرفی ندارند را علامت‌گذاری می‌کند و تغییرات داشبورد را برای تأیید انسان پیش‌نویس می‌کند.

در طول هکاتون، Agent K گزارش داد که ۳۸٪ از متریک‌های برتر هرگز خوانده نشده‌اند که این امر اتلاف پنهان در پشته (stack) مشاهده‌پذیری را آشکار کرد.

سیستم چگونه کار می‌کند

دستورالعمل‌های قطعی، نه حلقه‌های باز

عامل‌ها به جای استدلال‌های آزاد و «عامل‌محور» (agentic)، از دستورالعمل‌های ثابت و قطعی پیروی می‌کنند. هر اجرا یک گردش کار شناخته‌شده‌ی SRE را اجرا می‌کند — تأیید، trace، log، delta — که خروجی ثابتی تولید کرده و از غیرقابل‌پیش‌بینی بودن متن‌های تولید شده توسط LLMهای بدون محدودیت جلوگیری می‌کند.

سه لایه مشاهده‌پذیری

  1. لایه اپلیکیشن – اپلیکیشن تحت نظارت، traces، logs و metrics را به SigNoz ارسال می‌کند.
  2. لایه عامل – هر عامل، اسپان‌های معنایی (semantic spans) تولید شده توسط GenAI خود را به SigNoz بازمی‌گرداند و باعث می‌شود خودِ عامل‌ها نیز مشاهده‌پذیر باشند.
  3. لایه تلمتری MCP – سرور MCP تلمتریِ فراخوانی ابزارها (tool-call telemetry) را ثبت می‌کند و یک حلقه بازخورد کامل ایجاد می‌کند که در آن SigNoz، عامل‌هایی را که SigNoz را زیر نظر دارند، مشاهده می‌کند.

موتور پیش‌بینی برای بینش پیش از هشدار

یک فرآیند پس‌زمینه، روندها را هر ۲۵ ثانیه امتیازدهی می‌کند. هنگامی که نرخ تأخیر (latency) یا خطاها افزایش می‌یابد، این موتور پیش از عبور از آستانه هشدار، وقوع یک حادثه را پیش‌بینی کرده و به عامل‌ها فرصت پیش‌دستی می‌دهد.

دستاوردهای ملموس

متریک نتیجه
هزینه بررسی در هر اجرا $0.0013
زمان تا تحلیل کامل علت اصلی < ۴ ثانیه
شناسایی متریک‌های پرکاربرد بدون استفاده ۳۸٪

درس‌های آموخته شده در خط مقدم

  • ابزارگذاری دستی برای GenAI spans – افزودن ابزارگذاری (instrumentation) صریح برای ثبت خروجی معنایی هوش مصنوعی، دقت و قابلیت جستجوی داده‌ها را حفظ می‌کند.
  • خاموش کردن حالت‌های «تفکر» (thinking) – مدل‌های زبانی بزرگ (LLMs) که سعی می‌کنند مکالمه‌ای باشند، اغلب ساختار JSON را ناقص رها می‌کنند. غیرفعال کردن این حالت‌ها، خروجی‌های مختصر و ماشین‌خوان را تحمیل می‌کند.
  • وصله کردن با RFC 6902 – اعمال JSON-Patch (RFC 6902) روی پلتفرم Foundry به تیم اجازه داد تا بدون بازاستقرار (redeploy) کل سرویس، بررسی سلامت کانتینرها و پارامترهای تأخیر را اصلاح کند.

چه کسانی سود می‌برند و چه کسانی ممکن است محتاط باشند

شرکت‌هایی که در حال حاضر برای پلتفرم‌های مشاهده‌پذیری هزینه پرداخت می‌کنند، می‌توانند بلافاصله شاهد صرفه‌جویی باشند: کاهش زمان تحلیلگران و حذف جمع‌آوری متریک‌های بلااستفاده.

آنچه باید در ادامه دنبال کرد

کد متن‌باز MIB در GitHub موجود است و یک ویدئوی دمو، یک اجرای کامل از یک حادثه را نمایش می‌دهد.

جمع‌بندی

گنجاندن دو عامل هوش مصنوعی تخصصی مستقیماً در MCP شرکت SigNoz نشان می‌دهد که تحلیل خودکار علت اصلی می‌تواند بسیار سریع و بسیار ارزان باشد. این رویکرد، مشاهده‌پذیری را از یک ابزار گزارش‌دهی غیرفعال به یک شرکت‌کننده فعال تبدیل می‌کند که به محض وقوع یک حادثه اقدام می‌کند و در زمان، هزینه و ناامیدی اجتناب‌ناپذیر انسان در جستجوی لاگ‌ها پس از وقوع حادثه، صرفه‌جویی می‌کند.