دو عامل هوش مصنوعی خودگردان SRE که روی پلتفرم ابری مدیریتشده (MCP) شرکت SigNoz در حال اجرا هستند، علت اصلی مشکل را شناسایی کرده، خلاصهای از آن را در Slack منتشر میکنند و کل فرآیند بررسی را در کمتر از ۴ ثانیه و با هزینهای تنها معادل ۰.۰۰۱۳ دلار برای هر حادثه به پایان میرسانند. نتیجه این کار، گذار از پرسوجوهای چتباتهای واکنشی به یک نیروی کار مشاهدهپذیری خودران است که هزینههای بررسی را به شدت کاهش داده و در عین حال، متریکهای هدررفته را آشکار میکند.
چرا این موضوع اهمیت دارد
دموهای سنتی هوش مصنوعی در حوزه مشاهدهپذیری همچنان نیازمند این هستند که یک انسان سوالی درباره traces یا logs تایپ کند. رویکرد جدید این مرحله را حذف میکند: به محض فعال شدن یک هشدار (alert)، سیستم بهطور خودکار یک دستورالعمل (playbook) اثباتشدهی SRE را اجرا کرده و پاسخ را ارائه میدهد.
هکاتونی که عاملها را متولد کرد
این عاملها در هکاتون WeMakeDevs × Agents of SigNoz تحت نام پروژه MIB (Men in Backend) پدید آمدند. تیم به جای یک چتبات مکالمهای، یک «نیروی کار مشاهدهپذیری خودگردان» متشکل از دو عامل ساخته است:
- Agent J – پاسخدهنده به حادثه – به هشدارها گوش میدهد و سپس یک دستورالعمل پنج مرحلهای را دنبال میکند: تأیید هشدار، یافتن traces مربوطه، بررسی دقیق لاگهای مرتبط، محاسبه اختلاف (delta) و ارسال کارت علت اصلی به Slack. این توالی بهطور میان ۳.۷ ثانیه زمان میبرد.
- Agent K – حسابرس – حسابرسیهای برنامهریزیشدهای از میزان استفاده از متریکها انجام میدهد، متریکهایی که هزینه ایجاد میکنند اما مصرفی ندارند را علامتگذاری میکند و تغییرات داشبورد را برای تأیید انسان پیشنویس میکند.
در طول هکاتون، Agent K گزارش داد که ۳۸٪ از متریکهای برتر هرگز خوانده نشدهاند که این امر اتلاف پنهان در پشته (stack) مشاهدهپذیری را آشکار کرد.
سیستم چگونه کار میکند
دستورالعملهای قطعی، نه حلقههای باز
عاملها به جای استدلالهای آزاد و «عاملمحور» (agentic)، از دستورالعملهای ثابت و قطعی پیروی میکنند. هر اجرا یک گردش کار شناختهشدهی SRE را اجرا میکند — تأیید، trace، log، delta — که خروجی ثابتی تولید کرده و از غیرقابلپیشبینی بودن متنهای تولید شده توسط LLMهای بدون محدودیت جلوگیری میکند.
سه لایه مشاهدهپذیری
- لایه اپلیکیشن – اپلیکیشن تحت نظارت، traces، logs و metrics را به SigNoz ارسال میکند.
- لایه عامل – هر عامل، اسپانهای معنایی (semantic spans) تولید شده توسط GenAI خود را به SigNoz بازمیگرداند و باعث میشود خودِ عاملها نیز مشاهدهپذیر باشند.
- لایه تلمتری MCP – سرور MCP تلمتریِ فراخوانی ابزارها (tool-call telemetry) را ثبت میکند و یک حلقه بازخورد کامل ایجاد میکند که در آن SigNoz، عاملهایی را که SigNoz را زیر نظر دارند، مشاهده میکند.
موتور پیشبینی برای بینش پیش از هشدار
یک فرآیند پسزمینه، روندها را هر ۲۵ ثانیه امتیازدهی میکند. هنگامی که نرخ تأخیر (latency) یا خطاها افزایش مییابد، این موتور پیش از عبور از آستانه هشدار، وقوع یک حادثه را پیشبینی کرده و به عاملها فرصت پیشدستی میدهد.
دستاوردهای ملموس
| متریک | نتیجه |
|---|---|
| هزینه بررسی در هر اجرا | $0.0013 |
| زمان تا تحلیل کامل علت اصلی | < ۴ ثانیه |
| شناسایی متریکهای پرکاربرد بدون استفاده | ۳۸٪ |
درسهای آموخته شده در خط مقدم
- ابزارگذاری دستی برای GenAI spans – افزودن ابزارگذاری (instrumentation) صریح برای ثبت خروجی معنایی هوش مصنوعی، دقت و قابلیت جستجوی دادهها را حفظ میکند.
- خاموش کردن حالتهای «تفکر» (thinking) – مدلهای زبانی بزرگ (LLMs) که سعی میکنند مکالمهای باشند، اغلب ساختار JSON را ناقص رها میکنند. غیرفعال کردن این حالتها، خروجیهای مختصر و ماشینخوان را تحمیل میکند.
- وصله کردن با RFC 6902 – اعمال JSON-Patch (RFC 6902) روی پلتفرم Foundry به تیم اجازه داد تا بدون بازاستقرار (redeploy) کل سرویس، بررسی سلامت کانتینرها و پارامترهای تأخیر را اصلاح کند.
چه کسانی سود میبرند و چه کسانی ممکن است محتاط باشند
شرکتهایی که در حال حاضر برای پلتفرمهای مشاهدهپذیری هزینه پرداخت میکنند، میتوانند بلافاصله شاهد صرفهجویی باشند: کاهش زمان تحلیلگران و حذف جمعآوری متریکهای بلااستفاده.
آنچه باید در ادامه دنبال کرد
کد متنباز MIB در GitHub موجود است و یک ویدئوی دمو، یک اجرای کامل از یک حادثه را نمایش میدهد.
جمعبندی
گنجاندن دو عامل هوش مصنوعی تخصصی مستقیماً در MCP شرکت SigNoz نشان میدهد که تحلیل خودکار علت اصلی میتواند بسیار سریع و بسیار ارزان باشد. این رویکرد، مشاهدهپذیری را از یک ابزار گزارشدهی غیرفعال به یک شرکتکننده فعال تبدیل میکند که به محض وقوع یک حادثه اقدام میکند و در زمان، هزینه و ناامیدی اجتنابناپذیر انسان در جستجوی لاگها پس از وقوع حادثه، صرفهجویی میکند.
