SigNoz च्या Managed Cloud Platform (MCP) वर चालणारे दोन स्वायत्त (autonomous) AI SRE एजंट्स मूळ कारण (root-cause) शोधतात, Slack वर सारांश पोस्ट करतात आणि संपूर्ण तपासणी ४ सेकंदांच्या आत पूर्ण करतात, ज्याचा खर्च प्रति घटना केवळ $०.००१३ येतो. याचा परिणाम म्हणजे रिअॅक्टिव्ह चॅटबॉट क्वेरीजकडून 'सेल्फ-ड्रायव्हिंग ऑब्झर्व्हेबिलिटी वर्कफोर्स'कडे झालेला बदल, जो तपासणीचा खर्च कमी करतो आणि वाया जाणारे मेट्रिक्स समोर आणतो.

हे महत्त्वाचे का आहे

पारंपारिक AI-observability डेमोंमध्ये अजूनही ट्रेस (traces) किंवा लॉग्स (logs) बद्दल प्रश्न विचारण्यासाठी मानवाचा वापर करावा लागतो. नवीन दृष्टिकोन हा टप्पा काढून टाकतो: जेव्हा अलर्ट येतो, तेव्हा सिस्टम आपोआप एक सिद्ध झालेला SRE playbook चालवते आणि उत्तर देते.

एजंट्सना जन्म देणारा हॅकाथॉन

हे एजंट्स WeMakeDevs × Agents of SigNoz हॅकाथॉनमधून MIB (Men in Backend) या प्रोजेक्ट नावाने समोर आले. संवादात्मक चॅटबॉटऐवजी, टीमने दोन एजंट्सचा "स्वायत्त ऑब्झर्व्हेबिलिटी वर्कफोर्स" (autonomous observability workforce) तयार केला:

  • Agent J – द इन्सिडेंट रिस्पॉन्डर – अलर्ट्सवर लक्ष ठेवतो आणि त्यानंतर पाच-टप्प्यांचा playbook फॉलो करतो: अलर्टची खात्री करणे, संबंधित ट्रेस शोधणे, संबंधित लॉग्सचे सखोल विश्लेषण करणे, डेल्टा (delta) मोजणे आणि Slack वर root-cause कार्ड पोस्ट करणे. ही प्रक्रिया सरासरी ३.७ सेकंद घेते.
  • Agent K – द ऑडिटर – मेट्रिक वापराचे नियोजित ऑडिट करतो, खर्च वाढवणारे पण वापर नसलेले मेट्रिक्स फ्लॅग करतो आणि मानवी मंजुरीसाठी डॅशबोर्डमधील बदलांचा मसुदा तयार करतो.

हॅकाथॉन दरम्यान, Agent K ने अहवाल दिला की टॉप मेट्रिक्सपैकी ३८% कधीही वाचले गेले नव्हते, ज्यामुळे ऑब्झर्व्हेबिलिटी स्टॅक मधील लपलेला अपव्यय समोर आला.

सिस्टम कशी काम करते

अनिश्चित लूप्सऐवजी डिटरमिनिस्टिक (Deterministic) प्लेबुक्स

एजंट्स मुक्त स्वरूपाच्या "agentic" तर्काऐवजी निश्चित, डिटरमिनिस्टिक प्लेबुक्स फॉलो करतात. प्रत्येक रन एक ज्ञात SRE वर्कफ्लो—confirm, trace, log, delta—अंमलबजावणी करते, ज्यामुळे सुसंगत आउटपुट मिळते आणि अनियंत्रित LLM मजकुरामुळे येणारी अनिश्चितता टाळता येते.

ऑब्झर्व्हेबिलिटीचे तीन स्तर

  1. Application layer – मॉनिटर केलेले ॲप SigNoz कडे traces, logs आणि metrics स्ट्रीम करते.
  2. Agent layer – प्रत्येक एजंट स्वतःचे GenAI-जनरेटेड semantic spans परत SigNoz कडे पाठवतो, ज्यामुळे एजंट्स स्वतः ऑब्झर्व्हेबल बनतात.
  3. MCP telemetry layer – MCP सर्व्हर tool-call telemetry रेकॉर्ड करतो, ज्यामुळे एक फीडबॅक लूप पूर्ण होतो जिथे SigNoz अशा एजंट्सवर लक्ष ठेवते जे स्वतः SigNoz वर लक्ष ठेवतात.

प्री-अलर्ट इनसाइटसाठी प्रेडिक्टिव्ह इंजिन

एक बॅकग्राउंड प्रोसेस दर २५ सेकंदांनी ट्रेंड्सचे स्कोअरिंग करते. जेव्हा लॅटन्सी (latency) किंवा एरर रेट वाढतो, तेव्हा अलर्ट थ्रेशोल्ड (threshold) ओलांडण्यापूर्वीच इंजिन घटनेचा अंदाज वर्तवते, ज्यामुळे एजंट्सना कामासाठी पूर्वतयारी करायला वेळ मिळतो.

प्रत्यक्ष परिणाम

मेट्रिक निकाल
प्रति रन तपासणी खर्च $०.००१३
पूर्ण root-cause विश्लेषण करण्यासाठी लागणारा वेळ < ४ सेकंद
न वापरलेले टॉप मेट्रिक्स ३८ %

प्रत्यक्ष अनुभवातून शिकलेले धडे

  • GenAI spans साठी मॅन्युअल इन्स्ट्रुमेंटेशन – AI चे सिमेंटिक आउटपुट कॅप्चर करण्यासाठी स्पष्ट इन्स्ट्रुमेंटेशन जोडल्यामुळे डेटा अचूक आणि शोधण्यायोग्य राहतो.
  • “Thinking” मोड बंद करा – जे LLMs संवादात्मक होण्याचा प्रयत्न करतात ते अनेकदा JSON ट्रंकेट (truncate) करतात. ते मोड अक्षम केल्यामुळे संक्षिप्त आणि मशीन-रीडेबल आउटपुट मिळते.
  • RFC 6902 ने पॅच करा – Foundry प्लॅटफॉर्मवर JSON-Patch (RFC 6902) लागू केल्यामुळे टीमला संपूर्ण सर्व्हिस पुन्हा तैनात (redeploy) न करता कंटेनर हेल्थ-चेक्स आणि लॅटन्सी पॅरामीटर्स दुरुस्त करता आले.

कोणाला फायदा होईल आणि कोण सावध राहील

जे एंटरप्राइजेस आधीच ऑब्झर्व्हेबिलिटी प्लॅटफॉर्मसाठी पैसे मोजत आहेत, त्यांना त्वरित बचत दिसून येईल: विश्लेषकांचा (analyst) कमी झालेला वेळ आणि न वापरल्या जाणाऱ्या मेट्रिक कलेक्शनमधील बचत.

पुढे काय पाहायचे

MIB चा ओपन-सोर्स कोड GitHub वर उपलब्ध आहे आणि एक डेमो व्हिडिओ पूर्ण इन्सिडेंट रन दाखवतो.

निष्कर्ष

SigNoz च्या MCP मध्ये थेट दोन विशेष AI एजंट्स समाविष्ट करणे हे दर्शवते की स्वायत्त root-cause विश्लेषण अत्यंत वेगवान आणि अत्यंत स्वस्त असू शकते. हा दृष्टिकोन ऑब्झर्व्हेबिलिटीला केवळ एक निष्क्रिय रिपोर्टिंग टूल न ठेवता, एक सक्रिय सहभागी बनवतो जो घटना घडताच कृती करतो; ज्यामुळे वेळ, पैसा आणि घटना घडल्यानंतर लॉग्स शोधताना होणारी मानवी निराशा वाचते.