SigNoz యొక్క Managed Cloud Platform (MCP) పై నడుస్తున్న రెండు స్వయంప్రతిపత్త (autonomous) AI SRE ఏజెంట్లు, ఒక ఇన్సిడెంట్ యొక్క మూల కారణాన్ని (root-cause) గుర్తించి, దాని సారాంశాన్ని Slackలో పోస్ట్ చేసి, మొత్తం విచారణను 4 సెకన్ల కంటే తక్కువ సమయంలో పూర్తి చేస్తాయి. దీనికి ఒక్కో ఇన్సిడెంట్కు కేవలం $0.0013 మాత్రమే ఖర్చవుతుంది. దీని ఫలితంగా, కేవలం చాట్బాట్ ద్వారా ప్రశ్నలు అడిగే పద్ధతి నుండి, అనవసరమైన మెట్రిక్స్ను గుర్తించడమే కాకుండా, విచారణ ఖర్చులను తగ్గించే ఒక 'సెల్ఫ్-డ్రైవింగ్ అబ్జర్వబిలిటీ వర్క్ఫోర్స్' (self-driving observability workforce) వైపు మార్పు కనిపిస్తోంది.
ఇది ఎందుకు ముఖ్యం
సాంప్రదాయ AI-observability డెమోలలో traces లేదా logs గురించి మనిషి స్వయంగా ప్రశ్న టైప్ చేయాల్సి ఉంటుంది. కానీ ఈ కొత్త విధానం ఆ దశను తొలగిస్తుంది: ఒక అలర్ట్ వచ్చినప్పుడు, సిస్టమ్ స్వయంచాలకంగా ఒక నిరూపితమైన SRE playbookని రన్ చేసి సమాధానాన్ని అందిస్తుంది.
ఈ ఏజెంట్లు పుట్టిన హ్యాకథాన్
ఈ ఏజెంట్లు WeMakeDevs × Agents of SigNoz హ్యాకథాన్ ద్వారా MIB (Men in Backend) అనే ప్రాజెక్ట్ పేరుతో ఉద్భవించాయి. కేవలం సంభాషించే చాట్బాట్కు బదులుగా, ఈ టీమ్ రెండు ఏజెంట్లతో కూడిన ఒక "autonomous observability workforce"ను రూపొందించింది:
- Agent J – The Incident Responder – ఇది అలర్ట్లను గమనిస్తుంది, ఆపై ఐదు దశల playbookని అనుసరిస్తుంది: అలర్ట్ను ధృవీకరించడం, తప్పుగా ఉన్న tracesలను గుర్తించడం, సంబంధిత logsని లోతుగా పరిశీలించడం, తేడాను (delta) లెక్కించడం మరియు Slackలో root-cause కార్డ్ను పోస్ట్ చేయడం. ఈ ప్రక్రియ సగటున 3.7 సెకన్లు పడుతుంది.
- Agent K – The Auditor – ఇది మెట్రిక్ వినియోగంపై షెడ్యూల్ చేయబడిన ఆడిట్లను నిర్వహిస్తుంది, ఖర్చు అవుతున్నా వినియోగం లేని మెట్రిక్స్ను గుర్తిస్తుంది మరియు మనిషి ఆమోదించడానికి అవసరమైన dashboard మార్పుల డ్రాఫ్ట్లను సిద్ధం చేస్తుంది.
హ్యాకథాన్ సమయంలో, టాప్ మెట్రిక్స్లో 38% ఎప్పుడూ చదవబడలేదని Agent K నివేదించింది, ఇది observability stackలో ఉన్న దాగి ఉన్న వృధాను బయటపెట్టింది.
ఈ సిస్టమ్ ఎలా పనిచేస్తుంది
Deterministic playbooks, open-ended loops కాదు
ఈ ఏజెంట్లు స్వేచ్ఛా రూపంలో ఉండే "agentic" రీజనింగ్కు బదులుగా, నిర్ణీతమైన (fixed), deterministic playbooksని అనుసరిస్తాయి. ప్రతి రన్ ఒక తెలిసిన SRE workflow—confirm, trace, log, delta—ని అమలు చేస్తుంది, తద్వారా స్థిరమైన అవుట్పుట్ను అందిస్తుంది మరియు నియంత్రణ లేని LLM టెక్స్ట్ వల్ల కలిగే అనిశ్చితిని నివారిస్తుంది.
మూడు పొరల అబ్జర్వబిలిటీ (Three layers of observability)
- Application layer – పర్యవేక్షించబడుతున్న యాప్ traces, logs మరియు metricsలను SigNozకి స్ట్రీమ్ చేస్తుంది.
- Agent layer – ప్రతి ఏజెంట్ తన స్వంత GenAI-జనరేటెడ్ semantic spansలను తిరిగి SigNozకి పంపుతుంది, దీనివల్ల ఏజెంట్లు కూడా అబ్జర్వబుల్ (observable) అవుతాయి.
- MCP telemetry layer – MCP సర్వర్ tool-call telemetryని రికార్డ్ చేస్తుంది, తద్వారా SigNoz తనను పర్యవేక్షిస్తున్న ఏజెంట్లను కూడా పర్యవేక్షించే ఒక feedback loop పూర్తవుతుంది.
ప్రీ-అలర్ట్ ఇన్సైట్ కోసం ప్రిడిక్టివ్ ఇంజిన్
ఒక బ్యాక్గ్రౌండ్ ప్రాసెస్ ప్రతి 25 సెకన్లకు ట్రెండ్స్ను స్కోర్ చేస్తుంది. లాటెన్సీ (latency) లేదా ఎర్రర్ రేట్లు పెరిగినప్పుడు, అలర్ట్ థ్రెషోల్డ్ చేరుకోకముందే ఈ ఇంజిన్ ఇన్సిడెంట్ను అంచనా వేస్తుంది, దీనివల్ల ఏజెంట్లకు ముందే సమాచారం అందుతుంది.
స్పష్టమైన ఫలితాలు
| మెట్రిక్ | ఫలితం |
|---|---|
| ఒక్కో విచారణ ఖర్చు | $0.0013 |
| పూర్తి root-cause విశ్లేషణకు పట్టే సమయం | < 4 సెకన్లు |
| ఉపయోగించని టాప్ మెట్రిక్స్ గుర్తింపు | 38 % |
క్షేత్రస్థాయిలో నేర్చుకున్న పాఠాలు
- GenAI spans కోసం మాన్యువల్ ఇన్స్ట్రుమెంటేషన్ – AI యొక్క semantic అవుట్పుట్ను క్యాప్చర్ చేయడానికి స్పష్టమైన ఇన్స్ట్రుమెంటేషన్ను జోడించడం వల్ల డేటా ఖచ్చితంగా మరియు సెర్చ్ చేయదగినదిగా ఉంటుంది.
- “Thinking” మోడ్లను ఆపివేయండి – సంభాషణలా ఉండటానికి ప్రయత్నించే LLMలు తరచుగా JSONని మధ్యలోనే ఆపేస్తాయి (truncate). ఆ మోడ్లను నిలిపివేయడం వల్ల సంక్షిప్తమైన, మెషిన్-రీడబుల్ అవుట్పుట్ లభిస్తుంది.
- RFC 6902తో ప్యాచ్ చేయడం – Foundry ప్లాట్ఫారమ్పై JSON-Patch (RFC 6902)ని ఉపయోగించడం వల్ల, మొత్తం సర్వీస్ను మళ్ళీ డిప్లాయ్ చేయకుండానే కంటైనర్ హెల్త్-చెక్స్ మరియు లాటెన్సీ పారామీటర్లను టీమ్ సరిదిద్దగలిగింది.
ఎవరికి ప్రయోజనం, ఎవరు జాగ్రత్తగా ఉండాలి
ఇప్పటికే అబ్జర్వబిలిటీ ప్లాట్ఫారమ్ల కోసం చెల్లిస్తున్న సంస్థలు వెంటనే ఆదా చేయవచ్చు: అనలిస్ట్ సమయం తగ్గడం మరియు ఉపయోగించని మెట్రిక్ సేకరణను నివారించడం ద్వారా ఇది సాధ్యమవుతుంది.
తదుపరి ఏమి చూడాలి
MIB యొక్క ఓపెన్-సోర్స్ కోడ్ GitHubలో అందుబాటులో ఉంది మరియు ఒక డెమో వీడియో పూర్తి ఇన్సిడెంట్ రన్ను వివరిస్తుంది.
ముగింపు (Takeaway)
SigNoz యొక్క MCPలో నేరుగా రెండు ప్రత్యేకమైన AI ఏజెంట్లను చేర్చడం ద్వారా, స్వయంప్రతిపత్త root-cause విశ్లేషణ అత్యంత వేగంగా మరియు అత్యంత తక్కువ ఖర్చుతో చేయవచ్చని నిరూపితమైంది. ఈ విధానం అబ్జర్వబిలిటీని కేవలం రిపోర్టింగ్ టూల్గా కాకుండా, ఇన్సిడెంట్ రాగానే స్పందించే ఒక క్రియాశీల భాగస్వామిగా మారుస్తుంది. దీనివల్ల సమయం, డబ్బు ఆదా అవ్వడమే కాకుండా, ఇన్సిడెంట్ జరిగిన తర్వాత లాగ్స్ను వెతకడంలో మనుషులు పడే ఇబ్బంది కూడా తగ్గుతుంది.
