चार स्वायत्त AI एजेंट अब सॉफ्टवेयर ग्लिच का पता लगा सकते हैं, संबंधित कोड को एडिट कर सकते हैं और फिक्स की पुष्टि कर सकते हैं—यह सब एक मिनट से भी कम समय में संभव हुआ है, और इसका श्रेय SigNoz हैकथॉन के लिए बनाए गए एक नए ऑब्जर्वेबिलिटी-संचालित वर्कफ़्लो को जाता है।

AgentOps नाम का यह सिस्टम, SigNoz में एरर स्पाइक्स (error spikes) पर नज़र रखता है, प्रासंगिक लॉग्स और ट्रेसेस (logs and traces) निकालता है, जिम्मेदार सटीक फ़ाइल और लाइन का पता लगाता है, एक सैंडबॉक्स में सोर्स कोड को एडिट करता है, और फिर यह साबित करने के लिए अनुरोध को फिर से चलाता है कि बग दूर हो गया है। प्रत्येक पूर्ण चक्र 30-60 सेकंड में समाप्त हो जाता है, और पूरी प्रक्रिया बिना किसी मानवीय प्रॉम्प्ट के चलती है।

AI एजेंटों के लिए ऑब्जर्वेबिलिटी क्यों महत्वपूर्ण है

पारंपरिक SRE अभ्यास लॉग्स, मेट्रिक्स और डिस्ट्रिब्यूटेड ट्रेसेस को किसी सर्विस की 'आँखों' के रूप में मानता है। जब कोई अनुरोध विफल होता है, तो एक इंजीनियर उस घटक (component) तक पहुँचने के लिए ट्रेस का अनुसरण करता है। यही सिद्धांत अब AgentOps को शक्ति देता है, लेकिन यहाँ जिस "सर्विस" की निगरानी की जा रही है, वह स्वयं AI एजेंट है।

एजेंट द्वारा इन्वोक किया गया प्रत्येक टूल—चाहे वह लैंग्वेज मॉडल कॉल हो, फ़ाइल-सिस्टम एडिट हो या टेस्ट रनर—ट्रेस में एक स्पैन (span) बनाता है। एक स्पैन शुरू होने का समय, अवधि और सफलता की स्थिति को रिकॉर्ड करता है, ताकि एजेंट देख सके कि प्रत्येक रीजनिंग स्टेप में कितना समय लगा और क्या वह सफल रहा। उन स्पैन को एक साथ जोड़कर, एजेंट अपनी स्वयं की विचार प्रक्रिया की एक पूरी तस्वीर बनाता है, ठीक वैसे ही जैसे एक इंसान मैन्युअल रूप से डिबगिंग करते समय करता है।

मुख्य बदलाव "रिपोर्टिंग लेयर के रूप में ऑब्जर्वेबिलिटी" से "परसेप्शन (अनुभूति) के रूप में ऑब्जर्वेबिलिटी" की ओर है। AgentOps ट्रेस डेटा को वापस एजेंटों में फीड करता है, जिससे वे वास्तविक समय में अपने स्वयं के कार्यों के बारे में तर्क कर पाते हैं। इसका परिणाम एक ऐसा लूप है जहाँ AI न केवल एक परिकल्पना (hypothesis) उत्पन्न करता है, बल्कि उसी टेलीमेट्री के विरुद्ध उसका सत्यापन भी करता है जिसका उपयोग वह समस्या का पता लगाने के लिए करता है।

चार-चरणीय वर्कफ़्लो

  1. Monitor – एक हल्का वॉचर (watcher) SigNoz में नए रिपोर्ट किए गए एरर्स को स्कैन करता है।
  2. Diagnose – एजेंट संबंधित लॉग्स और ट्रेसेस निकालता है, स्टैक को एक्सट्रैक्ट करता है, और उस सोर्स फ़ाइल और लाइन नंबर को अलग करता है जिसने विफलता को ट्रिगर किया।
  3. Fix – एक सैंडबॉक्स्ड फ़ाइल-सिस्टम सर्वर का उपयोग करके, एजेंट पहचानी गई लाइन पर एक पैच लिखता है। सैंडबॉक्स सख्त अनुमतियों को लागू करता है और यदि एडिट पॉलिसी का उल्लंघन करता है तो स्वचालित रूप से रोलबैक कर देता है।
  4. Verify – एजेंट पैच किए गए कोड के विरुद्ध मूल अनुरोध को फिर से जारी करता है। यदि ट्रेस एक सफल रन दिखाता है, तो फिक्स को कमिट कर दिया जाता है; अन्यथा एजेंट फिर से प्रयास करता है।

सभी चरणों को एजेंटों के एक ही सेट द्वारा ऑर्केस्ट्रेट किया जाता है, जिनमें से प्रत्येक एक स्वायत्त माइक्रो-सर्विस के रूप में कार्य करता है। पूरी श्रृंखला OpenTelemetry-संगत स्पैन के माध्यम से ऑब्जर्वेबल है, जिसे SigNoz इनजेस्ट और विज़ुअलाइज़ करता है।

विश्वसनीयता पर कठिन परिश्रम से सीखे गए सबक

Error clarity

एक सामान्य "failed" स्टेटस कुछ नहीं बताता। टीम ने विस्तृत विफलता कारण जोड़े—जैसे, "गलत परिकल्पना" या "पैच ने प्रक्रिया को तोड़ दिया"—ताकि डाउनस्ट्रीम एजेंट यह तय कर सकें कि उन्हें फिर से प्रयास करना चाहिए, पीछे हटना चाहिए या प्रक्रिया को रोकना चाहिए। यह उसी तरह है जैसे इंसान पोस्टमॉर्टम में मूल कारणों (root causes) को लेबल करते हैं।

Data latency

टेलीमेट्री तुरंत दिखाई नहीं देती है। एजेंट अब एक छोटा ठहराव और एक सैनिटी चेक शामिल करते हैं ताकि यह सुनिश्चित हो सके कि फिक्स का दावा करने से पहले आवश्यक लॉग्स आ गए हैं। इस सुरक्षा के बिना, एक एजेंट अधूरे डेटा पर कार्य कर सकता है और एक गलत परिणाम (false positive) दे सकता है।

Security boundaries

AI को कोड लिखने की अनुमति देना प्रिविलेज एस्केलेशन (privilege escalation) का जोखिम है। सैंडबॉक्स एक समर्पित फ़ाइलसिस्टम सर्वर के पीछे चलता है जो राइट स्कोप (write scope) को लक्षित रिपॉजिटरी तक सीमित रखता है और यदि कोई टेस्ट विफल हो जाता है तो स्वचालित रूप से पिछली स्थिति को बहाल कर देता है। यह कंटेनमेंट मॉडल AI की शक्ति को नियंत्रण में रखता है।

Token limits

लार्ज लैंग्वेज मॉडल API टोकन का उपयोग करते हैं, और जांच के बीच में ही दैनिक कोटा समाप्त हो सकता है। AgentOps प्रत्येक घटना के लिए टोकन उपयोग को ट्रैक करता है और एक सीमा तक पहुँचने पर आगे की कॉल्स को थ्रॉटल (throttle) कर देता है, जिससे कोटा समाप्त होने पर विफल फिक्स की श्रृंखला बनने से रुक जाती है।

डेमो ने क्या साबित किया

टीम ने एक बिल्कुल नया बग डाला जो कोडबेस में पहले कभी नहीं आया था। AgentOps ने विसंगति का पता लगाया, उसे सटीक लाइन तक ट्रैक किया, एक सुधारात्मक एडिट जेनरेट किया, सैंडबॉक्स में पैच लागू किया और सत्यापित किया कि अनुरोध सफल रहा—यह सब बिना किसी मैन्युअल कोड परिवर्तन या नए प्रॉम्प्ट के हुआ। एंड-टू-एंड समय एक मिनट से कम रहा, जो रिपोर्ट की गई 30-60 सेकंड की अवधि के अनुरूप था।

काउंटर-पॉइंट: स्वायत्तता कोई रामबाण नहीं है

आगे क्या देखें

  • मॉडल-स्वतंत्र टेलीमेट्री – जैसे-जैसे अधिक विक्रेता OpenTelemetry-संगत स्पैन (spans) उपलब्ध कराएंगे, यह दृष्टिकोण विक्रेता-तटस्थ (vendor-neutral) हो सकता है, जिससे विभिन्न प्रकार के स्टैक (heterogeneous stacks) में इसे अपनाना आसान हो जाएगा।
  • नीति-संचालित गार्डरेल्स – कॉन्फ़िगर करने योग्य नीतियों को शामिल करना, जो यह निर्धारित करती हैं कि एक एजेंट किन फ़ाइलों को संपादित कर सकता है, या कमिट से पहले किन टेस्ट सूट्स को पास होना चाहिए, गवर्नेंस संबंधी चिंताओं का समाधान करेगा।
  • लागत-जागरूक टोकन बजटिंग – घटना की गंभीरता के आधार पर गतिशील टोकन आवंटन कोटा समाप्त होने से रोक सकता है और साथ ही उच्च-प्रभाव वाले बग्स को संभालने की क्षमता को भी बनाए रख सकता है।

AgentOps दिखाता है कि बग-फिक्स चक्र में 30-60 सेकंड लग सकते हैं। यह प्रयोग एक प्रूफ-ऑफ-कॉन्सेप्ट प्रदर्शित करता है कि ऑब्जर्वेबिलिटी (observability) का उपयोग स्वायत्त सॉफ्टवेयर सहायकों द्वारा किया जा सकता है।