SigNoz-ന്റെ Managed Cloud Platform (MCP)-ൽ പ്രവർത്തിക്കുന്ന രണ്ട് ഓട്ടോണമസ് AI SRE ഏജന്റുകൾ, ഒരു പ്രശ്നത്തിന്റെ മൂലകാരണം (root-cause) കണ്ടെത്തി, അതിന്റെ സംഗ്രഹം Slack-ൽ പോസ്റ്റ് ചെയ്യുന്നു, കൂടാതെ 4 സെക്കൻഡിൽ താഴെ സമയം കൊണ്ട് അന്വേഷണം പൂർത്തിയാക്കുന്നു. ഒരു ഇൻസിഡന്റിന് വെറും $0.0013 മാത്രമാണ് ഇതിന് ചെലവാകുന്നത്. ഇതിന്റെ ഫലമായി, പ്രതികരണാത്മകമായ (reactive) ചാറ്റ്ബോട്ട് ചോദ്യങ്ങളിൽ നിന്ന്, അന്വേഷണ ചെലവ് കുറയ്ക്കുന്നതോടൊപ്പം ഉപയോഗശൂന്യമായ മെട്രിക്സുകൾ (metrics) കണ്ടെത്തുന്നതോ ആയ ഒരു 'സെൽഫ്-ഡ്രൈവിംഗ് ഒബ്സർവബിലിറ്റി വർക്ക്ഫോഴ്സിലേക്കുള്ള' മാറ്റം സംഭവിക്കുന്നു.
എന്തുകൊണ്ടാണ് ഇത് പ്രധാനമാകുന്നത്
പരമ്പരാഗത AI-observability ഡെമോകളിൽ ട്രേസുകളെക്കുറിച്ചോ (traces) ലോഗുകളെക്കുറിച്ചോ (logs) ചോദിക്കാൻ ഒരു മനുഷ്യൻ ടൈപ്പ് ചെയ്യേണ്ടതുണ്ട്. എന്നാൽ പുതിയ രീതി ഈ ഘട്ടം ഒഴിവാക്കുന്നു: ഒരു അലേർട്ട് (alert) ഉണ്ടാകുമ്പോൾ, സിസ്റ്റം സ്വയമേവ ഒരു പ്രമാണിതപ്പെട്ട SRE പ്ലേബുക്ക് (playbook) പ്രവർത്തിപ്പിക്കുകയും ഉത്തരം നൽകുകയും ചെയ്യുന്നു.
ഏജന്റുകൾ രൂപപ്പെട്ട ഹാക്കത്തോൺ
WeMakeDevs × Agents of SigNoz ഹാക്കത്തോണിലൂടെയാണ് MIB (Men in Backend) എന്ന പ്രോജക്റ്റ് പേരിൽ ഈ ഏജന്റുകൾ ഉയർന്നുവന്നത്. ഒരു സംഭാഷണാത്മക ചാറ്റ്ബോട്ടിന് പകരം, രണ്ട് ഏജന്റുകളുള്ള ഒരു "autonomous observability workforce" ആണ് ടീം നിർമ്മിച്ചത്:
- Agent J – The Incident Responder – അലേർട്ടുകൾ ശ്രദ്ധിക്കുന്നു, തുടർന്ന് അഞ്ച് ഘട്ടങ്ങളുള്ള ഒരു പ്ലേബുക്ക് പിന്തുടരുന്നു: അലേർട്ട് സ്ഥിരീകരിക്കുക, പ്രശ്നമുണ്ടാക്കുന്ന ട്രേസുകൾ കണ്ടെത്തുക, ബന്ധപ്പെട്ട ലോഗുകൾ പരിശോധിക്കുക, വ്യത്യാസം (delta) കണക്കാക്കുക, കൂടാതെ Slack-ലേക്ക് ഒരു root-cause കാർഡ് പോസ്റ്റ് ചെയ്യുക. ഈ പ്രക്രിയ ശരാശരി 3.7 സെക്കൻഡ് എടുക്കുന്നു.
- Agent K – The Auditor – മെട്രിക് ഉപയോഗത്തിന്റെ നിശ്ചിത ഓഡിറ്റുകൾ നടത്തുന്നു, ചെലവ് വരുത്തുന്നുണ്ടെങ്കിലും ഉപയോഗിക്കാത്ത മെട്രിക്സുകളെ അടയാളപ്പെടുത്തുന്നു, കൂടാതെ ഒരു മനുഷ്യൻ അംഗീകരിക്കുന്നതിനായി ഡാഷ്ബോർഡ് മാറ്റങ്ങൾ തയ്യാറാക്കുന്നു.
ഹാക്കത്തോണിടെ, പ്രധാനപ്പെട്ട മെട്രിക്സുകളിൽ 38% ഒരിക്കലും വായിക്കപ്പെട്ടിട്ടില്ലെന്ന് Agent K റിപ്പോർട്ട് ചെയ്തു, ഇത് ഒബ്സർവബിലിറ്റി സ്റ്റാക്കിലെ (observability stack) മറഞ്ഞിരിക്കുന്ന പാഴാക്കലുകൾ വെളിപ്പെടുത്തി.
സിസ്റ്റം എങ്ങനെ പ്രവർത്തിക്കുന്നു
നിശ്ചിത പ്ലേബുക്കുകൾ, അല്ലാതെ തുറന്ന ലൂപ്പുകളല്ല
ഏജന്റുകൾ സ്വതന്ത്രമായ "agentic" യുക്തിക്ക് പകരം നിശ്ചിതവും കൃത്യവുമായ (deterministic) പ്ലേബുക്കുകളാണ് പിന്തുടരുന്നത്. ഓരോ തവണയും ഒരു അറിയപ്പെടുന്ന SRE വർക്ക്ഫ്ലോ—confirm, trace, log, delta—പ്രവർത്തിപ്പിക്കുന്നു, ഇത് സ്ഥിരതയുള്ള ഔട്ട്പുട്ട് നൽകുകയും നിയന്ത്രണമില്ലാത്ത LLM ടെക്സ്റ്റുകളുടെ അനിശ്ചിതത്വം ഒഴിവാക്കുകയും ചെയ്യുന്നു.
ഒബ്സർവബിലിറ്റിയുടെ മൂന്ന് പാളികൾ
- Application layer – നിരീക്ഷിക്കപ്പെടുന്ന ആപ്പ് ട്രേസുകൾ, ലോഗുകൾ, മെട്രിക്സുകൾ എന്നിവ SigNoz-ലേക്ക് സ്ട്രീം ചെയ്യുന്നു.
- Agent layer – ഓരോ ഏജന്റും തനിയെ GenAI ഉപയോഗിച്ച് നിർമ്മിച്ച സെമാന്റിക് സ്പാനുകൾ (semantic spans) തിരികെ SigNoz-ലേക്ക് അയക്കുന്നു, ഇത് ഏജന്റുകളെ തന്നെ നിരീക്ഷിക്കാൻ (observable) സഹായിക്കുന്നു.
- MCP telemetry layer – MCP സെർവർ ടൂൾ-കോൾ ടെലിമെട്രി (tool-call telemetry) രേഖപ്പെടുത്തുന്നു, ഇത് SigNoz തന്നെ നിരീക്ഷിക്കുന്ന ഏജന്റുകളെ നിരീക്ഷിക്കുന്ന ഒരു ഫീഡ്ബാക്ക് ലൂപ്പ് പൂർത്തിയാക്കുന്നു.
അലേർട്ടിന് മുൻപുള്ള ഉൾക്കാഴ്ചയ്ക്കായുള്ള പ്രെഡിക്റ്റീവ് എഞ്ചിൻ
ഒരു ബാക്ക്ഗ്രൗണ്ട് പ്രക്രിയ ഓരോ 25 സെക്കൻഡിലും ട്രെൻഡുകൾ വിലയിരുത്തുന്നു. ലേറ്റൻസി (latency) അല്ലെങ്കിൽ എറർ നിരക്ക് വർദ്ധിക്കുമ്പോൾ, അലേർട്ട് പരിധിയിൽ എത്തുന്നതിന് മുമ്പ് തന്നെ എഞ്ചിൻ ഒരു ഇൻസിഡന്റ് പ്രവചിക്കുന്നു, ഇത് ഏജന്റുകൾക്ക് മുൻകൂട്ടി പ്രവർത്തിക്കാൻ സമയം നൽകുന്നു.
പ്രായോഗിക ഫലങ്ങൾ
| മെട്രിക് | ഫലം |
|---|---|
| ഒരു അന്വേഷണത്തിനുള്ള ചെലവ് | $0.0013 |
| പൂർണ്ണമായ root-cause വിശകലനത്തിനുള്ള സമയം | < 4 സെക്കൻഡ് |
| ഉപയോഗിക്കാത്ത പ്രധാന മെട്രിക്സുകൾ കണ്ടെത്തിയത് | 38 % |
നേരിട്ടുള്ള അനുഭവങ്ങളിൽ നിന്നുള്ള പാഠങ്ങൾ
- GenAI സ്പാനുകൾക്കായി മാനുവൽ ഇൻസ്ട്രുമെന്റേഷൻ – AI-യുടെ സെമാന്റിക് ഔട്ട്പുട്ട് ക്യാപ്ചർ ചെയ്യുന്നതിനായി കൃത്യമായ ഇൻസ്ട്രുമെന്റേഷൻ ചേർക്കുന്നത് ഡാറ്റ കൃത്യമായും തിരയാൻ സാധിക്കുന്ന രീതിയിലും നിലനിർത്തുന്നു.
- “thinking” മോഡുകൾ ഓഫ് ചെയ്യുക – സംഭാഷണാത്മകമായിരിക്കാൻ ശ്രമിക്കുന്ന LLM-കൾ പലപ്പോഴും JSON ഡാറ്റ മുറിച്ചുമാറ്റാറുണ്ട് (truncate). ഇത്തരം മോഡുകൾ പ്രവർത്തനരഹിതമാക്കുന്നത് കൃത്യവും മെഷീൻ-റീഡബിൾ ആയതുമായ ഔട്ട്പുട്ട് ലഭിക്കാൻ സഹായിക്കുന്നു.
- RFC 6902 ഉപയോഗിച്ച് പാച്ച് ചെയ്യുക – Foundry പ്ലാറ്റ്ഫോമിൽ JSON-Patch (RFC 6902) പ്രയോഗിച്ചതിലൂടെ, മുഴുവൻ സർവീസും വീണ്ടും വിന്യസിക്കാതെ തന്നെ (redeploy) കണ്ടെയ്നർ ഹെൽത്ത്-ചെക്കുകളും ലേറ്റൻസി പാരാമീറ്ററുകളും പരിഹരിക്കാൻ ടീമിന് കഴിഞ്ഞു.
ആർക്കൊക്കെ ഗുണമുണ്ടാകും, ആർക്കൊക്കെ ആശങ്കയുണ്ടാകാം
ഒബ്സർവബിലിറ്റി പ്ലാറ്റ്ഫോമുകൾക്കായി നിലവിൽ പണം ചിലവാക്കുന്ന സംരംഭങ്ങൾക്ക് ഇതിലൂടെ ഉടനടി ലാഭമുണ്ടാക്കാം: അനലിസ്റ്റുകളുടെ സമയം കുറയ്ക്കാനും ഉപയോഗശൂന്യമായ മെട്രിക് ശേഖരണം ഒഴിവാക്കാനും സാധിക്കും.
ഇനി ശ്രദ്ധിക്കേണ്ടവ
MIB-യുടെ ഓപ്പൺ സോഴ്സ് കോഡ് GitHub-ൽ ലഭ്യമാണ്, കൂടാതെ ഒരു ഡെമോ വീഡിയോയിലൂടെ ഒരു ഇൻസിഡന്റ് എങ്ങനെ പൂർത്തിയാകുന്നു എന്ന് കാണാവുന്നതാണ്.
ചുരുക്കത്തിൽ
SigNoz-ന്റെ MCP-യിൽ നേരിട്ട് രണ്ട് സ്പെഷ്യലൈസ്ഡ് AI ഏജന്റുകളെ ഉൾപ്പെടുത്തിയത്, ഓട്ടോണമസ് root-cause വിശകലനം അതിവേഗത്തിലും വളരെ കുറഞ്ഞ ചെലവിലും സാധ്യമാണെന്ന് തെളിയിക്കുന്നു. ഈ സമീപനം ഒബ്സർവബിലിറ്റിയെ ഒരു നിഷ്ക്രിയ റിപ്പോർട്ടിംഗ് ടൂൾ എന്നതിൽ നിന്ന്, ഒരു പ്രശ്നം ഉണ്ടാകുന്ന നിമിഷം തന്നെ പ്രവർത്തിക്കുന്ന സജീവ പങ്കാളിയാക്കി മാറ്റുന്നു. ഇത് സമയം, പണം എന്നിവ ലാഭിക്കുന്നതിനൊപ്പം, പ്രശ്നത്തിന് ശേഷം ലോഗുകൾ പരിശോധിക്കുമ്പോൾ മനുഷ്യർക്കുണ്ടാകുന്ന ബുദ്ധിമുട്ടുകളും ഒഴിവാക്കുന്നു.
