SigNoz ના Managed Cloud Platform (MCP) પર ચાલતા બે સ્વાયત્ત (autonomous) AI SRE એજન્ટ્સ મૂળ કારણ (root-cause) શોધી કાઢે છે, Slack પર સારાંશ પોસ્ટ કરે છે, અને આખી તપાસ 4 સેકન્ડથી ઓછા સમયમાં પૂર્ણ કરે છે, જેનો ખર્ચ પ્રતિ ઇન્સિડન્ટ માત્ર $0.0013 થાય છે. તેનું પરિણામ એ છે કે રિએક્ટિવ ચેટબોટ ક્વેરીઝમાંથી બદલાઈને તે એક 'સેલ્ફ-ડ્રાઇવિંગ ઓબ્ઝર્વેબિલિટી વર્કફોર્સ' બની જાય છે, જે તપાસના ખર્ચમાં ઘટાડો કરે છે અને બિનઉપયોગી મેટ્રિક્સને પણ બહાર લાવે છે.

આ શા માટે મહત્વનું છે

પરંપરાગત AI-observability ડેમોમાં હજુ પણ ટ્રેસ (traces) અથવા લોગ્સ (logs) વિશે પ્રશ્ન ટાઇપ કરવા માટે માણસની જરૂર પડે છે. નવો અભિગમ આ સ્ટેપને દૂર કરે છે: જ્યારે એલર્ટ આવે છે, ત્યારે સિસ્ટમ આપમેળે એક સાબિત થયેલ SRE પ્લેબુક ચલાવે છે અને જવાબ આપે છે.

એજન્ટ્સનો જન્મ કરનાર હેકાથોન

આ એજન્ટ્સ WeMakeDevs × Agents of SigNoz હેકાથોનમાંથી MIB (Men in Backend) પ્રોજેક્ટના નામે ઉભરી આવ્યા છે. વાતચીત કરતા ચેટબોટને બદલે, ટીમે બે એજન્ટ્સનું “autonomous observability workforce” બનાવ્યું છે:

  • Agent J – The Incident Responder – એલર્ટ્સ સાંભળે છે, અને પછી પાંચ-સ્ટેપ પ્લેબુક અનુસરે છે: એલર્ટની પુષ્ટિ કરવી, સંબંધિત ટ્રેસ શોધવા, સંબંધિત લોગ્સમાં ઊંડાણપૂર્વક તપાસ કરવી, ડેલ્ટા (delta) ની ગણતરી કરવી, અને Slack પર root-cause કાર્ડ પોસ્ટ કરવું. આ પ્રક્રિયા સરેરાશ 3.7 સેકન્ડ લે છે.
  • Agent K – The Auditor – મેટ્રિક વપરાશના શેડ્યૂલ ઓડિટ ચલાવે છે, જે મેટ્રિક્સ ખર્ચ કરે છે પણ તેનો વપરાશ થતો નથી તેને ફ્લેગ કરે છે, અને માણસ દ્વારા મંજૂરી મેળવવા માટે ડેશબોર્ડ ફેરફારોનો ડ્રાફ્ટ તૈયાર કરે છે.

હેકાથોન દરમિયાન, Agent K એ રિપોર્ટ કર્યો હતો કે ટોચના 38% મેટ્રિક્સ ક્યારેય વાંચવામાં આવ્યા નહોતા, જે ઓબ્ઝર્વેબિલિટી સ્ટેકમાં છુપાયેલ બગાડને ખુલ્લો પાડે છે.

સિસ્ટમ કેવી રીતે કામ કરે છે

ડિટરમિનિસ્ટિક પ્લેબુક્સ, ઓપન-એન્ડેડ લૂપ્સ નહીં

એજન્ટ્સ ફ્રી-ફોર્મ “agentic” તર્કને બદલે નિશ્ચિત, ડિટરમિનિસ્ટિક પ્લેબુક્સનું પાલન કરે છે. દરેક રન એક જાણીતી SRE વર્કફ્લો—confirm, trace, log, delta—અમલમાં મૂકે છે, જે સુસંગત આઉટપુટ આપે છે અને અનિયંત્રિત LLM ટેક્સ્ટની અનિશ્ચિતતાને ટાળે છે.

ઓબ્ઝર્વેબિલિટીના ત્રણ સ્તરો

  1. Application layer – મોનિટર કરેલ એપ SigNoz ને ટ્રેસ, લોગ્સ અને મેટ્રિક્સ સ્ટ્રીમ કરે છે.
  2. Agent layer – દરેક એજન્ટ તેના પોતાના GenAI-જનરેટેડ સેમેન્ટિક સ્પેન્સ (semantic spans) પાછા SigNoz ને મોકલે છે, જેનાથી એજન્ટ્સ પોતે જ ઓબ્ઝર્વેબલ બને છે.
  3. MCP telemetry layer – MCP સર્વર ટૂલ-કોલ ટેલિમેટ્રી રેકોર્ડ કરે છે, જે એક ફીડબેક લૂપ પૂર્ણ કરે છે જ્યાં SigNoz એ એજન્ટ્સ પર નજર રાખે છે જે SigNoz પર નજર રાખે છે.

પ્રી-એલર્ટ ઇનસાઇટ માટે પ્રિડિક્ટિવ એન્જિન

એક બેકગ્રાઉન્ડ પ્રોસેસ દર 25 સેકન્ડે ટ્રેન્ડ્સને સ્કોર કરે છે. જ્યારે લેટન્સી (latency) અથવા એરર રેટમાં વધારો થાય છે, ત્યારે એન્જિન એલર્ટ થ્રેશોલ્ડ વટાવતા પહેલા જ ઇન્સિડન્ટની આગાહી કરે છે, જે એજન્ટ્સને વહેલી તકે કામ કરવાની તક આપે છે.

નક્કર પરિણામો

મેટ્રિક પરિણામ
પ્રતિ રન તપાસનો ખર્ચ $0.0013
સંપૂર્ણ root-cause એનાલિસિસ માટેનો સમય < 4 સેકન્ડ
બિનઉપયોગી ટોચના મેટ્રિક્સની ઓળખ 38 %

ફિલ્ડમાંથી શીખવા મળેલા પાઠ

  • GenAI સ્પેન્સ માટે મેન્યુઅલ ઇન્સ્ટ્રુમેન્ટેશન – AI ના સેમેન્ટિક આઉટપુટને કેપ્ચર કરવા માટે સ્પષ્ટ ઇન્સ્ટ્રુમેન્ટેશન ઉમેરવાથી ડેટા સચોટ અને સર્ચેબલ રહે છે.
  • “thinking” મોડ્સ બંધ કરો – જે LLMs વાતચીત કરવાનો પ્રયાસ કરે છે તે ઘણીવાર JSON ને ટ્રેન્કેટ (truncate) કરી નાખે છે. તે મોડ્સને ડિસેબલ કરવાથી સંક્ષિપ્ત અને મશીન-રીડેબલ આઉટપુટ મળે છે.
  • RFC 6902 સાથે પેચ કરો – Foundry પ્લેટફોર્મ પર JSON-Patch (RFC 6902) લાગુ કરવાથી ટીમને આખી સર્વિસ ફરીથી ડિપ્લોય કર્યા વિના કન્ટેનર હેલ્થ-ચેક્સ અને લેટન્સી પેરામીટર્સ સુધારવાની મંજૂરી મળી.

કોને ફાયદો થશે, અને કોણ સાવધ રહેશે

જે એન્ટરપ્રાઇઝ પહેલેથી જ ઓબ્ઝર્વેબિલિટી પ્લેટફોર્મ્સ માટે ચૂકવણી કરે છે તેઓ તરત જ બચત જોઈ શકે છે: એનાલિસ્ટનો સમય ઘટશે અને બિનજરૂરી મેટ્રિક કલેક્શન બંધ થશે.

આગળ શું જોવું

MIB માટેનો ઓપન-સોર્સ કોડ GitHub પર ઉપલબ્ધ છે, અને ડેમો વિડિયોમાં સંપૂર્ણ ઇન્સિડન્ટ રન વિશે સમજાવવામાં આવ્યું છે.

મુખ્ય વાત (Takeaway)

SigNoz ના MCP માં સીધા જ બે સ્પેશિયલાઇઝ્ડ AI એજન્ટ્સને એમ્બેડ કરવાથી સાબિત થાય છે કે સ્વાયત્ત root-cause એનાલિસિસ અત્યંત ઝડપી અને અત્યંત સસ્તું હોઈ શકે છે. આ અભિગમ ઓબ્ઝર્વેબિલિટીને માત્ર એક પેસિવ રિપોર્ટિંગ ટૂલમાંથી બદલીને એક એક્ટિવ સહભાગી બનાવે છે જે ઇન્સિડન્ટ દેખાય તે ક્ષણે કાર્ય કરે છે, જેનાથી સમય, નાણાં અને ઇન્સિડન્ટ પછી લોગ્સમાં શોધખોળ કરવાના માનવીય નિરાશાથી બચાવી શકાય છે.