Due agenti AI SRE autonomi in esecuzione sulla SigNoz Managed Cloud Platform (MCP) individuano la causa principale (root-cause), pubblicano un riepilogo su Slack e completano l'intera investigazione in meno di 4 secondi, con un costo di soli 0,0013 $ per incidente. Il risultato è un passaggio dalle query reattive tramite chatbot a una forza lavoro di osservabilità "self-driving" che abbatte le spese di investigazione e al contempo fa emergere le metriche inutilizzate.
Perché è importante
Le demo tradizionali di AI-observability richiedono ancora l'intervento umano per digitare una domanda su trace o log. Il nuovo approccio elimina questo passaggio: quando scatta un alert, il sistema esegue automaticamente un playbook SRE collaudato e fornisce la risposta.
L'hackathon che ha dato vita agli agenti
Gli agenti sono nati dall'hackathon WeMakeDevs × Agents of SigNoz sotto il nome del progetto MIB (Men in Backend). Invece di un chatbot conversazionale, il team ha costruito una "forza lavoro di osservabilità autonoma" composta da due agenti:
- Agent J – L'Incident Responder – Monitora gli alert e poi segue un playbook in cinque fasi: conferma l'alert, individua i trace responsabili, analizza i log correlati, calcola il delta e pubblica una scheda sulla causa principale (root-cause) su Slack. La sequenza richiede in media 3,7 secondi.
- Agent K – L'Auditor – Esegue audit programmati sull'utilizzo delle metriche, segnala quelle che generano costi ma non vengono consumate e prepara bozze di modifiche alle dashboard per l'approvazione umana.
Durante l'hackathon, l'Agent K ha segnalato che il 38% delle metriche principali non veniva mai letto, esponendo sprechi nascosti nello stack di osservabilità.
Come funziona il sistema
Playbook deterministici, non loop aperti
Gli agenti seguono playbook fissi e deterministici invece di un ragionamento "agentico" a forma libera. Ogni esecuzione segue un workflow SRE noto — conferma, trace, log, delta — producendo output coerenti ed evitando l'imprevedibilità del testo generato da LLM non vincolati.
Tre livelli di osservabilità
- Application layer – L'app monitorata invia stream di trace, log e metriche a SigNoz.
- Agent layer – Ogni agente emette i propri semantic span generati da GenAI verso SigNoz, rendendo osservabili gli agenti stessi.
- MCP telemetry layer – Il server MCP registra la telemetria delle chiamate agli strumenti (tool-call), completando un ciclo di feedback in cui SigNoz osserva gli agenti che osservano SigNoz.
Motore predittivo per insight pre-alert
Un processo in background valuta i trend ogni 25 secondi. Quando si verificano picchi di latenza o tassi di errore, il motore prevede un incidente prima che venga superata la soglia di alert, dando agli agenti un vantaggio temporale.
Risultati tangibili
| Metrica | Risultato |
|---|---|
| Costo investigazione per esecuzione | 0,0013 $ |
| Tempo per l'analisi completa della root-cause | < 4 secondi |
| Metriche principali inutilizzate identificate | 38 % |
Lezioni apprese sul campo
- Strumentazione manuale per gli span GenAI – L'aggiunta di una strumentazione esplicita per catturare l'output semantico dell'IA mantiene i dati accurati e ricercabili.
- Disattivare le modalità di "pensiero"
