Dois agentes de IA SRE autônomos rodando na Managed Cloud Platform (MCP) da SigNoz identificam a causa raiz, postam um resumo no Slack e concluem toda a investigação em menos de 4 segundos, custando apenas US$ 0,0013 por incidente. O resultado é uma mudança de consultas reativas em chatbots para uma força de trabalho de observabilidade autônoma que reduz drasticamente os gastos com investigação, ao mesmo tempo em que revela métricas desperdiçadas.

Por que isso é importante

Demonstrações tradicionais de observabilidade com IA ainda exigem que um humano digite uma pergunta sobre traces ou logs. A nova abordagem elimina essa etapa: quando um alerta é disparado, o sistema executa automaticamente um playbook de SRE comprovado e entrega a resposta.

O hackathon que deu origem aos agentes

Os agentes surgiram do hackathon WeMakeDevs × Agents of SigNoz sob o nome de projeto MIB (Men in Backend). Em vez de um chatbot conversacional, a equipe construiu uma "força de trabalho de observabilidade autônoma" composta por dois agentes:

  • Agente J – O Respondente de Incidentes – Monitora alertas e, em seguida, segue um playbook de cinco etapas: confirmar o alerta, localizar os traces problemáticos, analisar detalhadamente os logs relacionados, calcular o delta e postar um card de causa raiz no Slack. A sequência leva, em média, 3,7 segundos.
  • Agente K – O Auditor – Realiza auditorias agendadas do uso de métricas, sinaliza métricas que geram custos mas não apresentam consumo e elabora rascunhos de alterações nos dashboards para aprovação humana.

Durante o hackathon, o Agente K relatou que 38% das principais métricas nunca foram lidas, expondo desperdícios ocultos na stack de observabilidade.

Como o sistema funciona

Playbooks determinísticos, não loops abertos

Os agentes seguem playbooks fixos e determinísticos em vez de um raciocínio "agêntico" de forma livre. Cada execução executa um workflow de SRE conhecido — confirmar, trace, log, delta — produzindo resultados consistentes e evitando a imprevisibilidade de textos de LLM sem restrições.

Três camadas de observabilidade

  1. Camada de aplicação – O app monitorado envia traces, logs e métricas para o SigNoz.
  2. Camada de agente – Cada agente emite seus próprios semantic spans gerados por GenAI de volta para o SigNoz, tornando os próprios agentes observáveis.
  3. Camada de telemetria do MCP – O servidor MCP registra a telemetria de chamadas de ferramentas (tool-calls), completando um loop de feedback onde o SigNoz observa os agentes que observam o SigNoz.

Mecanismo preditivo para insights pré-alerta

Um processo em segundo plano pontua tendências a cada 25 segundos. Quando a latência ou as taxas de erro disparam, o mecanismo prevê um incidente antes que o limite do alerta seja atingido, dando uma vantagem inicial aos agentes.

Resultados tangíveis

Métrica Resultado
Custo de investigação por execução US$ 0,0013
Tempo para análise completa da causa raiz < 4 segundos
Principais métricas não utilizadas identificadas 38%

Lições aprendidas na linha de frente

  • Instrumentação manual para spans de GenAI – Adicionar instrumentação explícita para capturar a saída semântica da IA mantém os dados precisos e pesquisáveis.
  • Desativar modos de "pensamento" – LLMs que tentam ser conversacionais frequentemente truncam o JSON. Desativar esses modos força uma saída concisa e legível por máquina.
  • Correção com RFC 6902 – A aplicação de JSON-Patch (RFC 6902) na plataforma Foundry permitiu que a equipe corrigisse os health-checks de containers e os parâmetros de latência sem a necessidade de fazer o redeploy de todo o serviço.

Quem ganha e quem pode ficar cauteloso

Empresas que já pagam por plataformas de observabilidade podem ver economias imediatamente: redução do tempo dos analistas e eliminação da coleta de métricas ociosas.

O que observar a seguir

O código de código aberto para o MIB está no GitHub, e um vídeo de demonstração percorre uma execução completa de incidente.

Conclusão

Integrar dois agentes de IA especializados diretamente no MCP da SigNoz mostra que a análise autônoma de causa raiz pode ser ultra-rápida e ultra-barata. A abordagem transforma a observabilidade de uma ferramenta de relatório passiva em um participante ativo que age no momento em que um incidente aparece, economizando tempo, dinheiro e a inevitável frustração humana de vasculhar logs após o ocorrido.