Zwei autonome KI-SRE-Agenten, die auf der SigNoz Managed Cloud Platform (MCP) laufen, ermitteln eine Ursache (Root-Cause), posten eine Zusammenfassung in Slack und schließen die gesamte Untersuchung in weniger als 4 Sekunden ab – bei Kosten von nur 0,0013 $ pro Vorfall. Das Ergebnis ist ein Wandel von reaktiven Chatbot-Abfragen hin zu einer selbstfahrenden Observability-Belegschaft, die die Untersuchungsausgaben drastisch senkt und gleichzeitig verschwendete Metriken aufdeckt.

Warum das wichtig ist

Traditionelle KI-Observability-Demos erfordern immer noch, dass ein Mensch eine Frage zu Traces oder Logs eintippt. Der neue Ansatz streicht diesen Schritt: Sobald ein Alert ausgelöst wird, führt das System automatisch ein bewährtes SRE-Playbook aus und liefert die Antwort.

Der Hackathon, der die Agenten hervorbrachte

Die Agenten entstanden während des WeMakeDevs × Agents of SigNoz Hackathons unter dem Projektnamen MIB (Men in Backend). Anstatt eines konversationellen Chatbots baute das Team eine „autonome Observability-Belegschaft“ aus zwei Agenten:

  • Agent J – Der Incident Responder – Hört auf Alerts und folgt dann einem fünfstufigen Playbook: Bestätigung des Alerts, Lokalisierung der verursachenden Traces, Analyse der zugehörigen Logs, Berechnung der Differenz (Delta) und Posten einer Root-Cause-Karte in Slack. Die Sequenz dauert durchschnittlich 3,7 Sekunden.
  • Agent K – Der Auditor – Führt geplante Audits der Metrikennutzung durch, markiert Metriken, die Kosten verursachen, aber nicht genutzt werden, und entwirft Dashboard-Änderungen zur Genehmigung durch einen Menschen.

Während des Hackathons meldete Agent K, dass 38 % der wichtigsten Metriken nie gelesen wurden, was die versteckte Verschwendung im Observability-Stack aufdeckte.

Wie das System funktioniert

Deterministische Playbooks statt offener Schleifen

Die Agenten folgen festen, deterministischen Playbooks anstelle von freiformem „agentischem“ Denken. Jeder Durchlauf führt einen bekannten SRE-Workflow aus – bestätigen, Trace, Log, Delta – was zu konsistenten Ergebnissen führt und die Unvorhersehbarkeit von unbeschränktem LLM-Text vermeidet.

Drei Ebenen der Observability

  1. Application Layer – Die überwachte App streamt Traces, Logs und Metriken an SigNoz.
  2. Agent Layer – Jeder Agent sendet seine eigenen, von GenAI generierten semantischen Spans zurück an SigNoz, wodurch die Agenten selbst beobachtbar werden.
  3. MCP Telemetry Layer – Der MCP-Server zeichnet die Telemetrie der Tool-Aufrufe auf und schließt so einen Feedback-Loop, in dem SigNoz die Agenten überwacht, die wiederum SigNoz überwachen.

Predictive Engine für Erkenntnisse vor dem Alert

Ein Hintergrundprozess bewertet Trends alle 25 Sekunden. Wenn Latenz- oder Fehlerraten ansteigen, prognostiziert die Engine einen Vorfall, noch bevor der Alert-Schwellenwert überschritten wird, was den Agenten einen Vorsprung verschafft.

Greifbare Ergebnisse

Metrik Ergebnis
Untersuchungskosten pro Durchlauf 0,0013 $
Zeit bis zur vollständigen Ursachenanalyse < 4 Sekunden
Identifizierte ungenutzte Top-Metriken 38 %

Erkenntnisse von der Frontlinie

  • Manuelle Instrumentierung für GenAI-Spans – Das Hinzufügen einer expliziten Instrumentierung zur Erfassung der semantischen Ausgaben der KI stellt sicher, dass die Daten präzise und durchsuchbar bleiben.
  • „Thinking“-Modi deaktivieren – LLMs, die versuchen, konversationell zu sein, kürzen oft JSON-Daten ab. Das Deaktivieren dieser Modi erzwingt prägnante, maschinenlesbare Ausgaben.
  • Patching mit RFC 6902 – Die Anwendung von JSON-Patch (RFC 6902) auf die Foundry-Plattform ermöglichte es dem Team, Container-Health-Checks und Latenzparameter zu korrigieren, ohne den gesamten Service neu bereitstellen zu müssen.

Wer profitiert und wer könnte skeptisch sein

Unternehmen, die bereits für Observability-Plattformen bezahlen, können sofort Einsparungen erzielen: reduzierte Analysezeit und die Eliminierung unnötiger Metrik-Sammlung.

Was als Nächstes zu beachten ist

Der Open-Source-Code für MIB ist auf GitHub verfügbar, und ein Demo-Video führt durch einen vollständigen Incident-Durchlauf.

Fazit

Die direkte Einbindung von zwei spezialisierten KI-Agenten in die SigNoz MCP zeigt, dass autonome Ursachenanalysen extrem schnell und kostengünstig sein können. Dieser Ansatz verwandelt Observability von einem passiven Reporting-Tool in einen aktiven Teilnehmer, der sofort handelt, wenn ein Vorfall auftritt – und spart so Zeit, Geld und die unvermeidliche menschliche Frustration bei der nachträglichen Durchsuche von Logs.