Zwei autonome KI-SRE-Agenten, die auf der SigNoz Managed Cloud Platform (MCP) laufen, ermitteln eine Ursache (Root-Cause), posten eine Zusammenfassung in Slack und schließen die gesamte Untersuchung in weniger als 4 Sekunden ab – bei Kosten von nur 0,0013 $ pro Vorfall. Das Ergebnis ist ein Wandel von reaktiven Chatbot-Abfragen hin zu einer selbstfahrenden Observability-Belegschaft, die die Untersuchungsausgaben drastisch senkt und gleichzeitig verschwendete Metriken aufdeckt.
Warum das wichtig ist
Traditionelle KI-Observability-Demos erfordern immer noch, dass ein Mensch eine Frage zu Traces oder Logs eintippt. Der neue Ansatz streicht diesen Schritt: Sobald ein Alert ausgelöst wird, führt das System automatisch ein bewährtes SRE-Playbook aus und liefert die Antwort.
Der Hackathon, der die Agenten hervorbrachte
Die Agenten entstanden während des WeMakeDevs × Agents of SigNoz Hackathons unter dem Projektnamen MIB (Men in Backend). Anstatt eines konversationellen Chatbots baute das Team eine „autonome Observability-Belegschaft“ aus zwei Agenten:
- Agent J – Der Incident Responder – Hört auf Alerts und folgt dann einem fünfstufigen Playbook: Bestätigung des Alerts, Lokalisierung der verursachenden Traces, Analyse der zugehörigen Logs, Berechnung der Differenz (Delta) und Posten einer Root-Cause-Karte in Slack. Die Sequenz dauert durchschnittlich 3,7 Sekunden.
- Agent K – Der Auditor – Führt geplante Audits der Metrikennutzung durch, markiert Metriken, die Kosten verursachen, aber nicht genutzt werden, und entwirft Dashboard-Änderungen zur Genehmigung durch einen Menschen.
Während des Hackathons meldete Agent K, dass 38 % der wichtigsten Metriken nie gelesen wurden, was die versteckte Verschwendung im Observability-Stack aufdeckte.
Wie das System funktioniert
Deterministische Playbooks statt offener Schleifen
Die Agenten folgen festen, deterministischen Playbooks anstelle von freiformem „agentischem“ Denken. Jeder Durchlauf führt einen bekannten SRE-Workflow aus – bestätigen, Trace, Log, Delta – was zu konsistenten Ergebnissen führt und die Unvorhersehbarkeit von unbeschränktem LLM-Text vermeidet.
Drei Ebenen der Observability
- Application Layer – Die überwachte App streamt Traces, Logs und Metriken an SigNoz.
- Agent Layer – Jeder Agent sendet seine eigenen, von GenAI generierten semantischen Spans zurück an SigNoz, wodurch die Agenten selbst beobachtbar werden.
- MCP Telemetry Layer – Der MCP-Server zeichnet die Telemetrie der Tool-Aufrufe auf und schließt so einen Feedback-Loop, in dem SigNoz die Agenten überwacht, die wiederum SigNoz überwachen.
Predictive Engine für Erkenntnisse vor dem Alert
Ein Hintergrundprozess bewertet Trends alle 25 Sekunden. Wenn Latenz- oder Fehlerraten ansteigen, prognostiziert die Engine einen Vorfall, noch bevor der Alert-Schwellenwert überschritten wird, was den Agenten einen Vorsprung verschafft.
Greifbare Ergebnisse
| Metrik | Ergebnis |
|---|---|
| Untersuchungskosten pro Durchlauf | 0,0013 $ |
| Zeit bis zur vollständigen Ursachenanalyse | < 4 Sekunden |
| Identifizierte ungenutzte Top-Metriken | 38 % |
Erkenntnisse von der Frontlinie
- Manuelle Instrumentierung für GenAI-Spans – Das Hinzufügen einer expliziten Instrumentierung zur Erfassung der semantischen Ausgaben der KI stellt sicher, dass die Daten präzise und durchsuchbar bleiben.
- „Thinking“-Modi deaktivieren – LLMs, die versuchen, konversationell zu sein, kürzen oft JSON-Daten ab. Das Deaktivieren dieser Modi erzwingt prägnante, maschinenlesbare Ausgaben.
- Patching mit RFC 6902 – Die Anwendung von JSON-Patch (RFC 6902) auf die Foundry-Plattform ermöglichte es dem Team, Container-Health-Checks und Latenzparameter zu korrigieren, ohne den gesamten Service neu bereitstellen zu müssen.
Wer profitiert und wer könnte skeptisch sein
Unternehmen, die bereits für Observability-Plattformen bezahlen, können sofort Einsparungen erzielen: reduzierte Analysezeit und die Eliminierung unnötiger Metrik-Sammlung.
Was als Nächstes zu beachten ist
Der Open-Source-Code für MIB ist auf GitHub verfügbar, und ein Demo-Video führt durch einen vollständigen Incident-Durchlauf.
Fazit
Die direkte Einbindung von zwei spezialisierten KI-Agenten in die SigNoz MCP zeigt, dass autonome Ursachenanalysen extrem schnell und kostengünstig sein können. Dieser Ansatz verwandelt Observability von einem passiven Reporting-Tool in einen aktiven Teilnehmer, der sofort handelt, wenn ein Vorfall auftritt – und spart so Zeit, Geld und die unvermeidliche menschliche Frustration bei der nachträglichen Durchsuche von Logs.
