Dua agen AI SRE otonom yang berjalan di SigNoz’s Managed Cloud Platform (MCP) menemukan akar masalah (root-cause), mengirimkan ringkasan ke Slack, dan menyelesaikan seluruh investigasi dalam waktu kurang dari 4 detik, dengan biaya hanya $0,0013 per insiden. Hasilnya adalah pergeseran dari kueri chatbot yang reaktif menjadi tenaga kerja observabilitas yang self-driving, yang memangkas biaya investigasi sekaligus mengungkap metrik yang terbuang.

Mengapa ini penting

Demo AI-observabilitas tradisional masih memerlukan manusia untuk mengetik pertanyaan tentang trace atau log. Pendekatan baru ini menghilangkan langkah tersebut: saat sebuah alert muncul, sistem secara otomatis menjalankan playbook SRE yang teruji dan memberikan jawabannya.

Hackathon yang melahirkan para agen ini

Para agen ini muncul dari hackathon WeMakeDevs × Agents of SigNoz dengan nama proyek MIB (Men in Backend). Alih-alih chatbot percakapan, tim membangun "tenaga kerja observabilitas otonom" yang terdiri dari dua agen:

  • Agent J – The Incident Responder – Mendengarkan alert, lalu mengikuti playbook lima langkah: mengonfirmasi alert, menemukan trace yang bermasalah, mendalami log terkait, menghitung delta, dan mengirimkan kartu akar masalah (root-cause card) ke Slack. Urutan ini rata-rata memakan waktu 3,7 detik.
  • Agent K – The Auditor – Menjalankan audit terjadwal terhadap penggunaan metrik, menandai metrik yang menimbulkan biaya tetapi tidak ada konsumsi, dan menyusun draf perubahan dasbor untuk disetujui manusia.

Selama hackathon, Agent K melaporkan bahwa 38% dari metrik teratas tidak pernah dibaca, mengungkap pemborosan tersembunyi dalam tumpukan (stack) observabilitas.

Cara kerja sistem

Playbook deterministik, bukan loop tanpa batas

Para agen mengikuti playbook deterministik yang tetap, alih-alih penalaran "agentic" yang bebas. Setiap sesi menjalankan alur kerja SRE yang sudah diketahui—konfirmasi, trace, log, delta—menghasilkan output yang konsisten dan menghindari ketidakpastian dari teks LLM yang tidak terkendali.

Tiga lapisan observabilitas

  1. Application layer – Aplikasi yang dipantau mengirimkan trace, log, dan metrik ke SigNoz.
  2. Agent layer – Setiap agen memancarkan semantic span buatannya sendiri yang dihasilkan GenAI kembali ke SigNoz, membuat para agen itu sendiri dapat diobservasi.
  3. MCP telemetry layer – Server MCP mencatat telemetri tool-call, melengkapi loop umpan balik di mana SigNoz mengawasi agen-agen yang mengawasi SigNoz.

Mesin prediktif untuk wawasan pra-alert

Sebuah proses latar belakang memberikan skor pada tren setiap 25 detik. Saat latensi atau tingkat kesalahan melonjak, mesin tersebut memprediksi insiden sebelum ambang batas alert terlampaui, memberikan keunggulan waktu bagi para agen.

Hasil nyata

Metrik Hasil
Biaya investigasi per sesi $0,0013
Waktu untuk analisis akar masalah penuh < 4 detik
Metrik teratas yang tidak digunakan teridentifikasi 38%

Pelajaran yang dipetik di garis depan

  • Instrumentasi manual untuk GenAI spans – Menambahkan instrumentasi eksplisit untuk menangkap output semantik AI menjaga data tetap akurat dan dapat dicari.
  • Matikan mode “thinking” – LLM yang mencoba untuk bersifat percakapan sering kali memotong JSON. Menonaktifkan mode tersebut memaksa output yang ringkas dan dapat dibaca mesin.
  • Patch dengan RFC 6902 – Menerapkan JSON-Patch (RFC 6902) pada platform Foundry memungkinkan tim memperbaiki pemeriksaan kesehatan (health-check) kontainer dan parameter latensi tanpa perlu melakukan redeploy pada seluruh layanan.

Siapa yang akan diuntungkan, dan siapa yang mungkin waspada

Perusahaan yang sudah membayar platform observabilitas dapat melihat penghematan secara langsung: pengurangan waktu analis dan penghapusan pengumpulan metrik yang menganggur.

Apa yang perlu diperhatikan selanjutnya

Kode sumber terbuka untuk MIB tersedia di GitHub, dan video demo menunjukkan simulasi penuh dari sebuah insiden.

Kesimpulan

Menanamkan dua agen AI khusus secara langsung ke dalam MCP SigNoz menunjukkan bahwa analisis akar masalah otonom bisa sangat cepat dan sangat murah. Pendekatan ini mengubah observabilitas dari alat pelaporan pasif menjadi partisipan aktif yang bertindak saat insiden muncul, menghemat waktu, uang, dan frustrasi manusia yang tak terelakkan saat harus menggali log setelah kejadian.