Два автономні ШІ-агенти SRE, що працюють на SigNoz Managed Cloud Platform (MCP), визначають першопричину, публікують звіт у Slack і завершують усе розслідування менш ніж за 4 секунди, витрачаючи лише $0,0013 на інцидент. Результатом є перехід від реактивних запитів до чат-ботів до «самокерованого» персоналу для спостережності (observability workforce), що різко скорочує витрати на розслідування та виявляє марнотратство на метрики.

Чому це важливо

Традиційні демо-покази ШІ-спостережності все ще потребують, щоб людина вводила запитання про трасування (traces) або логи. Новий підхід усуває цей крок: коли спрацьовує сповіщення (alert), система автоматично запускає перевірений SRE-плейбук і надає відповідь.

Хакатон, що породив цих агентів

Агенти з'явилися під час хакатону WeMakeDevs × Agents of SigNoz під назвою проєкту MIB (Men in Backend). Замість розмовного чат-бота команда створила «автономний персонал для спостережності» з двох агентів:

  • Agent J – Incident Responder – слухає сповіщення, а потім виконує п'ятиступеневий плейбук: підтверджує сповіщення, знаходить проблемні трасування, заглиблюється в пов'язані логи, обчислює дельту та публікує картку з першопричиною у Slack. Ця послідовність займає в середньому 3,7 секунди.
  • Agent K – Auditor – проводить заплановані аудити використання метрик, позначає метрики, які створюють витрати, але не використовуються, і готує проєкти змін для дашбордів на затвердження людині.

Під час хакатону Agent K повідомив, що 38 % найбільш популярних метрик ніколи не зчитувалися, що виявило приховані втрати в стеку спостережності.

Як працює система

Детерміновані плейбуки, а не нескінченні цикли

Агенти дотримуються фіксованих детермінованих плейбуків замість вільних «агентських» міркувань. Кожен запуск виконує відомий SRE-воркфлоу — підтвердження, трасування, логи, дельта — що забезпечує стабільний результат і дозволяє уникнути непередбачуваності неструктурованого тексту від LLM.

Три рівні спостережності

  1. Application layer – моніторизований застосунок передає трасування, логи та метрики в SigNoz.
  2. Agent layer – кожен агент надсилає власні семантичні спани (spans), згенеровані GenAI, назад у SigNoz, що робить самих агентів доступними для спостереження.
  3. MCP telemetry layer – сервер MCP записує телеметрію викликів інструментів, завершуючи цикл зворотного зв'язку, де SigNoz спостерігає за агентами, які спостерігають за SigNoz.

Прогностичний двигун для аналізу до спрацювання сповіщення

Фоновий процес оцінює тренди кожні 25 секунд. Коли затримка (latency) або рівень помилок різко зростають, двигун прогнозує інцидент ще до того, як буде перевищено поріг сповіщення, даючи агентам перевагу у часі.

Відчутні результати

Метрика Результат
Вартість розслідування за один запуск $0,0013
Час до повного аналізу першопричини < 4 секунд
Виявлено невикористовуваних топових метрик 38 %

Уроки, засвоєні на передовій

  • Ручна інструментація для GenAI-спанів – додавання явного інструментарію для захоплення семантичних результатів ШІ забезпечує точність і можливість пошуку даних.
  • Вимкнення режимів «роздумів» – LLM, які намагаються бути розмовними, часто обрізають JSON. Вимкнення цих режимів змушує модель видавати стислий результат, придатний для машинного читання.
  • Виправлення за допомогою RFC 6902 – застосування JSON-Patch (RFC 6902) до платформи Foundry дозволило команді виправити перевірки стану (health-checks) контейнерів та параметри затримки без перерозгортання всього сервісу.

Хто отримає вигоду, а хто може поставитися скептично

Підприємства, які вже платять за платформи спостережності, можуть миттєво побачити економію: скорочення часу аналітиків та усунення збору непотрібних метрик.

За чим стежити далі

Відкритий код MIB доступний на GitHub, а демонстраційне відео показує повний цикл розслідування інциденту.

Підсумок

Інтеграція двох спеціалізованих ШІ-агентів безпосередньо в SigNoz MCP демонструє, що автономний аналіз першопричин може бути надшвидким і наддешевим. Такий підхід перетворює спостережність із пасивного інструменту звітності на активного учасника, який діє в момент виникнення інциденту, заощаджуючи час, гроші та позбавляючи людей неминучого роздратування від необхідності розбиратися в логах постфактум.