Два автономных ИИ-агента SRE, работающих на платформе SigNoz Managed Cloud Platform (MCP), выявляют первопричину, публикуют отчет в Slack и завершают всё расследование менее чем за 4 секунды, при этом стоимость одного инцидента составляет всего $0,0013. Результатом становится переход от реактивных запросов к чат-ботам к «самоуправляемой рабочей силе» в области наблюдаемости (observability), которая сокращает расходы на расследования и выявляет неиспользуемые метрики.
Почему это важно
Традиционные демо-версии ИИ-наблюдаемости всё еще требуют от человека ввода вопроса о трассировках или логах. Новый подход исключает этот шаг: когда срабатывает оповещение (alert), система автоматически запускает проверенный SRE-плейбук и выдает готовый ответ.
Хакатон, породивший агентов
Агенты появились в ходе хакатона WeMakeDevs × Agents of SigNoz под названием проекта MIB (Men in Backend). Вместо разговорного чат-бота команда создала «автономную рабочую силу для обеспечения наблюдаемости» из двух агентов:
- Agent J — Респондент инцидентов — отслеживает оповещения, а затем следует пятишаговому плейбуку: подтверждение оповещения, поиск проблемных трассировок, углубленный анализ связанных логов, вычисление дельты и публикация карточки с первопричиной в Slack. Этот цикл занимает в среднем 3,7 секунды.
- Agent K — Аудитор — проводит плановые аудиты использования метрик, помечает метрики, которые приносят затраты, но не используются, и готовит черновики изменений в дашбордах для утверждения человеком.
Во время хакатона Agent K сообщил, что 38 % наиболее популярных метрик никогда не считывались, что выявило скрытые потери в стеке наблюдаемости.
Как работает система
Детерминированные плейбуки вместо неопределенных циклов
Агенты следуют фиксированным детерминированным плейбукам, а не используют свободные «агентские» рассуждения. Каждый запуск выполняет известный SRE-рабочий процесс — подтверждение, трассировка, лог, дельта, — что обеспечивает согласованный результат и позволяет избежать непредсказуемости неструктурированного текста от LLM.
Три уровня наблюдаемости
- Уровень приложения — отслеживаемое приложение передает трассировки, логи и метрики в SigNoz.
- Уровень агентов — каждый агент отправляет собственные семантические спаны (spans), сгенерированные GenAI, обратно в SigNoz, что делает самих агентов наблюдаемыми.
- Уровень телеметрии MCP — сервер MCP записывает телеметрию вызовов инструментов (tool-calls), замыкая цикл обратной связи, в котором SigNoz наблюдает за агентами, которые наблюдают за SigNoz.
Прогностический движок для анализа до срабатывания оповещения
Фоновый процесс оценивает тренды каждые 25 секунд. Когда задержка (latency) или уровень ошибок резко возрастает, движок прогнозирует инцидент еще до того, как будет превышен порог оповещения, давая агентам фору.
Ощутимые результаты
| Метрика | Результат |
|---|---|
| Стоимость расследования за один запуск | $0,0013 |
| Время до полного анализа первопричины | < 4 секунд |
| Выявлено неиспользуемых топовых метрик | 38 % |
Уроки, полученные на передовой
- Ручная инструментация для GenAI-спанов — добавление явной инструментации для захвата семантического вывода ИИ позволяет сохранять точность и возможность поиска данных.
- Отключение режимов «размышления» — LLM, пытающиеся вести диалог, часто обрезают JSON. Отключение этих режимов заставляет модель выдавать лаконичный, машиночитаемый результат.
- Исправление через RFC 6902 — применение JSON-Patch (RFC 6902) к платформе Foundry позволило команде исправить проверки состояния контейнеров и параметры задержки без переразвертывания всего сервиса.
Кто выиграет, а кто может отнестись с осторожностью
Предприятия, которые уже платят за платформы наблюдаемости, могут немедленно увидеть экономию: сокращение времени аналитиков и устранение сбора неиспользуемых метрик.
За чем следить дальше
Исходный код MIB с открытым исходным кодом доступен на GitHub, а демо-видео демонстрирует полный цикл обработки инцидента.
Итог
Внедрение двух специализированных ИИ-агентов непосредственно в SigNoz MCP показывает, что автономный анализ первопричин может быть сверхбыстрым и сверхдешевым. Такой подход превращает наблюдаемость из пассивного инструмента отчетности в активного участника, который действует в тот момент, когда появляется инцидент, экономя время, деньги и избавляя человека от неизбежного разочарования при ручном разборе логов постфактум.
