SigNozのManaged Cloud Platform (MCP)上で動作する2つの自律型AI SREエージェントは、根本原因を特定し、Slackに要約を投稿し、わずか4秒足らずで調査を完了します。そのコストは1インシデントあたりわずか0.0013ドルです。これにより、リアクティブなチャットボットへの問い合わせから、調査コストを削減しつつ無駄なメトリクスを浮き彫りにする「自律走行型のオブザーバビリティ・ワークフォース」への転換が実現します。
なぜこれが重要なのか
従来のAIオブザーバビリティのデモでは、人間がトレースやログについて質問を入力する必要があります。新しいアプローチはこのステップを排除します。アラートが発生すると、システムは検証済みのSREプレイブックを自動的に実行し、回答を提供します。
エージェントを生んだハッカソン
これらのエージェントは、WeMakeDevs × Agents of SigNoz ハッカソンにおいて、MIB (Men in Backend) というプロジェクト名で誕生しました。対話型のチャットボットではなく、チームは2つのエージェントからなる「自律型オブザーバビリティ・ワークフォース」を構築しました。
- Agent J – インシデント・レスポンダー – アラートを監視し、5つのステップからなるプレイブックに従います:アラートの確認、原因となっているトレースの特定、関連ログの深掘り、デルタ(差分)の計算、そしてSlackへの根本原因カードの投稿。この一連の動作は平均3.7秒で完了します。
- Agent K – オーディター – メトリクス使用状況の定期的な監査を実行し、コストが発生しているにもかかわらず消費されていないメトリクスをフラグ立てし、人間が承認するためのダッシュボード変更案を作成します。
ハッカソン期間中、Agent Kは上位メトリクスの38%が一度も読み取られていないことを報告し、オブザーバビリティスタックに隠れた無駄を明らかにしました。
システムの仕組み
決定論的なプレイブック、自由なループではない
エージェントは、自由形式の「エージェンティック(agentic)」な推論ではなく、固定された決定論的なプレイブックに従います。各実行は、確認、トレース、ログ、デルタといった既知のSREワークフローを実行するため、一貫した出力を生成し、制約のないLLMのテキストによる予測不可能性を回避できます。
3つのオブザーバビリティ層
- アプリケーション層 – モニタリング対象のアプリが、トレース、ログ、メトリクスをSigNozにストリーミングします。
- エージェント層 – 各エージェントは、自身が生成したGenAIセマンティック・スパンをSigNozに送り返し、エージェント自体もオブザーバブル(観測可能)になります。
- MCPテレメトリ層 – MCPサーバーがツール呼び出しのテレメトリを記録し、「SigNozを監視するエージェントを、SigNozが監視する」というフィードバックループを完成させます。
アラート前の洞察を得るための予測エンジン
バックグラウンドプロセスが25秒ごとにトレンドのスコアリングを行います。レイテンシやエラー率が急上昇すると、エンジンはアラートの閾値を超える前にインシデントを予測し、エージェントに先手を打たせます。
具体的な成果
| メトリクス | 結果 |
|---|---|
| 1回あたりの調査コスト | $0.0013 |
| 完全な根本原因分析までの時間 | 4秒未満 |
| 特定された未使用の上位メトリクス | 38% |
最前線で得られた教訓
- GenAIスパンのための手動インストルメンテーション – AIのセマンティックな出力をキャプチャするために明示的なインストルメンテーションを追加することで、データの正確性と検索性を維持できます。
- 「思考(thinking)」モードをオフにする – 対話を試みるLLMは、JSONを途中で切り捨てることがよくあります。これらのモードを無効にすることで、簡潔でマシン読み取り可能な出力を強制できます。
- RFC 6902によるパッチ適用 – Foundryプラットフォームに対してJSON-Patch (RFC 6902) を適用することで、チームはサービス全体を再デプロイすることなく、コンテナのヘルスチェックやレイテンシパラメータを修正できました。
恩恵を受けるのは誰か、誰が警戒するか
すでにオブザーバビリティプラットフォームに費用を支払っている企業は、アナリストの工数削減やアイドル状態のメトリクス収集の排除により、即座にコスト削減を実現できます。
次に注目すべきこと
MIBのオープンソースコードはGitHubにあり、デモビデオではインシデント発生から完了までの全工程を確認できます。
まとめ
SigNozのMCPに2つの特化型AIエージェントを直接組み込むことは、自律的な根本原因分析が極めて高速かつ極めて安価に行えることを示しています。このアプローチは、オブザーバビリティを単なる受動的なレポートツールから、インシデントが発生した瞬間に即座に行動する能動的な参加者へと変貌させ、時間、コスト、そして事後にログを掘り返すという避けられない人間のフラストレーションを削減します。
