Hai tác nhân AI SRE tự hành chạy trên SigNoz’s Managed Cloud Platform (MCP) có thể xác định nguyên nhân gốc rễ, đăng tóm tắt lên Slack và hoàn tất toàn bộ quá trình điều tra trong chưa đầy 4 giây, với chi phí chỉ 0,0013 USD cho mỗi sự cố. Kết quả là một sự chuyển dịch từ các truy vấn chatbot mang tính phản ứng sang một lực lượng lao động observability tự vận hành, giúp cắt giảm chi phí điều tra đồng thời phát hiện các metrics đang bị lãng phí.

Tại sao điều này lại quan trọng

Các bản demo AI-observability truyền thống vẫn yêu cầu con người phải nhập câu hỏi về traces hoặc logs. Cách tiếp cận mới đã loại bỏ bước đó: khi một cảnh báo (alert) được kích hoạt, hệ thống sẽ tự động thực hiện một playbook SRE đã được kiểm chứng và đưa ra câu trả lời.

Cuộc thi hackathon đã khai sinh ra các tác nhân này

Các tác nhân này ra đời từ cuộc thi hackathon WeMakeDevs × Agents of SigNoz với tên dự án là MIB (Men in Backend). Thay vì một chatbot hội thoại, nhóm đã xây dựng một "lực lượng lao động observability tự hành" gồm hai tác nhân:

  • Agent J – Người phản ứng sự cố (The Incident Responder) – Lắng nghe các cảnh báo, sau đó thực hiện playbook gồm năm bước: xác nhận cảnh báo, định vị các traces gây lỗi, đi sâu vào các logs liên quan, tính toán độ chênh lệch (delta), và đăng một thẻ nguyên nhân gốc rễ lên Slack. Quy trình này trung bình mất 3,7 giây.
  • Agent K – Kiểm toán viên (The Auditor) – Thực hiện các đợt kiểm toán định kỳ về việc sử dụng metrics, gắn cờ các metrics phát sinh chi phí nhưng không được sử dụng, và soạn thảo các thay đổi trên dashboard để con người phê duyệt.

Trong suốt cuộc thi hackathon, Agent K đã báo cáo rằng 38% các metrics hàng đầu chưa bao giờ được đọc, làm lộ ra sự lãng phí tiềm ẩn trong stack observability.

Cách thức hệ thống hoạt động

Playbook mang tính xác định, không phải các vòng lặp mở

Các tác nhân tuân theo các playbook cố định và mang tính xác định thay vì suy luận "agentic" tự do. Mỗi lần chạy sẽ thực hiện một quy trình làm việc SRE đã biết—xác nhận, trace, log, delta—tạo ra đầu ra nhất quán và tránh được sự khó đoán của văn bản LLM không bị kiểm soát.

Ba lớp observability

  1. Application layer – Ứng dụng được giám sát truyền các traces, logs và metrics về SigNoz.
  2. Agent layer – Mỗi tác nhân tự phát ra các semantic spans do GenAI tạo ra về lại SigNoz, giúp chính các tác nhân này cũng có thể được quan sát.
  3. MCP telemetry layer – Máy chủ MCP ghi lại telemetry của các lệnh gọi công cụ (tool-call), hoàn thiện một vòng lặp phản hồi nơi SigNoz giám sát các tác nhân đang giám sát SigNoz.

Công cụ dự đoán để có thông tin trước khi cảnh báo

Một quy trình chạy ngầm sẽ chấm điểm các xu hướng sau mỗi 25 giây. Khi độ trễ (latency) hoặc tỷ lệ lỗi tăng vọt, công cụ này sẽ dự báo một sự cố trước khi ngưỡng cảnh báo bị vượt qua, giúp các tác nhân có lợi thế dẫn trước.

Kết quả hữu hình

Chỉ số Kết quả
Chi phí điều tra mỗi lần chạy 0,0013 USD
Thời gian phân tích đầy đủ nguyên nhân gốc rễ < 4 giây
Các metrics hàng đầu không được sử dụng đã được xác định 38 %

Bài học kinh nghiệm từ thực tế

  • Instrumentation thủ công cho các GenAI spans – Việc thêm instrumentation rõ ràng để ghi lại đầu ra ngữ nghĩa (semantic output) của AI giúp dữ liệu luôn chính xác và có thể tìm kiếm được.
  • Tắt các chế độ "suy nghĩ" (thinking modes) – Các LLM cố gắng giao tiếp theo kiểu hội thoại thường làm cắt ngắn JSON. Việc vô hiệu hóa các chế độ đó sẽ buộc mô hình tạo ra đầu ra ngắn gọn, máy có thể đọc được.
  • Vá lỗi bằng RFC 6902 – Việc áp dụng JSON-Patch (RFC 6902) lên nền tảng Foundry đã cho phép nhóm sửa các lỗi kiểm tra sức khỏe (health-check) của container và các tham số độ trễ mà không cần triển khai lại toàn bộ dịch vụ.

Ai sẽ được lợi, và ai có thể sẽ thận trọng

Các doanh nghiệp vốn đã chi trả cho các nền tảng observability có thể thấy ngay sự tiết kiệm: giảm thời gian của chuyên viên phân tích và loại bỏ việc thu thập các metrics không cần thiết.

Những gì cần theo dõi tiếp theo

Mã nguồn mở của MIB đã có trên GitHub, và một video demo sẽ hướng dẫn chi tiết một quy trình xử lý sự cố đầy đủ.

Bài học rút ra

Việc tích hợp trực tiếp hai tác nhân AI chuyên dụng vào SigNoz’s MCP cho thấy phân tích nguyên nhân gốc rễ tự hành có thể cực kỳ nhanh và cực kỳ rẻ. Cách tiếp cận này biến observability từ một công cụ báo cáo thụ động thành một thành phần tham gia chủ động, hành động ngay khi sự cố xuất hiện, giúp tiết kiệm thời gian, tiền bạc và tránh được sự ức chế không thể tránh khỏi của con người khi phải đào bới qua các logs sau khi sự cố đã xảy ra.