SigNoz کے Managed Cloud Platform (MCP) پر چلنے والے دو خود مختار (autonomous) AI SRE ایجنٹس، 4 سیکنڈ سے بھی کم وقت میں اصل وجہ (root-cause) کا تعین کرتے ہیں، Slack پر خلاصہ پوسٹ کرتے ہیں، اور مکمل تحقیقات مکمل کر لیتے ہیں، جس کی لاگت فی واقعہ صرف $0.0013 آتی ہے۔ اس کا نتیجہ ری ایکٹیو (reactive) چیٹ بوٹ سوالات سے ہٹ کر ایک خودکار (self-driving) observability ورک فورس کی طرف منتقلی ہے، جو فضول میٹرکس کو سامنے لاتے ہوئے تحقیقاتی اخراجات میں نمایاں کمی لاتی ہے۔
یہ کیوں اہم ہے
روایتی AI-observability ڈیمو میں اب بھی ٹریسز (traces) یا لاگز (logs) کے بارے میں سوال پوچھنے کے لیے انسان کی ضرورت ہوتی ہے۔ نیا طریقہ کار اس مرحلے کو ختم کر دیتا ہے: جب کوئی الرٹ (alert) آتا ہے، تو سسٹم خود بخود ایک آزمودہ SRE پلے بک (playbook) چلاتا ہے اور جواب فراہم کر دیتا ہے۔
وہ ہیکاتھون جس نے ان ایجنٹس کو جنم دیا
یہ ایجنٹس WeMakeDevs × Agents of SigNoz ہیکاتھون کے دوران پروجیکٹ کے نام MIB (Men in Backend) کے تحت سامنے آئے۔ ایک بات چیت کرنے والے چیٹ بوٹ کے بجائے، ٹیم نے دو ایجنٹس پر مشتمل ایک "خود مختار observability ورک فورس" تیار کی:
- Agent J – دی انسائیڈنٹ ریسپانڈر (The Incident Responder) – الرٹس کو سنتا ہے، پھر پانچ مرحلہ وار پلے بک پر عمل کرتا ہے: الرٹ کی تصدیق کرنا، متعلقہ ٹریسز (traces) کا پتہ لگانا، متعلقہ لاگز (logs) کی گہرائی میں جانا، فرق (delta) کا حساب لگانا، اور Slack پر روٹ کاز کارڈ پوسٹ کرنا۔ اس عمل میں اوسطاً 3.7 سیکنڈ لگتے ہیں۔
- Agent K – دی آڈیٹر (The Auditor) – میٹک استعمال کے شیڈول شدہ آڈٹ چلاتا ہے، ان میٹرکس کی نشاندہی کرتا ہے جن پر لاگت تو آتی ہے لیکن وہ استعمال نہیں ہو رہے، اور انسانی منظوری کے لیے ڈیش بورڈ میں تبدیلیوں کا مسودہ تیار کرتا ہے۔
ہیکاتھون کے دوران، Agent K نے رپورٹ کیا کہ ٹاپ میٹرکس میں سے 38% کبھی پڑھے ہی نہیں گئے، جس سے observability stack میں چھپے ہوئے ضیاع کا انکشاف ہوا۔
سسٹم کیسے کام کرتا ہے
ڈٹرمینسٹک (Deterministic) پلے بکس، نہ کہ غیر محدود لوپس
ایجنٹس آزادانہ "ایجنٹک" (agentic) استدلال کے بجائے مقررہ، ڈٹرمینسٹک پلے بکس پر عمل کرتے ہیں۔ ہر بار ایک معلوم SRE ورک فلو—تصدیق، ٹریس، لاگ، ڈیلٹا—چلایا جاتا ہے، جو مستقل نتائج فراہم کرتا ہے اور غیر محدود LLM ٹیکسٹ کی غیر یقینی صورتحال سے بچاتا ہے۔
observability کے تین تہیں (layers)
- ایپلی کیشن لیئر (Application layer) – مانیٹر کی جانے والی ایپ ٹریسز، لاگز اور میٹرکس کو SigNoz پر بھیجتی ہے۔
- ایجنٹ لیئر (Agent layer) – ہر ایجنٹ اپنے خود کے GenAI سے تیار کردہ سیمنٹک سپینز (semantic spans) واپس SigNoz کو بھیجتا ہے، جس سے ایجنٹس خود بھی قابلِ مشاہدہ (observable) بن جاتے ہیں۔
- MCP ٹیلی میٹری لیئر (MCP telemetry layer) – MCP سرور ٹول کال ٹیلی میٹری ریکارڈ کرتا ہے، جس سے ایک فیڈ بیک لوپ مکمل ہوتا ہے جہاں SigNoz ان ایجنٹس پر نظر رکھتا ہے جو خود SigNoz پر نظر رکھتے ہیں۔
پری الرٹ بصیرت کے لیے پریڈیکٹیو انجن
ایک بیک گراؤنڈ پروسیس ہر 25 سیکنڈ بعد رجحانات (trends) کا اسکورنگ کرتا ہے۔ جب لیٹنسی (latency) یا ایرر ریٹ میں اضافہ ہوتا ہے، تو انجن الرٹ کی حد (threshold) سے پہلے ہی واقعے کی پیش گوئی کر دیتا ہے، جس سے ایجنٹس کو بروقت کارروائی کا موقع مل جاتا ہے۔
ٹھوس نتائج
| میٹرک (Metric) | نتیجہ |
|---|---|
| فی رن تحقیقاتی لاگت | $0.0013 |
| مکمل روٹ کاز تجزیہ کا وقت | < 4 سیکنڈ |
| غیر استعمال شدہ ٹاپ میٹرکس کی نشاندہی | 38 % |
فرنٹ لائنز سے سیکھے گئے اسباق
- GenAI سپینز کے لیے دستی انسٹرومینٹیشن (Manual instrumentation) – AI کے سیمنٹک آؤٹ پٹ کو محفوظ کرنے کے لیے واضح انسٹرومینٹیشن شامل کرنے سے ڈیٹا درست اور قابلِ تلاش رہتا ہے۔
- "تھنکنگ" (thinking) موڈز کو بند کریں – وہ LLMs جو بات چیت کرنے کی کوشش کرتے ہیں، اکثر JSON کو ادھورا چھوڑ دیتے ہیں۔ ان موڈز کو غیر فعال کرنے سے مختصر اور مشین کے قابلِ خواندہ (machine-readable) آؤٹ پٹ حاصل ہوتا ہے۔
- RFC 6902 کے ذریعے پیچ (Patch) کرنا – Foundry پلیٹ فارم پر JSON-Patch (RFC 6902) کا اطلاق کرنے سے ٹیم کو پوری سروس کو دوبارہ تعینات (redeploy) کیے بغیر کنٹینر ہیلتھ چیکس اور لیٹنسی پیرامیٹرز کو درست کرنے میں مدد ملی۔
کسے فائدہ ہوگا، اور کون محتاط ہو سکتا ہے
وہ ادارے جو پہلے سے ہی observability پلیٹ فارمز کے لیے ادائیگی کر رہے ہیں، وہ فوری طور پر بچت دیکھ سکتے ہیں: تجزیہ کاروں (analysts) کے وقت میں کمی اور غیر ضروری میٹک کلیکشن کا خاتمہ۔
آگے کیا دیکھنا ہے
MIB کا اوپن سورس کوڈ GitHub پر دستیاب ہے، اور ایک ڈیمو ویڈیو میں مکمل انسیڈنٹ رن کا طریقہ کار دکھایا گیا ہے۔
خلاصہ
SigNoz کے MCP میں براہ راست دو خصوصی AI ایجنٹس کو شامل کرنا یہ ظاہر کرتا ہے کہ خود مختار روٹ کاز تجزیہ انتہائی تیز اور انتہائی سستا ہو سکتا ہے۔ یہ طریقہ کار observability کو ایک غیر فعال رپورٹنگ ٹول سے بدل کر ایک فعال شریک کار بنا دیتا ہے جو واقعہ پیش آتے ہی کارروائی کرتا ہے، جس سے وقت، پیسہ اور واقعہ کے بعد لاگز میں کھوج کرنے کی انسانی پریشانی سے بچا جا سکتا ہے۔
