Matt Shumer نے اپنے کمپیوٹر پر بیٹھ کر اپنے AI agent کو ایک سادہ سا حکم دیا: فائلوں کو صاف کر دو (clean up the files)۔ اس نے یہ معمول سینکڑوں بار بغیر کسی مسئلے کے انجام دیا تھا۔ اس بار، ایک path resolution error نے ایک عام صفائی کے کام کو ایک بڑے حادثے میں بدل دیا۔ برسوں کا کوڈ، دستاویزات اور تصاویر چند سیکنڈوں میں غائب ہو گئیں۔

یہ کوئی فرضی خطرہ نہیں ہے۔ یہ ایک حقیقی ڈویلپر کے ساتھ اس کی حقیقی مشین پر ہوا، اور جس ایجنٹ کا ذکر کیا جا رہا ہے اس کا ریکارڈ ناکام ہونے سے عین پہلے تک ناقابلِ تسخیر نظر آتا تھا۔ وہ AI agents جو فائلیں لکھ سکتے ہیں، terminal commands چلا سکتے ہیں، اور subagents بنا سکتے ہیں، اب IDEs، chat interfaces، اور automation pipelines میں شامل ہیں۔ انہیں operating systems تک براہ راست رسائی کے ساتھ قابلِ اعتماد سمجھا جاتا ہے، اور یہی وہ جگہ ہے جہاں خطرہ چھپا ہوا ہے۔ وہی ناکامی کے طریقے جنہوں نے Shumer کی مشین کو تباہ کیا، ہر اس ایجنٹ میں موجود ہیں جس کے پاس tools تک رسائی ہے۔ یہ سمجھنا کہ وہ کیوں ناکام ہوتے ہیں، اور انہیں صحیح طریقے سے کیسے قابو میں رکھا جائے، اب ان ٹولز کو استعمال کرنے والے ہر شخص کے لیے بقا کی ایک بنیادی مہارت ہے۔

جب Pattern Matching کا سامنا Filesystem سے ہوتا ہے

AI agents سوچتے نہیں ہیں۔ وہ patterns کو میچ کرتے ہیں۔ جب آپ کہتے ہیں "فائلیں صاف کر دو"، تو ماڈل اپنی ٹریننگ میموری میں ہزاروں ملتے جلتے تعاملات تلاش کرتا ہے اور ایک ایسی کمانڈ تیار کرتا ہے جو شماریاتی طور پر اس پیٹرن کے مطابق ہو۔ اگر ہدایت بلڈ ڈائریکٹری (build directory) میں عارضی فائلوں کو حذف کرنے کی ہو، تو یہ rm -rf /tmp/build-cache/* جیسی کمانڈ تیار کر سکتا ہے۔ یہ معقول لگتا ہے کیونکہ یہ ہر اس صفائی کی کمانڈ سے ملتا جلتا ہے جو ماڈل نے پہلے کبھی دیکھی ہو۔

لیکن کیا ہوتا ہے جب $HOME جیسا متغیر (variable) ریزولو (resolve) ہونے میں ناکام ہو جائے؟ ایک انسان خالی اسٹرنگ یا غیر متوقع پاتھ دیکھتا ہے، رکتا ہے، اور سوالات کرتا ہے۔ ایک ایجنٹ دیکھتا ہے کہ پیٹرن اب بھی میچ ہو رہا ہے اور 'enter' دبا دیتا ہے۔ Shumer کے معاملے میں، ایک کمانڈ جسے ایک مخصوص فولڈر کو صاف کرنا چاہیے تھا، اس کے بجائے صارف کی ڈائریکٹری (user directory) کی جڑ (root) کو نشانہ بنا لیا۔ ایجنٹ یہ سوچنے کے لیے نہیں رکا کہ پاتھ عجیب کیوں لگ رہا ہے۔ اس نے ہدف (target) کی تصدیق نہیں کی۔ اس نے کمانڈ اس لیے چلائی کیونکہ اس کا عمل "صفائی" کے پیٹرن سے مطابقت رکھتا تھا۔

یہ لارج لینگویج ماڈلز (LLMs) اور سسٹم ایڈمنسٹریشن کے درمیان بنیادی فرق ہے۔ حقیقی استدلال (reasoning) میں سیاق و سباق کو سمجھنا، مفروضوں کی تصدیق کرنا، اور پیچیدہ حالات (edge cases) کو سنبھالنا شامل ہے۔ Pattern matching میں ایسا متن تیار کرنا شامل ہے جو شماریاتی طور پر ایک درست جواب سے ملتا جلتا ہو۔ جب وہ جواب ایک ایسی terminal command ہو جس میں recursive delete flag شامل ہو، تو محض شماریاتی مماثلت کافی نہیں ہوتی۔

The Subagent Blind Spot

بہت سے جدید ایجنٹ فریم ورکس ایک مین آرکیسٹریٹر (main orchestrator) استعمال کرتے ہیں جو کاموں کو subagents کے سپرد کرتا ہے۔ پیرنٹ ایجنٹ کے پاس سخت ہدایات ہو سکتی ہیں: ہوم ڈائریکٹری کو کبھی نہ چھوئیں، حذف کرنے سے پہلے ہمیشہ پوچھیں، آڈٹ لاگ برقرار رکھیں۔ پھر وہ ایک ورکر کو "پرانے لاگز صاف کریں" جیسے محدود پرامپٹ کے ساتھ پیدا کرتا ہے۔

وہ subagent اکثر ایک الگ تھلگ ماحول میں کام کرتا ہے۔ وہ ٹولز تو وراثت میں حاصل کرتا ہے لیکن پیرنٹ کا حفاظتی کلچر نہیں۔ وہ پابندیاں جو مین ایجنٹ کو محتاط رکھتی ہیں، context window management کے دوران سمٹ جاتی ہیں، خلاصہ کر دی جاتی ہیں، یا مکمل طور پر ختم کر دی جاتی ہیں۔ Subagent کو ایک ٹاسک اور ٹول کٹ تو مل جاتی ہے، لیکن اسے وہ گھنٹوں کی محتاط پرامپٹنگ نہیں ملتی جس نے حفاظتی حدود (guardrails) قائم کی تھیں۔

اس کا نتیجہ ایک قسم کی تنظیمی فراموشی (organizational amnesia) کی صورت میں نکلتا ہے۔ حفاظتی اصول جو پیرنٹ ایجنٹ کے سسٹم پرامپٹ میں موجود ہوتا ہے، وہ subagent کے لیے ایسا ہی ہے جیسے اس کا کوئی وجود ہی نہ ہو۔ یہ خاص طور پر خطرناک ہے کیونکہ subagents کو عام طور پر وہ تکراری اور کم اہمیت کے کام دیے جاتے ہیں جن کی نگرانی آپریٹرز قریب سے کرنا چھوڑ دیتے ہیں۔ کوئی بھی لاگ صفائی کے کام پر نظر نہیں رکھتا جب تک کہ وہ پروڈکشن ڈیٹا بیس کو ڈیلیٹ نہ کر دے۔

فیصلہ سازی کا خطرہ (The Danger of Decisiveness)

AI ایجنٹس میں زیادہ سے زیادہ خودمختاری (autonomy) کی طرف ایک ڈیزائن کا رجحان ہے۔ اس تصور میں، مثالی ایجنٹ معمولی سوالات کے ساتھ صارف کو کبھی پریشان نہیں کرتا۔ یہ فیصلہ کن طور پر عمل کرتا ہے، ٹول کالز کو آپس میں جوڑتا ہے، اور بغیر رکے کثیر مرحلہ وار ورک فلو مکمل کرتا ہے۔

یہی فیصلہ سازی ان سسٹمز کو غیر محفوظ بناتی ہے۔ ایک ماڈل جسے "فیصلہ کن طور پر عمل کرنے" کے لیے پروگرام کیا گیا ہو، وہ اپنے کام کی دوبارہ تصدیق نہیں کرتا۔ جب کوئی کمانڈ تباہ کن نظر آتی ہے تو وہ رکتا نہیں ہے۔ وہ ہچکچاہٹ کو ایک فیچر کے بجائے ایک بگ (bug) سمجھتا ہے۔ جب ماڈل درست ہوتا ہے، تو یہ جادوئی محسوس ہوتا ہے۔ جب یہ غلط ہوتا ہے، تو یہ بے رحم محسوس ہوتا ہے۔ سسٹم میں کسی بھی غلط کمانڈ کو روکنے کے لیے کوئی قدرتی رکاوٹ موجود نہیں ہوتی۔

Shumer کے ایجنٹ نے سینکڑوں بار درست طریقے سے کام کیا تھا۔ اس ریکارڈ نے تحفظ کا ایک غلط احساس پیدا کر دیا۔ لیکن سو تجربات پر بھروسہ اس وقت بے معنی ہو جاتا ہے جب ایک سو ایکواں تجربہ ایک ایسا شماریاتی غیر معمولی واقعہ ہو جہاں پیٹرن ٹوٹ جائے۔ سسٹم کی حفاظت میں، ماضی کی کارکردگی صرف اس صورت میں اہمیت رکھتی ہے اگر ناکامی کا انداز بتدریج اور واضح ہو۔ AI ایجنٹ کی ناکامیاں اچانک، خاموش اور مکمل ہوتی ہیں۔ "یہ سینکڑوں بار کام کر گیا" کوئی حفاظتی ریکارڈ نہیں ہے۔ یہ محض خوش قسمتی کی ایک ایسی وضاحت ہے جو آخر کار ختم ہو جاتی ہے۔

حقیقی تحفظ کیسے بنایا جائے

اگر ماڈل حفاظتی تہہ نہ ہو