मॅट शुमर (Matt Shumer) आपल्या संगणकासमोर बसले आणि त्यांनी त्यांच्या AI एजंटला एक साधी सूचना दिली: फाईल्स साफ कर (clean up the files). त्यांनी ही प्रक्रिया शेकडो वेळा कोणत्याही समस्येशिवाय केली होती. यावेळी, एका 'पाथ रिझोल्यूशन' (path resolution) त्रुटीमुळे एक सामान्य साफसफाईचे काम पूर्णपणे विनाशात बदलले. अनेक वर्षांचा कोड, दस्तऐवज आणि फोटो काही सेकंदात नाहीसे झाले.

ही केवळ एक काल्पनिक जोखीम नाही. हे एका खऱ्या डेव्हलपरसोबत आणि खऱ्या मशीनवर घडले आहे, आणि ज्या एजंटमुळे हे घडले त्याचा ट्रॅक रेकॉर्ड तो अपयशी ठरण्यापूर्वीपर्यंत अगदी अचूक वाटत होता. जे AI एजंट्स फाईल्स लिहू शकतात, टर्मिनल कमांड्स कार्यान्वित करू शकतात आणि सब-एजंट्स (subagents) तयार करू शकतात, ते आता IDEs, चॅट इंटरफेस आणि ऑटोमेशन पाइपलाईन्समध्ये समाविष्ट झाले आहेत. त्यांना ऑपरेटिंग सिस्टमचा थेट प्रवेश दिला जातो आणि याच विश्वासामध्ये नेमकी धोकादायक गोष्ट दडलेली आहे. शुमरच्या मशीनचा नाश करणाऱ्या त्याच त्रुटी प्रत्येक 'टूल ॲक्सेस' असलेल्या एजंटमध्ये अस्तित्वात आहेत. ते का अपयशी ठरतात आणि त्यांना योग्यरित्या कसे नियंत्रित (cage) करावे, हे समजून घेणे आता या साधनांचा वापर करणाऱ्या प्रत्येकासाठी एक मूलभूत जगण्याची कौशल्य (survival skill) बनले आहे.

जेव्हा पॅटर्न मॅचिंग फाईलसिस्टमशी भिडते

AI एजंट्स विचार करत नाहीत. ते फक्त पॅटर्न मॅच करतात. जेव्हा तुम्ही "फाईल्स साफ कर" असे म्हणता, तेव्हा मॉडेल त्याच्या ट्रेनिंग मेमरीमध्ये हजारो समान संवादांचा शोध घेते आणि सांख्यिकीयदृष्ट्या (statistically) त्या पॅटर्नला जुळणारी कमांड तयार करते. जर सूचना बिल्ड डिरेक्टरीमधील तात्पुरत्या फाईल्स हटवण्याची असेल, तर ते rm -rf /tmp/build-cache/* सारखी कमांड तयार करू शकते. हे तर्कसंगत वाटते कारण ते मॉडेलने पाहिलेल्या इतर सर्व साफसफाईच्या कमांड्ससारखेच दिसते.

पण जेव्हा $HOME सारखा व्हेरिएबल (variable) रिझॉल्व्ह होऊ शकत नाही, तेव्हा काय होते? एक माणूस रिकामी स्ट्रिंग किंवा अनपेक्षित पाथ पाहतो, थांबतो आणि प्रश्न विचारतो. पण एक एजंट पाहतो की पॅटर्न अजूनही जुळत आहे आणि 'एंटर' दाबतो. शुमरच्या बाबतीत, जी कमांड एका विशिष्ट फोल्डरमधील फाईल्स काढण्यासाठी होती, ती चुकून युजर डिरेक्टरीच्या रूटला (root) लक्ष्यित करू लागली. पाथ विचित्र वाटत आहे का, याचा विचार करण्यासाठी एजंट थांबला नाही. त्याने लक्ष्याला (target) पडताळले नाही. त्याने कमांड कार्यान्वित केली कारण ती कार्यान्वित करणे "साफसफाई" या पॅटर्नशी जुळत होते.

हे लार्ज लँग्वेज मॉडेल्स (LLMs) आणि सिस्टम ॲडमिनिस्ट्रेशनमधील मूलभूत विसंगतीचे केंद्र आहे. खऱ्या तर्कामध्ये (reasoning) संदर्भ समजून घेणे, गृहितकांची पडताळणी करणे आणि 'एज केसेस' (edge cases) हाताळणे समाविष्ट असते. पॅटर्न मॅचिंगमध्ये सांख्यिकीयदृष्ट्या योग्य उत्तरासारखा मजकूर तयार करणे समाविष्ट असते. जेव्हा ते उत्तर 'रिकर्सिव्ह डिलीट फ्लॅग' (recursive delete flag) असलेली टर्मिनल कमांड असते, तेव्हा केवळ सांख्यिकीय साम्य पुरेसे नसते.

सब-एजंटचा ब्लाइंड स्पॉट

अनेक आधुनिक एजंट फ्रेमवर्क्स एक मुख्य ऑर्केस्ट्रेटर (orchestrator) वापरतात जो सब-एजंट्सना कामे सोपवतो. मुख्य एजंटकडे कडक सूचना असू शकतात: होम डिरेक्टरीला कधीही स्पर्श करू नका, काहीही हटवण्यापूर्वी नेहमी विचारा, ऑडिट लॉग ठेवा. त्यानंतर तो "जुने लॉग्स साफ कर" (clean up old logs) सारख्या मर्यादित प्रॉम्प्टसह एक वर्कर (worker) तयार करतो.

तो सब-एजंट अनेकदा एका वेगळ्या (silo) वातावरणात काम करतो. त्याला टूल्सचे अधिकार मिळतात, पण मुख्य एजंटची सुरक्षा संस्कृती (safety culture) मिळत नाही. मुख्य एजंटला सावध ठेवणारे निर्बंध 'कॉन्टेक्स्ट विंडो मॅनेजमेंट' दरम्यान संकुचित केले जातात, सारांशित केले जातात किंवा पूर्णपणे काढून टाकले जातात. सब-एजंटला काम आणि टूलकिट मिळते, परंतु सुरक्षा कवच (guardrails) स्थापित करण्यासाठी लागणारे तासांचे काळजीपूर्वक प्रॉम्प्टिंग त्याला मिळत नाही.

याचा परिणाम म्हणजे एक प्रकारची 'संस्थात्मक विस्मरण' (organizational amnesia) होते. मुख्य एजंटच्या सिस्टम प्रॉम्प्टमध्ये असलेली सुरक्षा नियमांची अंमलबजावणी सब-एजंटसाठी अस्तित्वातच नाही असे समजावे. हे विशेषतः धोकादायक आहे कारण सब-एजंट्सना सहसा अशी पुनरावृत्ती होणारी, कमी महत्त्वात्वाची कामे दिली जातात ज्यावर ऑपरेटर्स बारकाईने लक्ष ठेवत नाहीत. जोपर्यंत एखादे काम प्रोडक्शन डेटाबेस (production database) डिलीट करत नाही, तोपर्यंत कोणीही लॉग क्लीनअप जॉबवर लक्ष ठेवत नाही.

निर्णायकतेचा धोका

AI एजंट्समध्ये जास्तीत जास्त स्वायत्ततेकडे (autonomy) झुकणारा एक डिझाइन ट्रेंड दिसून येत आहे. या दृष्टीकोनातून, एक आदर्श एजंट किरकोळ प्रश्नांनी वापरकर्त्याला कधीही त्रास देणार नाही. तो निर्णायकपणे काम करतो, टूल कॉल्सची साखळी तयार करतो आणि न थांबता बहु-स्तरीय वर्कफ्लो पूर्ण करतो.

हीच निर्णायकता या प्रणालींना असुरक्षित बनवते. "निर्णायकपणे कृती करा" (act decisively) असे प्रोग्राम केलेले मॉडेल स्वतःच्या कामाची पुन्हा पडताळणी करत नाही. जेव्हा एखादी कमांड विनाशकारी दिसते, तेव्हा ते थांबत नाही. ते संभ्रम किंवा संकोच (hesitation) हे वैशिष्ट्य मानण्याऐवजी त्रुटी (bug) मानतात. जेव्हा मॉडेल बरोबर असते, तेव्हा हे जादू वाटते. जेव्हा ते चुकते, तेव्हा ते अत्यंत भयानक वाटते. एखादी चुकीची कमांड थांबवण्यासाठी सिस्टममध्ये कोणताही नैसर्गिक अडथळा (friction) नसतो.

Shumer’s agent had worked correctly hundreds of times. That track record created a false sense of security. But reliability over a hundred trials means nothing if trial one hundred and one is the statistical outlier where the pattern breaks. In systems safety, past performance only matters if the failure mode is gradual and visible. AI agent failures are sudden, silent, and total. “It worked hundreds of times” is not a safety record. It is a description of luck that eventually runs out.

How To Build Actual Protection

If the model is not the safety layer