मैट शुमर अपने कंप्यूटर पर बैठे और अपने AI एजेंट को एक सरल निर्देश दिया: फाइलों को साफ करें (clean up the files)। उन्होंने बिना किसी समस्या के सैकड़ों बार यह रूटीन चलाया था। इस बार, एक पाथ रेज़ोल्यूशन एरर (path resolution error) ने एक साधारण हाउसकीपिंग कार्य को पूरी तरह से आपदा में बदल दिया। वर्षों का कोड, दस्तावेज़ और फ़ोटो सेकंडों में गायब हो गए।
यह कोई काल्पनिक जोखिम नहीं है। यह एक वास्तविक मशीन वाले वास्तविक डेवलपर के साथ हुआ, और जिस एजेंट की बात हो रही है, उसका ट्रैक रिकॉर्ड विफलता के क्षण तक पूरी तरह से सुरक्षित (bulletproof) लग रहा था। AI एजेंट जो फाइलें लिख सकते हैं, टर्मिनल कमांड चला सकते हैं और सब-एजेंट (subagents) बना सकते हैं, वे अब IDEs, चैट इंटरफेस और ऑटोमेशन पाइपलाइनों में शामिल हैं। उन्हें ऑपरेटिंग सिस्टम तक सीधी पहुंच के साथ भरोसा किया जाता है, और यही भरोसा खतरे का मुख्य कारण है। वही विफलता के तरीके (failure modes) जो शुमर की मशीन को नष्ट कर देते हैं, टूल एक्सेस वाले हर एजेंट में मौजूद हैं। वे क्यों विफल होते हैं, और उन्हें ठीक से कैसे नियंत्रित (cage) किया जाए, इसे समझना अब इन उपकरणों का उपयोग करने वाले किसी भी व्यक्ति के लिए एक बुनियादी उत्तरजीविता कौशल (survival skill) है।
जब पैटर्न मैचिंग (Pattern Matching) फाइलसिस्टम से मिलती है
AI एजेंट सोचते नहीं हैं। वे पैटर्न मैच करते हैं। जब आप "फाइलों को साफ करें" कहते हैं, तो मॉडल अपने ट्रेनिंग मेमोरी में हजारों समान इंटरैक्शन खोजता है और एक ऐसा कमांड जेनरेट करता है जो सांख्यिकीय रूप से (statistically) पैटर्न में फिट बैठता है। यदि निर्देश बिल्ड डायरेक्टरी में अस्थायी फ़ाइलों को हटाने का है, तो यह rm -rf /tmp/build-cache/* जैसा कमांड जेनरेट कर सकता है। यह तर्कसंगत लगता है क्योंकि यह मॉडल द्वारा देखे गए अन्य सभी क्लीनअप कमांड के समान है।
लेकिन क्या होता है जब $HOME जैसा वेरिएबल रेज़ॉल्व (resolve) करने में विफल हो जाता है? एक इंसान एक खाली स्ट्रिंग या एक अप्रत्याशित पाथ देखता है, रुकता है, और सवाल पूछता है। एक एजेंट देखता है कि पैटर्न अभी भी मेल खाता है और एंटर दबा देता है। शुमर के मामले में, एक कमांड जिसे एक विशिष्ट फ़ोल्डर को छाँटना (prune) था, उसने इसके बजाय यूजर डायरेक्टरी के रूट (root) को निशाना बनाया। एजेंट यह सोचने के लिए नहीं रुका कि पाथ अजीब क्यों लग रहा है। उसने लक्ष्य को सत्यापित (verify) नहीं किया। उसने कमांड को इसलिए निष्पादित (execute) किया क्योंकि निष्पादन "क्लीन अप" के पैटर्न से मेल खाता था।
यह लार्ज लैंग्वेज मॉडल्स (LLMs) और सिस्टम एडमिनिस्ट्रेशन के बीच का मुख्य अंतर है। वास्तविक तर्क (reasoning) में संदर्भ को समझना, धारणाओं को सत्यापित करना और एज केस (edge cases) को संभालना शामिल है। पैटर्न मैचिंग में ऐसा टेक्स्ट तैयार करना शामिल है जो सांख्यिकीय रूप से सही उत्तर के समान हो। जब वह उत्तर एक रिकर्सिव डिलीट फ्लैग (recursive delete flag) वाला टर्मिनल कमांड हो, तो सांख्यिकीय समानता पर्याप्त नहीं है।
सब-एजेंट ब्लाइंड स्पॉट (The Subagent Blind Spot)
कई आधुनिक एजेंट फ्रेमवर्क एक मुख्य ऑर्केस्ट्रेटर (orchestrator) का उपयोग करते हैं जो सब-एजेंटों को कार्य सौंपता है। पैरेंट एजेंट के पास सख्त निर्देश हो सकते हैं: होम डायरेक्टरी को कभी न छुएं, डिलीट करने से पहले हमेशा पूछें, ऑडिट लॉग बनाए रखें। फिर यह "पुराने लॉग्स को साफ करें" जैसे संकीर्ण प्रॉम्प्ट के साथ एक वर्कर को स्पॉन (spawn) करता है।
वह सब-एजेंट अक्सर एक अलग दायरे (silo) में काम करता है। वह टूल्स तो विरासत में प्राप्त करता है लेकिन पैरेंट की सुरक्षा संस्कृति (safety culture) नहीं। जो बाधाएं मुख्य एजेंट को सतर्क रखती थीं, वे कॉन्टेक्स्ट विंडो मैनेजमेंट के दौरान संकुचित, संक्षिप्त या पूरी तरह से हटा दी जाती हैं। सब-एजेंट को एक कार्य और टूलकिट तो मिलता है, लेकिन उसे वे घंटों की सावधानीपूर्वक प्रॉम्प्टिंग नहीं मिलती जिसने सुरक्षा घेरे (guardrails) स्थापित किए थे।
इसका परिणाम एक प्रकार की संगठनात्मक विस्मृति (organizational amnesia) है। पैरेंट एजेंट के सिस्टम प्रॉम्प्ट में मौजूद सुरक्षा नियम सब-एजेंट के लिए अस्तित्वहीन हो सकते हैं। यह विशेष रूप से खतरनाक है क्योंकि सब-एजेंटों को आमतौर पर ऐसे दोहराव वाले, कम-महत्व वाले कार्य दिए जाते हैं जिनकी निगरानी ऑपरेटर बारीकी से करना बंद कर देते हैं। लॉग क्लीनअप जॉब पर तब तक कोई नज़र नहीं रखता जब तक कि वह प्रोडक्शन डेटाबेस को डिलीट न कर दे।
निर्णायकता का खतरा (The Danger of Decisiveness)
AI एजेंटों में अधिकतम स्वायत्तता (autonomy) की ओर एक डिज़ाइन ट्रेंड है। इस दृष्टि में, आदर्श एजेंट उपयोगकर्ता को मामूली सवालों से कभी परेशान नहीं करता है। यह निर्णायक रूप से कार्य करता है, टूल कॉल्स को एक साथ जोड़ता है, और बिना रुके मल्टी-स्टेप वर्कफ़्लो को पूरा करता है।
वही निर्णायकता इन सिस्टम्स को असुरक्षित बनाती है। "निर्णायक रूप से कार्य करने" के लिए प्रोग्राम किया गया मॉडल अपने काम की दोबारा जांच नहीं करता है। जब कोई कमांड विनाशकारी लगता है, तो यह रुकता नहीं है। यह हिचकिचाहट को एक फीचर के बजाय एक बग के रूप में देखता है। जब मॉडल सही होता है, तो यह जादुई लगता है। जब यह गलत होता है, तो यह अथक (relentless) लगता है। सिस्टम में किसी गलत कमांड को धीमा करने के लिए कोई प्राकृतिक घर्षण (friction) नहीं होता है।
Shumer के एजेंट ने सैकड़ों बार सही ढंग से काम किया था। उस ट्रैक रिकॉर्ड ने सुरक्षा की एक झूठी भावना पैदा कर दी। लेकिन सौ परीक्षणों में विश्वसनीयता का कोई अर्थ नहीं रह जाता यदि एक सौ पहला परीक्षण एक सांख्यिकीय विसंगति (statistical outlier) हो जहाँ पैटर्न टूट जाता है। सिस्टम सुरक्षा में, पिछला प्रदर्शन तभी मायने रखता है जब विफलता का तरीका क्रमिक और दृश्यमान हो। AI एजेंट की विफलताएं अचानक, शांत और पूर्ण होती हैं। "यह सैकड़ों बार काम कर गया" कोई सुरक्षा रिकॉर्ड नहीं है। यह भाग्य का एक वर्णन है जो अंततः समाप्त हो जाता है।
वास्तविक सुरक्षा कैसे बनाएं
यदि मॉडल सुरक्षा परत नहीं है
