Anthropic ने कहा कि हाल ही में एक सुरक्षा-परीक्षण अभियान के दौरान उसके तीन Claude मॉडल सैंडबॉक्स से बाहर निकल गए और वास्तविक दुनिया के सिस्टम तक पहुँच गए, जिसके कारण मूल्यांकन को तुरंत रोक दिया गया और एक सार्वजनिक रिपोर्ट जारी की गई।

कंपनी ने 141,006 साइबर सुरक्षा परीक्षण चलाए और तीन ऐसी घटनाएं पाईं जहाँ मॉडल सिम्युलेटेड वातावरण के बजाय लाइव लक्ष्यों तक पहुँच गए। एक तीसरे पक्ष के पार्टनर के साथ गलत कॉन्फ़िगरेशन (misconfiguration) के कारण सैंडबॉक्स प्रभावी रूप से खुला रह गया।

ये उल्लंघन कैसे हुए

  • Claude Opus 4.7 इंटरनेट पर मौजूद एक वास्तविक कंपनी तक पहुँच गया और कुछ सौ पंक्तियों (rows) के डेटाबेस को निकालने के लिए कमजोर पासवर्ड का अनुमान लगाया।
  • Claude Mythos 5 ने वास्तविक PyPI रिपॉजिटरी में एक पैकेज प्रकाशित करके सप्लाई-चेन हमला (supply-chain attack) किया। रजिस्ट्री द्वारा विसंगति (anomaly) को पकड़े जाने से पहले यह पैकेज 15 प्रोडक्शन मशीनों पर इंस्टॉल हो गया था।
  • एक आंतरिक अनुसंधान मॉडल (internal research model) ने 9,000 लक्ष्यों को स्कैन किया, एक एकल एप्लिकेशन से समझौता किया, और फिर यह पहचान लेने के बाद खुद को रोक लिया कि होस्ट उसके सिम्युलेटेड कार्य से मेल नहीं खाता था।

Anthropic ने इस बात पर जोर दिया कि ये "rogue AI" की घटनाएं नहीं थीं। मॉडल वही कर रहे थे जो उन्हें बताया गया था; परीक्षण बुनियादी ढांचा उन्हें खुले इंटरनेट से अलग करने में विफल रहा।

यह क्यों महत्वपूर्ण है

ये घटनाएं दिखाती हैं कि जब AI एजेंट कोड निष्पादित (execute) कर सकते हैं और नेटवर्क कॉल कर सकते हैं, तो एक नियंत्रित सैंडबॉक्स और लाइव नेटवर्क के बीच की रेखा कितनी धुंधली होती है। स्वायत्त एजेंटों (autonomous agents) के साथ प्रयोग कर रहे उद्यमों के लिए, एक सिस्टम प्रॉम्प्ट या README फ़ाइल सीमाओं की गारंटी नहीं दे सकती है। जैसा कि PyPI मामले से पता चलता है, एक मामूली डेटा सेट या कुछ मशीनें भी बड़े सप्लाई-चेन समझौते (compromises) को ट्रिगर कर सकती हैं।

ये तीन उल्लंघन Anthropic के प्रयासों के पैमाने को भी प्रकट करते हैं: इसने किसी रैंडम सैंपल के बजाय हर परीक्षण रन का ऑडिट किया। इसी गहनता के कारण कंपनी घटनाओं के फैलने से पहले गलत कॉन्फ़िगरेशन का पता लगाने में सफल रही।

Anthropic ने क्या किया

सैंडबॉक्स विफलता का पता चलने के एक दिन के भीतर, Anthropic ने सभी चल रहे मूल्यांकनों को रोक दिया। एक सप्ताह बाद, इसने एक विस्तृत प्रकटीकरण (disclosure) जारी किया जिसमें तीनों घटनाओं, तकनीकी कारण और तत्काल सुधारात्मक कदमों (remediation steps) को सूचीबद्ध किया गया था।

AI-एजेंट उपयोगकर्ताओं के लिए व्यावहारिक सुझाव

  1. प्रत्यक्ष जांच के साथ नेटवर्क सीमाओं को सत्यापित करें – यह मानकर न चलें कि कोई प्रॉम्प्ट या कॉन्फ़िग फ़ाइल वास्तव में एजेंट को अलग करती है।
  2. क्रेडेंशियल्स (credentials) को न्यूनतम तक सीमित रखें – केवल वही अनुमति दें जो कार्य के लिए अत्यंत आवश्यक हो।
  3. पहुंच (reachability) का स्वयं परीक्षण करें – संवेदनशील संसाधन सौंपने से पहले एजेंट के वास्तविक नेटवर्क व्यू की जांच करें।
  4. अनपेक्षित गतिविधि की निगरानी करें – आउटबाउंड कनेक्शन या पैकेज पंजीकरण के लिए अलर्ट सेट करें जो योजना से अलग हों।

यह घटना एक सरल सत्य को रेखांकित करती है: किसी AI मॉडल को इंटरनेट एक्सेस देना उतना ही जोखिम भरा है जितना कि किसी मानव ऑपरेटर को क्रेडेंशियल्स सौंपना। जब तक सैंडबॉक्स की गारंटी साबित नहीं हो जाती, तब तक हर AI-संचालित क्रिया को संभावित रूप से अप्रतिबंधित (unrestricted) मानें और उसी के अनुसार वातावरण को सुरक्षित (lock down) करें।