Anthropic के Opus 5 ने ब्राउज़र प्रॉम्प्ट इंजेक्शन में शून्य प्रतिशत सफलता दर हासिल की

Anthropic ने Opus 5 की रिलीज़ के साथ AI सुरक्षा में एक ऐतिहासिक सफलता हासिल की है, जो स्वायत्त एजेंटों (autonomous agents) की सबसे निरंतर बनी रहने वाली कमजोरियों में से एक को हल कर सकती है। एक दोहरी-स्तरीय रक्षा प्रणाली (dual-layer defense system) को लागू करके, मॉडल ने ब्राउज़र-आधारित प्रॉम्प्ट इंजेक्शन हमलों के प्रति लगभग पूर्ण प्रतिरक्षा (immunity) प्रदर्शित की है।

AI एजेंटों में प्रॉम्प्ट इंजेक्शन का संकट

प्रॉम्प्ट इंजेक्शन वर्तमान AI युग की "अकिलीज़ हील" (Achilles' heel - सबसे बड़ी कमजोरी) बना हुआ है। यह भेद्यता तब होती है जब कोई हमलावर किसी वेबपेज के भीतर दुर्भावनापूर्ण निर्देश छिपा देता है—अक्सर अदृश्य टेक्स्ट के माध्यम से—जिसे एक AI एजेंट ब्राउज़िंग के दौरान पढ़ता है। एक बार प्रोसेस होने के बाद, ये निर्देश मॉडल को हाईजैक कर सकते हैं, जिससे वह सुरक्षा प्रोटोकॉल को दरकिनार करने या अनधिकृत कार्यों को निष्पादित करने के लिए मजबूर हो जाता है। हालांकि OpenAI जैसे उद्योग जगत के दिग्गजों ने पहले सुझाव दिया था कि प्रॉम्प्ट इंजेक्शन LLMs की एक अनसुलझी अंतर्निहित खामी हो सकती है, Anthropic का नवीनतम डेटा उस निराशावादी दृष्टिकोण को चुनौती देता है।

शून्य प्रतिशत बेंचमार्क हासिल करना

Anthropic के सिस्टम कार्ड के अनुसार, Opus 5 ने ब्राउज़र एजेंटों के लिए विशेष रूप से डिज़ाइन किए गए 129 अलग-अलग परीक्षण परिदृश्यों में आश्चर्यजनक 0% हमला सफलता दर हासिल की। यह पिछले संस्करणों की तुलना में एक महत्वपूर्ण छलांग है। सुरक्षा फर्म Gray Swan द्वारा किए गए सामान्य प्रॉम्प्ट इंजेक्शन परीक्षण में, Opus 5 ने अपने पूर्ववर्ती की तुलना में नाटकीय सुधार दिखाया; 15 प्रयासों के बाद, हमलावर की सफलता दर 5.5% (Opus 4.8 में देखी गई) से घटकर केवल 2.0% रह गई।

यह प्रदर्शन Opus 5 को Gray Swan IPI बेंचमार्क में शीर्ष पर रखता है, जो Mythos 5 (2.6%) और Fable 5 (2.8%) जैसे अन्य उच्च-स्तरीय मॉडलों से बेहतर प्रदर्शन करता है।

सीक्रेट सॉस: Auto Mode और दोहरी-स्तरीय रक्षा

यह सफलता केवल मॉडल की बुद्धिमत्ता के कारण नहीं है, बल्कि विशेष सॉफ़्टवेयर के साथ इसके एकीकरण के कारण है। "शून्य प्रतिशत" सफलता दर विशेष रूप से Claude Cowork जैसे उत्पादों में Auto Mode के उपयोग से जुड़ी है। Anthropic एजेंट को सुरक्षित करने के लिए एक परिष्कृत दो-स्तरीय रक्षा आर्किटेक्चर का उपयोग करता है:

  1. Pre-processing Scan: एक समर्पित लेयर प्राथमिक LLM द्वारा टेक्स्ट प्रोसेस किए जाने से पहले सभी आने वाले डेटा को छिपे हुए या हेरफेर करने वाले निर्देशों के लिए स्कैन करती है।
  2. Execution Blocking: एक माध्यमिक लेयर एजेंट के इच्छित कार्यों की निगरानी करती है, और ब्राउज़र वातावरण में निष्पादित होने से पहले किसी भी खतरनाक कमांड को ब्लॉक कर देती है।

दिलचस्प बात यह है कि डेटा दिखाता है कि केवल मॉडल ही कोई रामबाण (silver bullet) नहीं है। इन सुरक्षात्मक सॉफ़्टवेयर लेयर्स के बिना, Opus 5 की भेद्यता 3.7% है। वास्तव में, विशेष Sonnet 5 मॉडल अकेले में 0.93% सफलता दर के साथ थोड़ा बेहतर प्रदर्शन करता है। यह कोर मॉडल और रक्षात्मक सॉफ़्टवेयर स्टैक के बीच का तालमेल ही है जो सुरक्षा सीमा को लगभग पूर्णता तक ले जाता है।

यह AI के भविष्य के लिए क्यों महत्वपूर्ण है

स्वायत्त AI एजेंट बनाने वाले डेवलपर्स और संस्थापकों के लिए, यह विकास एक आमूलचूल परिवर्तन (paradigm shift) है। यदि प्रॉम्प्ट इंजेक्शन को केवल मॉडल प्रशिक्षण के बजाय आर्किटेक्चरल लेयर्स के माध्यम से बेअसर किया जा सकता है, तो विश्वसनीय, "एजेंटिक" (agentic) वर्कफ़्लो—जहाँ AI ईमेल, ब्राउज़र और संवेदनशील डेटा का प्रबंधन करता है—का मार्ग बहुत सुरक्षित हो जाता है। Anthropic ने एक ब्लूप्रिंट प्रदान किया है कि कैसे उद्योग "अनसुलझे" नैरेटिव से आगे बढ़कर मजबूत, प्रोडक्शन-रेडी AI स्वायत्तता की ओर बढ़ सकता है।

मुख्य बातें

  • उद्योग-अग्रणी सुरक्षा: Auto Mode का उपयोग करते समय Opus 5 ने 129 ब्राउज़र-आधारित प्रॉम्प्ट इंजेक्शन परिदृश्यों में 0% सफलता दर हासिल की।
  • Defense-in-Depth: सुरक्षा को प्री-प्रोसेसिंग डेटा स्कैन और सक्रिय एक्शन ब्लॉकिंग को शामिल करने वाले दोहरी-स्तरीय दृष्टिकोण के माध्यम से प्राप्त किया गया है।
  • बेंचमार्क प्रभुत्व: Opus 5 Gray Swan IPI बेंचमार्क में सबसे आगे है, जो पिछले मॉडल संस्करणों की तुलना में हमलावर की सफलता दर को काफी कम कर देता है।