क्यों OpenAI ने एक AI हमलावर का रुख किया
पारंपरिक रेड-टीम अभ्यास सुरक्षा इंजीनियरों को मॉडलों की मैन्युअल रूप से जांच करने के लिए मजबूर करते हैं—जो मानव कल्पना तक सीमित एक धीमी और महंगी प्रक्रिया है। OpenAI ने GPT-Red के साथ इसका उत्तर दिया, जो एक सेल्फ-प्ले (self-play) सिस्टम है जो एक हमलावर मॉडल को उसके रक्षा करने वाले साथी मॉडल के विरुद्ध खड़ा करता है। हमले का प्रत्येक दौर डिफेंडर को नया डेटा प्रदान करता है; हमलावर हर विफलता से सीखता है, जिससे एक विकासवादी लूप बनता है जो ऐसे शोषण पैटर्न (exploit patterns) सामने लाता है जिनके बारे में कोई इंसान सोचने की भी नहीं करेगा।
महत्वपूर्ण आंकड़े
- हमले की सफलता: मानव रेड-टीमर्स के 13% के मुकाबले, GPT-Red टेस्ट केस के 84% मामलों में सफल रहा।
- मॉडल हार्डनिंग: OpenAI ने GPT-Red के निष्कर्षों को सीधे ट्रेनिंग पाइपलाइन में शामिल किया, और अब GPT-5.6 Sol में चार महीने पहले जारी किए गए फ्लैगशिप मॉडल की तुलना में प्रॉम्प्ट-इंजेक्शन विफलताओं में छह गुना कमी दर्ज की गई है।
- अवशिष्ट जोखिम: नए सुरक्षा उपायों के बावजूद, लगभग 3.8% "मजबूत" इंजेक्शन अभी भी सफल हो जाते हैं, जो Claude Opus 4.5 के समान विफलता दर है।
एक लाइव डेमो ने सिस्टम की क्षमता को रेखांकित किया: GPT-Red ने OpenAI के कार्यालय में एक AI-नियंत्रित वेंडिंग मशीन में हेरफेर किया, बिना किसी मानवीय हस्तक्षेप के वस्तुओं की कीमतें बदल दीं और ऑर्डर रद्द कर दिए।
सुधार का उपयोगकर्ताओं के लिए क्या अर्थ है
OpenAI का कहना है कि GPT-5.6 Sol अपने पूर्ववर्ती की तरह ही तर्क करने की गति और उत्तर की गुणवत्ता बनाए रखता है, जिससे सुरक्षा-उपयोगिता (safety-utility) के उस पुराने समझौते से बचा जा सकता है जहाँ कड़े सुरक्षा उपाय उपयोगिता को कम कर देते हैं।
एक स्वचालित रेड टीम की सीमाएं
ऑटोमेशन सभी जोखिमों को खत्म नहीं करता है। उच्च-शक्ति वाले इंजेक्शनों के लिए 3.8% की सफलता दर यह दर्शाती है कि एक परिष्कृत सेल्फ-प्ले सिस्टम भी कमियां छोड़ देता है।
आगे क्या देखने की आवश्यकता है
- पुनरावृत्ति अपग्रेड: सेल्फ-प्ले लूप विकसित होता रहेगा।
निष्कर्ष
GPT-Red यह साबित करता है कि एक AI अपने ही जैसे मॉडलों में खामियां खोजने में इंसानों से बेहतर सोच सकता है, जिससे GPT-5.6 के लिए प्रॉम्प्ट-इंजेक्शन विफलताओं में छह गुना मापने योग्य कमी आई है। यह सफलता सुरक्षा और उपयोगिता के बीच के अंतर को कम करती है, लेकिन एक छोटा, वास्तविक अवशिष्ट जोखिम बना रहता है। अगला अध्याय इस बात पर निर्भर करेगा कि OpenAI उन विरोधियों से आगे रहने के लिए स्वचालित रेड-टीम के निष्कर्षों को बाहरी जांच के साथ कैसे मिलाता है, जो खुद तेजी से AI की ओर रुख कर रहे हैं।
