OpenAI ने आज GPT-Red लॉन्च किया है, जो एक लार्ज-लैंग्वेज मॉडल है और एक ऑटोमेटेड रेड-टीम हैकर के रूप में कार्य करता है। यह सिस्टम कंपनी के नवीनतम GPT-5.6 मॉडल को पहले से ही और अधिक सुरक्षित (hardening) बना रहा है, जिससे सिम्युलेटेड हमलों की सफलता दर 90% से अधिक से घटकर 23% से भी कम हो गई है।

GPT-Red रेड-टीम के काम को कैसे ऑटोमेट करता है

रेड-टीम टेस्टिंग—किसी सिस्टम को जानबूझकर तोड़ने या हाईजैक करने की कोशिश करना—पारंपरिक रूप से सुरक्षा विशेषज्ञों पर निर्भर रही है। जैसे-जैसे LLMs वेब ब्राउज़ करना, कोड चलाना और थर्ड-पार्टी सेवाओं का उपयोग करना सीखते हैं, उनके दुरुपयोग के तरीके एक मानव टीम द्वारा खोजे जाने की तुलना में कहीं अधिक तेज़ी से बढ़ते हैं।

OpenAI ने एक "सेल्फ-प्ले लूप" (self-play loop) के साथ इसका उत्तर दिया है, जो एक सिम्युलेटेड वातावरण के भीतर एक मॉडल की एक प्रति को दूसरी प्रति के विरुद्ध खड़ा करता है, जिसे शोधकर्ता "दोजो" (dojo) कहते हैं। इस सैंडबॉक्स में, GPT-Red हमलावर की भूमिका निभाता है जबकि एक या अधिक डिफेंडर मॉडल विरोध करने की कोशिश करते हैं। दोनों पक्ष अनगिनत राउंड चलाते हैं; प्रत्येक इटरेशन हमलावर को सूक्ष्म खामियों को खोजने और डिफेंडर को नई सुरक्षा प्रणालियाँ सीखने के लिए मजबूर करता है। OpenAI ने इस प्रक्रिया को उस ट्रेनिंग पाइपलाइन में शामिल किया है जिसने GPT-5.6 को तैयार किया है, जिसे कंपनी अब तक के अपने सबसे मजबूत (robust) रिलीज़ के रूप में प्रचारित कर रही है।

हमले का एक नया प्रकार: फेक चेन ऑफ थॉट (fake chain of thought)

सेल्फ-प्ले रन के दौरान एक चौंकाने वाले "फेक चेन ऑफ थॉट" (fake chain of thought) हमले का खुलासा हुआ। LLMs अक्सर एक स्टेप-बाय-स्टेप रीजनिंग ट्रेस—एक "चेन ऑफ थॉट"—उत्पन्न करते हैं जो अंतिम उत्तर का मार्गदर्शन करता है। GPT-Red ने उस ट्रेस में गलत प्रविष्टियाँ (spurious entries) डालना सीख लिया है, जिससे मॉडल को लगता है कि उसने पहले ही गलत आधारों (false premises) को सत्यापित कर लिया है। उदाहरण के लिए, हमलावर मॉडल को यह विश्वास दिला सकता है कि "1 + 1 = 3" की जाँच की जा चुकी है, जिससे सिस्टम उस मनगढ़ंत परिणाम के आधार पर आउटपुट देने के लिए प्रेरित होता है।

यह हमला केवल शुद्ध टेक्स्ट जनरेटर तक ही सीमित नहीं है। एक बाहरी लैब द्वारा बनाए गए वेंडिंग-मशीन-शैली के एजेंट "Vendy" के खिलाफ एक परीक्षण में, GPT-Red ने प्राइस फील्ड्स में हेरफेर किया और ऑर्डर रद्द कर दिए, जिससे यह साबित हो गया कि यह तकनीक उन विशेष एजेंटों के खिलाफ भी काम करती है जो यूजर कमांड पर काम करते हैं।

मापने योग्य सुरक्षा सुधार

OpenAI ने ऐसे आंकड़े जारी किए हैं जो GPT-Red के खिलाफ ट्रेनिंग के प्रभाव को दर्शाते हैं। जब नए मॉडल द्वारा उत्पन्न सबसे शक्तिशाली हमलों को अगस्त में रिलीज़ हुए GPT-5 के खिलाफ चलाया गया, तो 90% से अधिक हमले सफल रहे। वहीं GPT-5.6 के खिलाफ वही हमले 23% से भी कम बार सफल हुए।

2025 के एक प्रयोग में, जिसमें GPT-Red का मुकाबला मानव रेड-टीमर्स से कराया गया, AI ने मनुष्यों की तुलना में अधिक कुशलता से हमले के विविध रूपों (attack variations) की खोज की और उन्हें परिष्कृत किया, जो यह सुझाव देता है कि एक एडवर्सरियल मॉडल कम समय में भेद्यता क्षेत्र (vulnerability space) के एक व्यापक हिस्से की खोज कर सकता है।

सीमाएं और मानवीय विशेषज्ञता की निरंतर आवश्यकता

GPT-Red मानव सुरक्षा विश्लेषकों की जगह नहीं लेता है। यह अभी भी मल्टी-टर्न कन्वर्सेशनल हमलों (multi-turn conversational attacks), जहाँ हमलावर कई संवादों के माध्यम से एक कहानी बुनता है, और विजुअल प्रॉम्प्ट इंजेक्शन (visual prompt injections) पर लड़खड़ा जाता है जो छवियों के भीतर दुर्भावनापूर्ण टेक्स्ट को छिपा देते हैं। OpenAI इस मॉडल का उपयोग पहली पंक्ति के जांच उपकरण (first-line probe) के रूप में करने की योजना बना रहा है, जो मानव विशेषज्ञों के जांच करने और विस्तार करने के लिए आशाजनक हमले के विचार सामने लाएगा।

यह टूल प्रोप्रायटरी (proprietary) बना हुआ है, इसलिए बाहरी शोधकर्ता सीधे इसकी क्षमताओं का परीक्षण नहीं कर सकते या रिपोर्ट किए गए लाभों को सत्यापित नहीं कर सकते।