OpenAI ने आज GPT-Red लाँच केले आहे, जे एक लार्ज-लँग्वेज मॉडेल असून स्वयंचलित 'रेड-टीम हॅकर' (red-team hacker) म्हणून काम करते. हे सिस्टम कंपनीच्या नवीनतम GPT-5.6 मॉडेलला आधीच अधिक सुरक्षित (hardening) करत आहे, ज्यामुळे सिम्युलेटेड हल्ल्यांचा यशस्वी दर ९०% पेक्षा जास्त वरून २३% पेक्षा कमी झाला आहे.

GPT-Red रेड-टीमचे काम कसे स्वयंचलित करते

रेड-टीम टेस्टिंग—एखादी सिस्टम मुद्दाम तोडण्याचा किंवा हायजॅक करण्याचा प्रयत्न करणे—यासाठी पारंपारिकपणे सुरक्षा तज्ज्ञांवर अवलंबून राहावे लागते. जसे LLMs वेब ब्राउझ करणे, कोड चालवणे आणि थर्ड-पार्टी सेवा वापरणे शिकत आहेत, तसे त्यांच्या गैरवापराचे मार्ग मानवी टीम शोधू शकेल त्या वेगापेक्षा अधिक वेगाने वाढत आहेत.

OpenAI ने यावर "self-play loop" द्वारे उत्तर दिले आहे, ज्यामध्ये संशोधकांनी 'dojo' असे संबोधलेल्या सिम्युलेटेड वातावरणात मॉडेलची एक प्रत दुसऱ्या प्रतीविरुद्ध लढवली जाते. या सँडबॉक्समध्ये (sandbox), GPT-Red हल्लेखोर (attacker) भूमिका बजावते, तर एक किंवा अधिक डिफेन्डर (defender) मॉडेल्स प्रतिकार करण्याचा प्रयत्न करतात. हे दोन्ही गट असंख्य फेऱ्या पूर्ण करतात; प्रत्येक पुनरावृत्तीमुळे हल्लेखोराला अधिक सूक्ष्म त्रुटी शोधण्यास आणि डिफेन्डरला नवीन संरक्षण पद्धती शिकण्यास भाग पाडले जाते. OpenAI ने ही प्रक्रिया GPT-5.6 तयार करणाऱ्या ट्रेनिंग पाइपलाइनमध्ये समाविष्ट केली आहे, ज्याला कंपनीने आतापर्यंतचे सर्वात मजबूत (robust) रिलीज म्हणून सादर केले आहे.

हल्ल्याचा एक नवीन प्रकार: 'फेक चेन ऑफ थॉट' (fake chain of thought)

'self-play' प्रक्रियेतून "fake chain of thought" नावाचा एक धक्कादायक हल्ला समोर आला आहे. LLMs अनेकदा पायरी-पायरीने तर्क करण्याची प्रक्रिया—ज्याला "chain of thought" म्हणतात—देतात, जी अंतिम उत्तरासाठी मार्गदर्शक ठरते. GPT-Red ने त्या प्रक्रियेमध्ये बनावट नोंदी समाविष्ट करण्यास शिकले आहे, ज्यामुळे मॉडेलला असे वाटते की त्याने आधीच चुकीचे आधार (false premises) तपासले आहेत. उदाहरणार्थ, हल्लेखोर मॉडेलला "1 + 1 = 3" तपासले आहे असे पटवून देऊ शकतो, ज्यामुळे सिस्टम त्या बनावट निकालावर आधारित आउटपुट तयार करण्यास प्रवृत्त होते.

हा हल्ला केवळ मजकूर (text) जनरेट करणाऱ्या मॉडेल्सपुरता मर्यादित नाही. एका बाह्य लॅबने तयार केलेल्या "Vendy" नावाच्या वेंडिंग-मशीन-शैलीतील एजंटवर केलेल्या चाचणीत, GPT-Red ने किमतीच्या फील्डमध्ये फेरफार केले आणि ऑर्डर्स रद्द केल्या, ज्यामुळे हे सिद्ध झाले की ही पद्धत वापरकर्त्याच्या कमांडवर काम करणाऱ्या विशेष एजंट्सवरही प्रभावी ठरते.

मोजता येण्याजोगे सुरक्षा सुधारणा

OpenAI ने GPT-Red विरुद्धच्या ट्रेनिंगचा प्रभाव दर्शवणारे आकडे प्रसिद्ध केले आहेत. जेव्हा नवीन मॉडेलद्वारे तयार केलेले सर्वात शक्तिशाली हल्ले ऑगस्टमध्ये रिलीज झालेल्या GPT-5 वर केले गेले, तेव्हा ९०% पेक्षा जास्त हल्ले यशस्वी झाले. मात्र, तेच हल्ले GPT-5.6 वर केल्यावर त्यांचा यशस्वी दर २३% पेक्षा कमी होता.

२०२५ मधील एका प्रयोगात, ज्यामध्ये GPT-Red ची तुलना मानवी रेड-टीमर्सशी करण्यात आली, त्यामध्ये AI ने मानवांपेक्षा अधिक कार्यक्षमतेने हल्ल्याचे प्रकार शोधले आणि त्यात सुधारणा केली. यावरून असे सूचित होते की, एक 'अ‍ॅडव्हर्सरिअल मॉडेल' (adversarial model) कमी वेळात असुरक्षिततेच्या (vulnerability) अधिक व्यापक क्षेत्राचा शोध घेऊ शकते.

मर्यादा आणि मानवी तज्ज्ञतेची निरंतर गरज

GPT-Red मानवी सुरक्षा विश्लेषकांची (security analysts) जागा घेत नाही. 'मल्टी-टर्न कन्वर्सेशनल अटॅक्स' (multi-turn conversational attacks)—जिथे हल्लेखोर अनेक संवादांच्या माध्यमातून एक कथा तयार करतो—आणि प्रतिमांमध्ये (images) घातक मजकूर लपवणाऱ्या 'व्हिज्युअल प्रॉम्प्ट इंजेक्शन' (visual prompt injections) मध्ये हे मॉडेल अजूनही अडखळते. OpenAI या मॉडेलचा वापर 'फर्स्ट-लाईन प्रोब' (first-line probe) म्हणून करण्याचा विचार करत आहे, जेणेकरून मानवी तज्ज्ञांना तपासण्यासाठी आणि अधिक विस्तारण्यासाठी संभाव्य हल्ल्यांच्या कल्पना समोर येतील.

हे टूल मालकी हक्क असलेले (proprietary) असल्याने, बाह्य संशोधक थेट त्याच्या क्षमतांची चाचणी घेऊ शकत नाहीत किंवा अहवाल दिलेल्या फायद्यांची पडताळणी करू शकत नाहीत.