OpenAI இன்று GPT-Red ஐ அறிமுகப்படுத்தியுள்ளது; இது ஒரு தானியங்கி ரெட்-டீம் (red-team) ஹேக்கராகச் செயல்படும் ஒரு பெரிய மொழி மாதிரி (large-language model) ஆகும். இந்த அமைப்பு ஏற்கனவே நிறுவனத்தின் சமீபத்திய GPT-5.6 மாதிரியைப் பாதுகாப்பானதாக மாற்றி வருகிறது, இதன் மூலம் உருவகப்படுத்தப்பட்டத் தாக்குதல்களின் (simulated attacks) வெற்றி விகிதத்தை 90%-க்கும் மேலிருந்து 23%-க்கும் குறைவாகக் குறைத்துள்ளது.
GPT-Red எவ்வாறு ரெட்-டீம் பணிகளைத் தானியக்கமாக்குகிறது
ரெட்-டீம் சோதனை என்பது—ஒரு அமைப்பைத் திட்டமிட்டு உடைக்க அல்லது கடத்த முயற்சிப்பதாகும்—பாரம்பரியமாகப் பாதுகாப்பு நிபுணர்களைச் சார்ந்தே இருந்துள்ளது. LLM-கள் இணையத்தைப் பார்வையிடவும், குறியீடுகளை (code) இயக்கவும் மற்றும் மூன்றாம் தரப்பு சேவைகளைப் பயன்படுத்தவும் கற்றுக்கொள்ளும்போது, அவற்றைத் தவறாகப் பயன்படுத்தக்கூடிய வழிகள் ஒரு மனிதக் குழுவால் ஆராயப்படுபதை விட மிக வேகமாகப் பெருகுகின்றன.
ஆராய்ச்சியாளர்கள் 'டோஜோ' (dojo) என்று அழைக்கும் ஒரு உருவகப்படுத்தப்பட்ட சூழலுக்குள், ஒரு மாதிரியின் நகலை மற்றொரு நகலுக்கு எதிராகப் போட்டியிடச் செய்யும் "சுய-விளையாட்டுச் சுழற்சி" (self-play loop) மூலம் OpenAI இதற்குப் பதிலளித்துள்ளது. இந்த சாண்ட்பாக்ஸில் (sandbox), GPT-Red தாக்குபவர் பாத்திரத்தை ஏற்கிறது, அதே நேரத்தில் ஒன்று அல்லது அதற்கு மேற்பட்ட பாதுகாப்பு மாதிரிகள் (defender models) அதைத் தடுக்க முயல்கின்றன. இந்த இரு தரப்பினரும் எண்ணற்ற சுற்றுகளை நடத்துகின்றன; ஒவ்வொரு சுற்றும் தாக்குபவரை நுணுக்கமான குறைபாடுகளைக் கண்டறியவும், பாதுகாப்பாளர் புதிய பாதுகாப்பு முறைகளைக் கற்றுக்கொள்ளவும் தூண்டுகிறது. OpenAI இந்தச் செயல்முறையை GPT-5.6-ஐ உருவாக்கிய பயிற்சித் தொடருடன் (training pipeline) இணைத்துள்ளது; இது நிறுவனத்தின் மிகவும் வலுவான வெளியீடாகக் கருதப்படுகிறது.
ஒரு புதிய வகைத் தாக்குதல்: போலிச் சிந்தனைச் சங்கிலி (fake chain of thought)
இந்தச் சுய-விளையாட்டுச் சுழற்சிகள் ஒரு வியக்கத்தக்க "போலிச் சிந்தனைச் சங்கிலி" (fake chain of thought) தாக்குதலைக் கண்டறிந்துள்ளன. LLM-கள் பெரும்பாலும் இறுதிப் பதிலுக்கு வழிகாட்டும் படிபடியான காரணத் தடத்தை—அதாவது ஒரு "சிந்தனைச் சங்கிலி" (chain of thought)—வெளியிடுகின்றன. அந்தத் தடத்திற்குள் தவறான தகவல்களைச் செருகுவதன் மூலம், தவறான முன்க்கருத்துகளைத் தான் ஏற்கனவே சரிபார்த்துவிட்டதாக மாதிரி (model) நம்ப வைக்கும் முறையை GPT-Red கற்றுக்கொண்டது. உதாரணமாக, "1 + 1 = 3" என்பது சரிபார்க்கப்பட்டுவிட்டது என்று மாதிரியைத் திசைதிருப்ப முடியும், இதன் மூலம் அந்தத் தவறான முடிவின் அடிப்படையில் வெளியீடுகளை உருவாக்கத் தூண்டுகிறது.
இந்தத் தாக்குதல் வெறும் உரைத் தயாரிப்பாளர்களுடன் (text generators) மட்டும் நின்றுவிடவில்லை. ஒரு வெளி ஆய்வகத்தால் உருவாக்கப்பட்ட "Vendy" என்ற விற்பனை இயந்திரம் போன்ற ஏஜென்ட் (agent) மீது நடத்தப்பட்ட சோதனையில், GPT-Red விலைப் புலங்களை (price fields) மாற்றியமைத்தது மற்றும் ஆர்டர்களை ரத்து செய்தது; இதன் மூலம் பயனர் கட்டளைகளின்படி செயல்படும் சிறப்பு ஏஜென்ட்களுக்கு எதிராக இந்தத் தொழில்நுட்பம் வேலை செய்கிறது என்பது நிரூபிக்கப்பட்டது.
அளவிடக்கூடிய பாதுகாப்பு மேம்பாடு
GPT-Red-க்கு எதிராகப் பயிற்சி அளிப்பதன் தாக்கத்தைக் காட்டும் புள்ளிவிவரங்களை OpenAI வெளியிட்டுள்ளது. புதிய மாதிரியால் உருவாக்கப்பட்ட மிக வலிமையானத் தாக்குதல்கள் ஆகஸ்ட் மாதம் வெளியிடப்பட்ட GPT-5 மீது நடத்தப்பட்டபோது, 90%-க்கும் அதிகமானவை வெற்றி பெற்றன. அதே தாக்குதல்கள் GPT-5.6 மீது நடத்தப்பட்டபோது 23%-க்கும் குறைவான முறையே வெற்றி பெற்றன.
2025-ல் நடத்தப்பட்ட ஒரு சோதனையில், GPT-Red-ஐ மனித ரெட்-டீம் நிபுணர்களுடன் ஒப்பிட்டபோது, மனிதர்களை விட AI மிகவும் திறமையாகத் தாக்குதல் முறைகளைக் கண்டறிந்து மேம்படுத்தியது. இது ஒரு எதிரி மாதிரியால் (adversarial model) குறைவான நேரத்தில் பாதிப்பு ஏற்படக்கூடிய பரந்த பகுதிகளை ஆராய முடியும் என்பதைக் காட்டுகிறது.
வரம்புகள் மற்றும் மனித நிபுணத்துவத்தின் தொடர்ச்சியான தேவை
GPT-Red மனிதப் பாதுகாப்பு ஆய்வாளர்களுக்கு மாற்றாகாது. பல உரையாடல்கள் மூலம் ஒரு கதையை உருவாக்கித் தாக்கும் முறைகளிலும் (multi-turn conversational attacks), படங்களுக்குள் தீய உரையை மறைத்துத் தாக்கும் காட்சித் தூண்டுதல் ஊடுருவல்களிலும் (visual prompt injections) இது இன்னும் தடுமாறுகிறது. OpenAI இந்த மாதிரியை ஒரு முதற்கட்டத் தேடலாகப் (first-line probe) பயன்படுத்தத் திட்டமிட்டுள்ளது; இதன் மூலம் கிடைக்கும் முக்கியமான தாக்குதல் யோசனைகளை மனித நிபுணர்கள் ஆராய்ந்து விரிவுபடுத்த முடியும்.
இந்தக் கருவி ஒரு தனியுரிமைச் சொத்தாகவே (proprietary) உள்ளது, எனவே வெளி ஆராய்ச்சியாளர்களால் அதன் திறன்களை நேரடியாகச் சோதிக்கவோ அல்லது அறிக்கையிடப்பட்ட முன்னேற்றங்களைச் சரிபார்க்கவோ முடியாது.
