ஏன் OpenAI ஒரு AI தாக்குபவரை நாடியது

பாரம்பரிய ரெட்-டீம் (red-team) பயிற்சிகள், பாதுகாப்பு பொறியாளர்களை மாதிரிகளை (models) கைமுறையாக ஆய்வு செய்யத் தூண்டுகின்றன—இது மனித கற்பனைத் திறனால் மட்டுப்படுத்தப்பட்ட ஒரு மெதுவான மற்றும் செலவு மிகுந்த செயல்முறையாகும். OpenAI இதற்கு GPT-Red மூலம் பதிலளித்துள்ளது; இது ஒரு தாக்குதல் மாதிரியை (attacking model) ஒரு பாதுகாப்பு மாதிரியுடன் (defending sibling) மோதச் செய்யும் ஒரு 'செல்ஃப்-ப்ளே' (self-play) அமைப்பாகும். ஒவ்வொரு தாக்குதல் சுற்றும் பாதுகாப்பு மாதிரிக்கு புதிய தரவுகளை வழங்குகிறது; தாக்குபவர் ஒவ்வொரு தோல்வியிலிருந்தும் கற்றுக்கொள்கிறார், இது மனிதர்களால் யோசிக்க முடியாத ஊடுருவல் முறைகளை (exploit patterns) வெளிப்படுத்தும் ஒரு பரிணாமச் சுழற்சியை உருவாக்குகிறது.

முக்கியமான புள்ளிவிவரங்கள்

  • தாக்குதல் வெற்றி: மனித ரெட்-டீம் குழுவினரின் 13% வெற்றி விகிதத்துடன் ஒப்பிடுகையில், GPT-Red சோதனை நிகழ்வுகளில் 84% வெற்றி பெற்றது.
  • மாதிரி வலுப்படுத்துதல் (Model hardening): OpenAI, GPT-Red-ன் நுண்ணறிவுகளை நேரடியாகப் பயிற்சித் தொடரில் (training pipeline) சேர்த்தது; இதன் விளைவாக, நான்கு மாதங்களுக்கு முன்பு வெளியிடப்பட்ட முதன்மை மாதிரியை விட, GPT-5.6 Sol இப்போது ஆறு மடங்கு குறைவான 'ப்ராம்ப்ட்-இன்ஜெக்ஷன்' (prompt-injection) தோல்விகளைக் கொண்டுள்ளது.
  • எஞ்சியிருக்கும் ஆபத்து (Residual risk): புதிய பாதுகாப்பு முறைகள் இருந்தபோதிலும், சுமார் 3.8% "வலிமையான" ஊடுருவல்கள் இன்னும் ஊடுருவுகின்றன; இந்தத் தோல்வி விகிதம் Claude Opus 4.5-க்கு இணையானது.

ஒரு நேரடி செயல்விளக்கம் இந்த அமைப்பின் ஆற்றலை உறுதிப்படுத்தியது: OpenAI அலுவலகத்தில் உள்ள AI-கட்டுப்பாட்டு விற்பனை இயந்திரத்தை (vending machine) GPT-Red கையாண்டது; எந்தவொரு மனிதத் தலையீடும் இன்றி பொருட்களின் விலையை மாற்றியது மற்றும் ஆர்டர்களை ரத்து செய்தது.

இந்த முன்னேற்றம் பயனர்களுக்கு எதைக் குறிக்கிறது

GPT-5.6 Sol தனது முந்தைய மாதிரியைப் போலவே அதே பகுத்தறிவு வேகம் மற்றும் பதிலின் தரத்தைப் பராமரிக்கிறது என்று OpenAI கூறுகிறது; இதன் மூலம், கடுமையான பாதுகாப்பு நடவடிக்கைகள் பயனுள்ள தன்மையைக் குறைக்கும் என்ற நீண்டகால 'பாதுகாப்பு-பயன்பாடு' (safety-utility) சமரசப் சிக்கலை இது தவிர்த்துள்ளது.

தானியங்கி ரெட்-டீமின் வரம்புகள்

தானியங்கி முறை அனைத்து ஆபத்துகளையும் நீக்கிவிடாது. அதிக வலிமை கொண்ட ஊடுருவல்களில் 3.8% வெற்றி விகிதம் என்பது, ஒரு அதிநவீன 'செல்ஃப்-ப்ளே' அமைப்பு கூட இடைவெளிகளை விட்டுவிடுகிறது என்பதைக் காட்டுகிறது.

அடுத்து கவனிக்க வேண்டியவை

  • தொடர்ச்சியான மேம்பாடுகள் (Iterative upgrades): இந்த 'செல்ஃப்-ப்ளே' சுழற்சி தொடர்ந்து பரிணமித்துக் கொண்டே இருக்கும்.

சுருக்கம்

தனது சொந்த வகையைச் சேர்ந்த மாதிரிகளில் உள்ள குறைகளைக் கண்டறிவதில் மனிதர்களை விட ஒரு AI சிறப்பாகச் செயல்பட முடியும் என்பதை GPT-Red நிரூபிக்கிறது; இது GPT-5.6-ல் 'ப்ராம்ப்ட்-இன்ஜெக்ஷன்' தோல்விகளை ஆறு மடங்கு குறைத்துள்ளது. இந்த முன்னேற்றம் பாதுகாப்பு மற்றும் பயன்பாட்டிற்கு இடையிலான இடைவெளியைக் குறைக்கிறது, ஆனால் ஒரு சிறிய, உண்மையான எஞ்சிய ஆபத்து இன்னும் உள்ளது. AI-யையே அதிகம் பயன்படுத்தத் தொடங்கும் எதிரிகளை விட முன்னிலையில் இருக்க, தானியங்கி ரெட்-டீம் நுண்ணறிவுகளை வெளிப்புற ஆய்வுகளுடன் OpenAI எவ்வாறு ஒருங்கிணைக்கிறது என்பதிலேயே அடுத்த கட்டம் அமையும்.