OpenAI ഇന്ന് GPT-Red പുറത്തിറക്കി; ഇത് ഒരു ഓട്ടോമേറ്റഡ് റെഡ്-ടീം ഹാക്കറായി പ്രവർത്തിക്കുന്ന ഒരു ലാർജ്-ലാംഗ്വേജ് മോഡലാണ്. കമ്പനിയുടെ ഏറ്റവും പുതിയ GPT-5.6 മോഡലിനെ ഈ സിസ്റ്റം ഇപ്പോൾ തന്നെ കൂടുതൽ സുരക്ഷിതമാക്കിക്കൊണ്ടിരിക്കുകയാണ്, ഇത് സിമുലേറ്റഡ് ആക്രമണങ്ങളുടെ വിജയശതമാനം 90%-ൽ നിന്ന് 23%-ൽ താഴെയായി കുറച്ചു.

GPT-Red എങ്ങനെ റെഡ്-ടീം ജോലികൾ ഓട്ടോമേറ്റ് ചെയ്യുന്നു

റെഡ്-ടീം ടെസ്റ്റിംഗ്—ഒരു സിസ്റ്റം മനഃപൂർവ്വം തകർക്കാനോ ഹൈജാക്ക് ചെയ്യാനോ ശ്രമിക്കുന്ന രീതി—പരമ്പരാഗതമായി സുരക്ഷാ വിദഗ്ധരെയാണ് ആശ്രയിച്ചിരുന്നത്. LLM-കൾക്ക് വെബ് ബ്രൗസ് ചെയ്യാനും കോഡ് പ്രവർത്തിപ്പിക്കാനും തേർഡ് പാർട്ടി സേവനങ്ങൾ ഉപയോഗിക്കാനും കഴിയുന്നതോടെ, അവ ദുരുപയോഗം ചെയ്യാൻ കഴിയുന്ന രീതികൾ ഒരു മനുഷ്യ സംഘത്തിന് പരിശോധിച്ചു തീർക്കാവുന്നതിനേക്കാൾ വേഗത്തിൽ വർദ്ധിച്ചുകൊണ്ടിരിക്കുന്നു.

ഗവേഷകർ 'dojo' എന്ന് വിളിക്കുന്ന ഒരു സിമുലേറ്റഡ് എൻവയോൺമെന്റിനുള്ളിൽ ഒരു മോഡലിന്റെ മറ്റൊരു കോപ്പിയുമായി ഏറ്റുമുട്ടുന്ന ഒരു “self-play loop” വഴിയാണ് OpenAI ഇതിന് പരിഹാരം കണ്ടെത്തിയത്. ഈ sandbox-ൽ, GPT-Red ആക്രമണകാരിയുടെ പങ്ക് വഹിക്കുമ്പോൾ ഒന്നോ അതിലധികമോ ഡിഫെൻഡർ മോഡലുകൾ അതിനെ പ്രതിരോധിക്കാൻ ശ്രമിക്കുന്നു. ഈ രണ്ട് വശങ്ങളും എണ്ണമറ്റ റൗണ്ടുകൾ നടത്തുന്നു; ഓരോ തവണയും ആക്രമണകാരി കൂടുതൽ സൂക്ഷ്മമായ പിഴവുകൾ കണ്ടെത്താനും ഡിഫെൻഡർ പുതിയ പ്രതിരോധ മാർഗങ്ങൾ പഠിക്കാനും ഇത് പ്രേരിപ്പിക്കുന്നു. കമ്പനി തങ്ങളുടെ ഏറ്റവും കരുത്തുറ്റ റിലീസ് എന്ന് വിശേഷിപ്പിക്കുന്ന GPT-5.6 നിർമ്മിച്ച ട്രെയിനിംഗ് പൈപ്പ്‌ലൈനിൽ OpenAI ഈ പ്രക്രിയ ഉൾപ്പെടുത്തിയിട്ടുണ്ട്.

പുതിയ തരം ആക്രമണം: ഫേക്ക് ചെയിൻ ഓഫ് തോട്ട് (fake chain of thought)

സെൽഫ്-പ്ലേ റണ്ണുകൾ ശ്രദ്ധേയമായ ഒരു “fake chain of thought” ആക്രമണം കണ്ടെത്തി. LLM-കൾ പലപ്പോഴും അന്തിമ ഉത്തരത്തിലേക്ക് നയിക്കുന്ന ഘട്ടം ഘട്ടമായുള്ള യുക്തിപരമായ വിവരങ്ങൾ—അതായത് ഒരു “chain of thought”—നൽകുന്നുണ്ട്. ആ വിവരങ്ങളിൽ വ്യാജമായവ ഉൾപ്പെടുത്താൻ GPT-Red പഠിച്ചു, ഇത് തെറ്റായ കാര്യങ്ങൾ നേരത്തെ തന്നെ പരിശോധിച്ചു എന്ന് മോഡലിനെ വിശ്വസിപ്പിക്കുന്നു. ഉദാഹരണത്തിന്, “1 + 1 = 3” എന്നത് പരിശോധിച്ചു എന്ന് ആക്രമണകാരിക്ക് മോഡലിനെ ബോധ്യപ്പെടുത്താൻ കഴിയും, ഇത് നിർമ്മിത ഫലത്തിന്റെ അടിസ്ഥാനത്തിൽ ഔട്ട്‌പുട്ടുകൾ നൽകാൻ സിസ്റ്റത്തെ പ്രേരിപ്പിക്കുന്നു.

ഈ ആക്രമണം വെറും ടെക്സ്റ്റ് ജനറേറ്ററുകളിൽ മാത്രം പരിമിതമല്ല. ഒരു എക്സ്റ്റേണൽ ലാബ് നിർമ്മിച്ച “Vendy” എന്ന വെൻഡിംഗ് മെഷീൻ ശൈലിയിലുള്ള ഏജന്റിനെതിരെയുള്ള പരീക്ഷണത്തിൽ, GPT-Red വിലകൾ മാറ്റുകയും ഓർഡറുകൾ റദ്ദാക്കുകയും ചെയ്തു. ഉപയോക്താവിന്റെ നിർദ്ദേശങ്ങൾക്കനുസരിച്ച് പ്രവർത്തിക്കുന്ന പ്രത്യേക ഏജന്റുകൾക്കെതിരെയും ഈ സാങ്കേതികവിദ്യ ഫലപ്രദമാണെന്ന് ഇത് തെളിയിക്കുന്നു.

അളക്കാവുന്ന സുരക്ഷാ വർദ്ധനവ്

GPT-Red ഉപയോഗിച്ചുള്ള പരിശീലനത്തിന്റെ ഫലം കാണിക്കുന്ന കണക്കുകൾ OpenAI പുറത്തുവിട്ടു. പുതിയ മോഡൽ സൃഷ്ടിച്ച ഏറ്റവും ശക്തമായ ആക്രമണങ്ങൾ ഓഗസ്റ്റ് മാസത്തിൽ പുറത്തിറങ്ങിയ GPT-5-ന് നേരെ നടത്തിയപ്പോൾ 90 ശതമാനത്തിലധികം വിജയകരമായിരുന്നു. എന്നാൽ ഇതേ ആക്രമണങ്ങൾ GPT-5.6-ന് നേരെ നടത്തിയപ്പോൾ വിജയശതമാനം 23 ശതമാനത്തിൽ താഴെയായി കുറഞ്ഞു.

2025-ൽ GPT-Red-നെ മനുഷ്യരായ റെഡ്-ടീമർമാരുമായി ഏറ്റുമുട്ടിച്ച പരീക്ഷണത്തിൽ, മനുഷ്യരേക്കാൾ കാര്യക്ഷമമായി ആക്രമണ രീതികൾ കണ്ടെത്താനും പരിഷ്കരിക്കാനും AI-ക്ക് കഴിഞ്ഞു. ഒരു അഡ്വേഴ്സേറിയൽ മോഡലിന് കുറഞ്ഞ സമയത്തിനുള്ളിൽ കൂടുതൽ സുരക്ഷാ വീഴ്ചകൾ കണ്ടെത്താൻ കഴിയുമെന്ന് ഇത് സൂചിപ്പിക്കുന്നു.

പരിമിതികളും മനുഷ്യവിദഗ്ദ്ധതയുടെ തുടർച്ചയായ ആവശ്യകതയും

GPT-Red മനുഷ്യരായ സുരക്ഷാ വിശകലനകരെ (security analysts) മാറ്റിസ്ഥാപിക്കുന്നില്ല. പല സംഭാഷണങ്ങളിലൂടെ ഒരു കഥാസന്ദർഭം കെട്ടിപ്പടുക്കുന്ന മൾട്ടി-ടേൺ കൺവർസേഷണൽ ആക്രമണങ്ങളിലും, ചിത്രങ്ങൾക്കുള്ളിൽ ദോഷകരമായ ടെക്സ്റ്റ് ഒളിപ്പിച്ചു വെക്കുന്ന വിഷ്വൽ പ്രോംപ്റ്റ് ഇൻജക്ഷനുകളിലും ഇത് ഇപ്പോഴും പരാജയപ്പെടുന്നുണ്ട്. മനുഷ്യവിദഗ്ദ്ധർക്ക് അന്വേഷിക്കാനും വികസിപ്പിക്കാനും കഴിയുന്ന തരത്തിൽ പ്രോമിസിംഗ് ആയ ആക്രമണ ആശയങ്ങൾ കണ്ടെത്താനുള്ള ഒരു പ്രാഥമിക സംവിധാനമായി (first-line probe) ഈ മോഡലിനെ ഉപയോഗിക്കാൻ OpenAI പദ്ധതിയിടുന്നു.

ഈ ടൂൾ ഉടമസ്ഥാവകാശമുള്ളതാണ് (proprietary), അതിനാൽ പുറത്തുള്ള ഗവേഷകർക്ക് ഇതിന്റെ കഴിവുകൾ നേരിട്ട് പരിശോധിക്കാനോ റിപ്പോർട്ട് ചെയ്ത നേട്ടങ്ങൾ സാക്ഷ്യപ്പെടുത്താനോ കഴിയില്ല.