ബ്രൗസർ പ്രോംപ്റ്റ് ഇൻജക്ഷനുകളിൽ Anthropic-ന്റെ Opus 5 പൂജ്യം ശതമാനം വിജയനിരക്ക് കൈവരിക്കുന്നു
ഓട്ടോണമസ് ഏജന്റുകളിലെ (autonomous agents) ഏറ്റവും വലിയ സുരക്ഷാ വീഴ്ചകളിൽ ഒന്നായ പ്രോംപ്റ്റ് ഇൻജക്ഷൻ പ്രശ്നത്തിന് പരിഹാരം കാണുന്നതിനായി, Opus 5 പുറത്തിറക്കിക്കൊണ്ട് Anthropic AI സുരക്ഷാ രംഗത്ത് ഒരു വലിയ മുന്നേറ്റം നടത്തിയിരിക്കുകയാണ്. ഒരു ഡ്യുവൽ-ലെയർ ഡിഫൻസ് സിസ്റ്റം (dual-layer defense system) നടപ്പിലാക്കുന്നതിലൂടെ, ബ്രൗസർ അധിഷ്ഠിത പ്രോംപ്റ്റ് ഇൻജക്ഷൻ ആക്രമണങ്ങളെ ഏതാണ്ട് പൂർണ്ണമായും പ്രതിരോധിക്കാൻ ഈ മോഡലിന് സാധിക്കുന്നു.
AI ഏജന്റുകളിലെ പ്രോംപ്റ്റ് ഇൻജക്ഷൻ പ്രതിസന്ധി
നിലവിലെ AI യുഗത്തിലെ ഏറ്റവും വലിയ ബലഹീനതയായി (Achilles' heel) പ്രോംപ്റ്റ് ഇൻജക്ഷൻ തുടരുന്നു. ഒരു വെബ് പേജിനുള്ളിൽ—പലപ്പോഴും കാണാൻ കഴിയാത്ത ടെക്സ്റ്റുകളിലൂടെ—അക്രമികൾ ദോഷകരമായ നിർദ്ദേശങ്ങൾ ഒളിപ്പിച്ചു വെക്കുകയും, ബ്രൗസിംഗ് നടത്തുന്ന ഒരു AI ഏജന്റ് അത് വായിക്കുകയും ചെയ്യുമ്പോഴാണ് ഈ സുരക്ഷാ വീഴ്ച സംഭവിക്കുന്നത്. ഈ നിർദ്ദേശങ്ങൾ പ്രോസസ്സ് ചെയ്യപ്പെട്ടാൽ, അവ മോഡലിനെ ഹൈജാക്ക് ചെയ്യാനും സുരക്ഷാ പ്രോട്ടോക്കോളുകൾ ലംഘിക്കാനോ അനുമതിയില്ലാത്ത പ്രവർത്തനങ്ങൾ ചെയ്യാനോ പ്രേരിപ്പിക്കും. പ്രോംപ്റ്റ് ഇൻജക്ഷൻ എന്നത് LLM-കളുടെ പരിഹരിക്കാനാകാത്ത ഒരു തകരാറാണെന്ന് OpenAI പോലുള്ള മുൻനിര കമ്പനികൾ നേരത്തെ സൂചിപ്പിച്ചിരുന്നെങ്കിലും, Anthropic-ന്റെ പുതിയ വിവരങ്ങൾ ആ നിരാശാജനകമായ കാഴ്ചപ്പാടിനെ ചോദ്യം ചെയ്യുന്നു.
പൂജ്യം ശതമാനം ബെഞ്ച്മാർക്ക് കൈവരിക്കുന്നു
Anthropic-ന്റെ സിസ്റ്റം കാർഡ് പ്രകാരം, ബ്രൗസർ ഏജന്റുകൾക്കായി പ്രത്യേകം രൂപകൽപ്പന ചെയ്ത 129 വ്യത്യസ്ത പരീക്ഷണ സാഹചര്യങ്ങളിൽ Opus 5 ആക്രമണ വിജയനിരക്ക് 0% എന്ന അത്ഭുതകരമായ നിലവാരത്തിൽ എത്തിയിരിക്കുന്നു. ഇത് മുൻപത്തെ പതിലുകളെ അപേക്ഷിച്ച് വലിയൊരു കുതിച്ചുചാട്ടമാണ്. സുരക്ഷാ സ്ഥാപനമായ Gray Swan നടത്തിയ പൊതുവായ പ്രോംപ്റ്റ് ഇൻജക്ഷൻ പരിശോധനയിൽ, Opus 5 അതിന്റെ മുൻഗാമിയേക്കാൾ വലിയ പുരോഗതി കാണിച്ചു; 15 ശ്രമങ്ങൾക്ക് ശേഷം, ആക്രമണ വിജയനിരക്ക് 5.5%-ൽ നിന്ന് (Opus 4.8-ൽ നിരീക്ഷിച്ചത്) വെറും 2.0% ആയി കുറഞ്ഞു.
ഈ പ്രകടനം Opus 5-നെ Gray Swan IPI ബെഞ്ച്മാർക്കിൽ ഒന്നാമതെത്തിച്ചു. Mythos 5 (2.6%), Fable 5 (2.8%) തുടങ്ങിയ മറ്റ് ഉയർന്ന നിലവാരമുള്ള മോഡലുകളെക്കാൾ മികച്ച പ്രകടനമാണ് ഇത് കാഴ്ചവെക്കുന്നത്.
രഹസ്യം: Auto Mode-ഉം ഡ്യുവൽ-ലെയർ ഡിഫൻസും
ഈ മുന്നേറ്റം മോഡലിന്റെ ബുദ്ധിശക്തി കൊണ്ട് മാത്രം ഉണ്ടായതല്ല, മറിച്ച് പ്രത്യേക സോഫ്റ്റ്വെയറുകളുമായുള്ള അതിന്റെ സംയോജനമാണ് ഇതിന് കാരണം. "പൂജ്യം ശതമാനം" വിജയനിരക്ക് പ്രധാനമായും Claude Cowork പോലുള്ള ഉൽപ്പന്നങ്ങളിലെ Auto Mode ഉപയോഗിക്കുന്നതുമായി ബന്ധപ്പെട്ടിരിക്കുന്നു. ഏജന്റിനെ സുരക്ഷിതമാക്കാൻ Anthropic ഒരു സങ്കീർണ്ണമായ രണ്ട് പാളികളുള്ള ഡിഫൻസ് ആർക്കിടെക്ചർ ഉപയോഗിക്കുന്നു:
- Pre-processing Scan: പ്രധാന LLM ടെക്സ്റ്റ് പ്രോസസ്സ് ചെയ്യുന്നതിന് മുമ്പ് തന്നെ, വരുന്ന എല്ലാ ഡാറ്റകളിലും ഒളിഞ്ഞിരിക്കുന്നതോ കൃത്രിമമായതോ ആയ നിർദ്ദേശങ്ങൾക്കായി ഒരു പ്രത്യേക പാളി (layer) പരിശോധിക്കുന്നു.
- Execution Blocking: ഏജന്റ് ചെയ്യാൻ ഉദ്ദേശിക്കുന്ന പ്രവർത്തനങ്ങളെ ഒരു സെക്കൻഡറി പാളി നിരീക്ഷിക്കുകയും, ബ്രൗസർ എൻവയോൺമെന്റിൽ പ്രവർത്തിക്കുന്നതിന് മുമ്പ് തന്നെ അപകടകരമായ കമാൻഡുകൾ തടയുകയും ചെയ്യുന്നു.
രസകരമായ കാര്യം, മോഡൽ മാത്രം ഉപയോഗിച്ചാൽ ഈ പ്രശ്നം പൂർണ്ണമായും പരിഹരിക്കാനാവില്ല എന്നാണ് ഡാറ്റ കാണിക്കുന്നത്. ഈ സംരക്ഷണ സോഫ്റ്റ്വെയർ പാളികൾ ഇല്ലാതെ, Opus 5-ന്റെ സുരക്ഷാ വീഴ്ച 3.7% ആണ്. വാസ്തവത്തിൽ, പ്രത്യേകമായി രൂപകൽപ്പന ചെയ്ത Sonnet 5 മോഡൽ ഒറ്റയ്ക്ക് ഉപയോഗിക്കുമ്പോൾ 0.93% വിജയനിരക്കോടെ അല്പം കൂടി മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്നു. കോർ മോഡലും ഡിഫൻസീവ് സോഫ്റ്റ്വെയർ സ്റ്റാക്കും തമ്മിലുള്ള ഏകോപനമാണ് സുരക്ഷാ നിലവാരത്തെ പൂർണ്ണതയോടടുപ്പിക്കുന്നത്.
എന്തുകൊണ്ട് ഇത് AI-യുടെ ഭാവിക്ക് പ്രധാനമാണ്
ഓട്ടോണമസ് AI ഏജന്റുകൾ നിർമ്മിക്കുന്ന ഡെവലപ്പർമാർക്കും സ്ഥാപകർക്കും ഈ വികസനം ഒരു വലിയ മാറ്റമാണ് (paradigm shift). പ്രോംപ്റ്റ് ഇൻജക്ഷൻ എന്നത് വെറും മോഡൽ ട്രെയിനിംഗിലൂടെയല്ല, മറിച്ച് ആർക്കിടെക്ചറൽ പാളികളിലൂടെ തടയാൻ കഴിയുമെങ്കിൽ, AI ഇമെയിലുകളും ബ്രൗസറുകളും സെൻസിറ്റീവ് ഡാറ്റയും കൈകാര്യം ചെയ്യുന്ന വിശ്വസനീയമായ "ഏജന്റിക്" (agentic) വർക്ക്ഫ്ലോകളിലേക്കുള്ള പാത കൂടുതൽ സുരക്ഷിതമാകും. "പരിഹരിക്കാനാകാത്തത്" എന്ന ധാരണയിൽ നിന്ന് മാറി, ശക്തവും പ്രൊഡക്ഷൻ റെഡിയുമായ AI ഓട്ടോണമിയിലേക്ക് എങ്ങനെ വ്യവസായത്തിന് മുന്നേറാം എന്നതിനായുള്ള ഒരു മാതൃകയാണ് Anthropic നൽകിയിരിക്കുന്നത്.
പ്രധാന കാര്യങ്ങൾ
- വ്യവസായത്തിലെ മുൻനിര സുരക്ഷ: Auto Mode ഉപയോഗിക്കുമ്പോൾ 129 ബ്രൗസർ അധിഷ്ഠിത പ്രോംപ്റ്റ് ഇൻജക്ഷൻ സാഹചര്യങ്ങളിൽ Opus 5 പൂജ്യം ശതമാനം വിജയനിരക്ക് കൈവരിച്ചു.
- Defense-in-Depth: പ്രീ-പ്രോസസ്സിംഗ് ഡാറ്റ സ്കാനിംഗും മുൻകൂട്ടി കണ്ട് പ്രവർത്തനങ്ങൾ തടയുന്ന രീതിയും ഉൾപ്പെടുന്ന ഒരു ഡ്യുവൽ-ലെയർ സമീപനത്തിലൂടെയാണ് ഈ സുരക്ഷ കൈവരിക്കുന്നത്.
- ബെഞ്ച്മാർക്കിലെ ആധിപത്യം: മുൻപത്തെ മോഡലുകളെ അപേക്ഷിച്ച് ആക്രമണ വിജയനിരക്ക് ഗണ്യമായി കുറച്ചുകൊണ്ട് Opus 5 Gray Swan IPI ബെഞ്ച്മാർക്കിൽ മുന്നിലെത്തുന്നു.
