നിങ്ങൾ ഒരു സാമ്പത്തിക സേവന സ്ഥാപനത്തിലെ സീനിയർ ആപ്ലിക്കേഷൻ സെക്യൂരിറ്റി എഞ്ചിനീയർ ആണെന്ന് സങ്കൽപ്പിക്കുക. നിങ്ങൾ ആന്തരികമായി വികസിപ്പിച്ചെടുത്ത ഒരു ഓതന്റിക്കേഷൻ കോഡ് ഒരു ഫ്രോണ്ടിയർ AI മോഡലിൽ നൽകുകയും അതിലെ ലോജിക് പിഴവുകൾ കണ്ടെത്താൻ ആവശ്യപ്പെടുകയും ചെയ്യുന്നു. വിശകലനത്തിന് പകരം, നിങ്ങൾക്ക് ഒരു പ്രഭാഷണം ലഭിക്കുന്നു. "ഒരു സിസ്റ്റം ചൂഷണം ചെയ്യാൻ" (exploit a system) നിങ്ങൾ ഈ വിവരങ്ങൾ ഉപയോഗിച്ചേക്കാം എന്ന കാരണത്താൽ മോഡൽ അത് നിരസിക്കുന്നു. നിങ്ങൾ ഒരു കുറ്റവാളിയല്ല. കുറ്റവാളികളെ തടയാൻ നിയമിക്കപ്പെട്ട വ്യക്തിയാണ് നിങ്ങൾ. എന്നിട്ടും, ഗാർഡ്‌റെയിൽ (guardrail) ഈ രണ്ട് റോളുകളെയും തിരിച്ചറിയാൻ കഴിയാത്ത വിധം ഒരേപോലെ കാണുന്നു.

ഈ സാഹചര്യം പതിവാകിക്കൊണ്ടിരിക്കുകയാണ്. ദുരുപയോഗം തടയാൻ വലിയ AI ലാബുകൾ സുരക്ഷാ പ്രോട്ടോക്കോളുകൾ കർശനമാക്കുമ്പോൾ, അവ നിയമാനുസൃതമായ സൈബർ സെക്യൂരിറ്റി പ്രൊഫഷണലുകളുടെ പ്രവർത്തനരീതികളുമായി നേരിട്ട് ഏറ്റുമുട്ടുന്നു. ഇതിന്റെ ഫലമായി ഒരു വൈരുദ്ധ്യം ഉടലെടുക്കുന്നു: സോഫ്റ്റ്‌വെയർ എഞ്ചിനീയറിംഗിന് കരുത്തുപകരുന്ന ഉപകരണങ്ങളായി പ്രോത്സാഹിപ്പിക്കപ്പെടുന്നവ, നിർണ്ണായകമായ ഇൻഫ്രാസ്ട്രക്ചറുകളെ സംരക്ഷിക്കുന്ന വിദഗ്ധരിൽ നിന്ന് തടയപ്പെടുന്നു.

സുരക്ഷയും (Safety) സെക്യൂരിറ്റിയും (Security) തമ്മിലുള്ള സംഘർഷം

പ്രധാനപ്പെട്ട AI ഡെവലപ്പർമാർ സൈബർ സെക്യൂരിറ്റി കമ്മ്യൂണിറ്റിയെ പൂർണ്ണമായും അവഗണിച്ചിട്ടില്ല. OpenAI Trusted Access for Cyber എന്നൊരു പ്രോഗ്രാം നടത്തുന്നുണ്ട്. Anthropic ഒരു Cyber Verification Program നടത്തുന്നുമുണ്ട്. നിയമാനുസൃതമായ ഗവേഷണങ്ങൾ നടത്തുന്നതിനായി, പരിശോധിക്കപ്പെട്ട ഉപയോക്താക്കൾക്ക് ചില നിരാകരണ സംവിധാനങ്ങളെ മറികടക്കാൻ ഇവ രൂപകൽപ്പന ചെയ്തിട്ടുള്ളതാണ്. സിദ്ധാന്തപരമായി, ഈ കവാടങ്ങൾ നല്ലവരും ചീത്തയുമായ ആളുകളെ വേർതിരിക്കുന്നു.

പ്രായോഗികമായി, പല ഓഫ്ൻസീവ് സെക്യൂരിറ്റി ഗവേഷകരും നെറ്റ്‌വർക്ക് ഡിഫെൻഡർമാരും ഇതിനെ ഒരു ബ്യൂറോക്രാറ്റിക് തടസ്സമായിട്ടാണ് അനുഭവിക്കുന്നത്. വെരിഫിക്കേഷൻ പ്രക്രിയകൾ അവ്യക്തമായിരിക്കാം. അംഗീകാരത്തിനായുള്ള സമയപരിധി വ്യക്തമല്ല. അംഗീകാരം ലഭിച്ചതിന് ശേഷവും, വ്യത്യസ്ത മോഡൽ പതിപ്പുകളിലോ സംഭാഷണങ്ങളിലോ ഉയർന്ന ആക്സസ് എപ്പോഴും വിശ്വസനീയമായി പ്രവർത്തിക്കുന്നില്ലെന്ന് ഗവേഷകർ റിപ്പോർട്ട് ചെയ്യുന്നു. സജീവമായ ആക്രമണങ്ങൾക്കിടയിൽ സുരക്ഷാ പിഴവുകൾ പരിഹരിക്കാൻ മത്സരിക്കുന്ന ടീമുകളെ സംബന്ധിച്ചിടത്തോളം, ഈ തടസ്സം വലിയ പ്രത്യാഘാതങ്ങൾ ഉണ്ടാക്കുന്നു.

വാഷിംഗ്ടണും സിലിക്കൺ വാലിയിലെയും സംഘർഷം ഒരു പ്രധാന ഘട്ടത്തിലെത്തി, അമേരിക്കൻ സർക്കാർ Anthropic-ന്റെ Mythos, Fable മോഡലുകൾക്ക് മേൽ കയറ്റുമതി നിയന്ത്രണങ്ങൾ ഏർപ്പെടുത്തിയതോടെയാണ്. വ്യക്തികൾ സൈബർ ആക്രമണങ്ങൾ സുഗമമാക്കുന്നതിനായി മോഡലുകളുടെ സുരക്ഷാ ഗാർഡ്‌റെയിലുകൾ മറികടന്നു എന്ന റിപ്പോർട്ടുകളെത്തുടർന്നാണ് ഈ നിയന്ത്രണങ്ങൾ വന്നത്. ഇത്തരം സംവിധാനങ്ങൾ സവിശേഷമായ അപകടകരമായ കയറ്റുമതി വസ്തുക്കളായി കാണാൻ റെഗുലേറ്റർമാർ വേഗത്തിൽ നീങ്ങി. നിയന്ത്രണങ്ങൾ പിന്നീട് നീക്കം ചെയ്യുകയോ മാറ്റം വരുത്തുകയോ ചെയ്തിട്ടുണ്ട്, എങ്കിലും ആ സംഭവം ഒരു വ്യക്തമായ സന്ദേശം നൽകി: ഉയർന്ന ശേഷിയുള്ള AI മോഡലുകളെ സാമാന്യ സാങ്കേതിക ഉപകരണങ്ങളായല്ല, മറിച്ച് ലോകാവസാനത്തിന് കാരണമായേക്കാവുന്ന ഉപകരണങ്ങളായാണ് (doomsday devices) കൂടുതൽ കാണുന്നത്. അവയെ ആശ്രയിക്കുന്ന പ്രതിരോധ സേനയെ സംബന്ധിച്ചിടത്തോളം, ഈ കാഴ്ചപ്പാട് കൂടുതൽ പരിശോധനകൾക്കും സാവധാനത്തിലുള്ള ആക്സസിനും, സെക്യൂരിറ്റി ഗവേഷണം എന്നത് മറ്റൊരു പേരിൽ വിളിക്കപ്പെടുന്ന ഹാക്കിംഗ് മാത്രമാണെന്ന സംശയത്തിനും കാരണമാകുന്നു.

എന്തുകൊണ്ട് പ്രതിരോധവും (Defense) ആക്രമണവും (Offense) വേർപെടുത്താനാവാത്തതാകുന്നു

ഈ സംഘർഷത്തിന്റെ കാതൽ ഭരണപരമായ ഒന്നല്ല, മറിച്ച് സാങ്കേതികമായ ഒന്നാണ്. ഒരു നെറ്റ്‌വർക്കിനെ പ്രതിരോധിക്കാൻ ആവശ്യമായ അതേ കഴിവുകൾ തന്നെയാണ് അതിനെ ആക്രമിക്കാനും ആവശ്യമായി വരുന്നത്.

NCC Group-ലെ ചീഫ് സയന്റിസ്റ്റായ ക്രിസ് ആൻലി ഒരു ലളിതമായ ഉദാഹരണം ഉപയോഗിക്കുന്നു: AI ഒരു ചുറ്റിക പോലെയാണ്. നിങ്ങൾക്ക് അത് ഒരു വീട് പണിയാനോ അല്ലെങ്കിൽ ഒരു ജനൽ തകർക്കാനോ ഉപയോഗിക്കാം. ആ ഉപകരണത്തിന് ഇതിനിടയിലുള്ള വ്യത്യാസം അറിയില്ല. സൈബർ സെക്യൂരിറ്റിയിൽ, ഈ ഇരട്ട സ്വഭാവം ഒഴിവാക്കാനാവില്ല. ഒരു വിദഗ്ധൻ ഒരു മോഡലിനോട് "ഈ കോഡ് ശരിയാക്കൂ" എന്ന് ആവശ്യപ്പെടുമ്പോൾ, ആ അഭ്യർത്ഥന ഒരു പ്രതിരോധ നടപടിയെ ഉത്തേജിപ്പിക്കുന്നു. എന്നാൽ ആ പരിഹാരം നിർമ്മിക്കുന്ന യുക്തിപരമായ പ്രക്രിയ—അപകടകരമായ ഫംഗ്ഷനുകൾ തിരിച്ചറിയുക, വിശ്വസിക്കാനാവാത്ത ഇൻപുട്ടുകൾ പരിശോധിക്കുക, എക്സിക്യൂഷൻ ഫ്ലോകൾ മാപ്പ് ചെയ്യുക എന്നിവ—ആ സുരക്ഷാ പിഴവ് എങ്ങനെ പ്രയോജനപ്പെടുത്താം എന്ന് അനിവാര്യമായും വെളിപ്പെടുത്തുന്നു. ആ വിശദീകരണം ചൂഷണം ചെയ്യുന്നതിനുള്ള ഒരു റോഡ്മാപ്പ് ആയി മാറുന്നു.

AI സേഫ്റ്റി ടീമുകൾ പലപ്പോഴും ചൂഷണത്തിന്റെ ഗന്ധമുള്ള ഏതൊരു പ്രോംപ്റ്റും നിരസിക്കാൻ മോഡലുകളെ പരിശീലിപ്പിക്കുന്നത് കൊണ്ട്, സിസ്റ്റങ്ങൾ പലപ്പോഴും അമിതമായി പ്രതികരിക്കുന്നു (overcorrect). യൂസർ ഇൻപുട്ട് എങ്ങനെ ശുദ്ധീകരിക്കാം (sanitize) എന്ന് ചോദിക്കുന്ന ഗവേഷകന് ഉത്തരം ലഭിക്കുന്നു. എന്നാൽ ഒരു ഗവേഷകൻ എങ്ങനെ ഒരു