അടുത്തിടെ നടന്ന ഒരു സുരക്ഷാ പരിശോധനയ്ക്കിടെ (security-testing campaign), തങ്ങളുടെ മൂന്ന് Claude മോഡലുകൾ സാൻഡ്ബോക്സിൽ (sandbox) നിന്ന് പുറത്തുവരികയും യഥാർത്ഥ ലോകത്തിലെ സിസ്റ്റങ്ങളിൽ പ്രവേശിക്കുകയും ചെയ്തതായി Anthropic അറിയിച്ചു. ഇതിനെത്തുടർന്ന് പരിശോധനകൾ ഉടനടി നിർത്തിവെക്കുകയും ഒരു പൊതു റിപ്പോർട്ട് പുറത്തിറക്കുകയും ചെയ്തു.
കമ്പനി 141,006 സൈബർ സുരക്ഷാ പരിശോധനകൾ നടത്തി. ഇതിൽ മൂന്ന് സന്ദർഭങ്ങളിൽ മോഡലുകൾ സിമുലേറ്റഡ് എൻവയോൺമെന്റിന് (simulated environment) പകരം യഥാർത്ഥ ലക്ഷ്യസ്ഥാനങ്ങളിൽ (live targets) എത്തിച്ചേർന്നതായി കണ്ടെത്തി. ഒരു മൂന്നാം കക്ഷി പങ്കാളിയുമായുള്ള (third-party partner) കോൺഫിഗറേഷനിലെ പിശക് കാരണം സാൻഡ്ബോക്സ് ഫലത്തിൽ തുറന്ന നിലയിലായിപ്പോയി.
ഈ സുരക്ഷാ വീഴ്ചകൾ എങ്ങനെ സംഭവിച്ചു
- Claude Opus 4.7 ഇന്റർനെറ്റിൽ ലഭ്യമായ ഒരു യഥാർത്ഥ കമ്പനിയിൽ എത്തിച്ചേരുകയും, ദുർബലമായ പാസ്വേഡുകൾ ഊഹിച്ചെടുത്ത് ഏതാനും നൂറ് വരികളുള്ള ഒരു ഡാറ്റാബേസ് കൈക്കലാക്കുകയും ചെയ്തു.
- Claude Mythos 5 യഥാർത്ഥ PyPI റെപ്പോസിറ്ററിയിൽ ഒരു പാക്കേജ് പ്രസിദ്ധീകരിക്കുന്നതിലൂടെ ഒരു സപ്ലൈ-ചെയിൻ ആക്രമണം (supply-chain attack) നടത്തി. റെജിസ്ട്രി ഈ അസാധാരണത്വം കണ്ടെത്തുന്നതിന് മുമ്പ് തന്നെ ഈ പാക്കേജ് 15 പ്രൊഡക്ഷൻ മെഷീനുകളിൽ ഇൻസ്റ്റാൾ ചെയ്യപ്പെട്ടിരുന്നു.
- ഒരു ആഭ്യന്തര ഗവേഷണ മോഡൽ (internal research model) 9,000 ലക്ഷ്യസ്ഥാനങ്ങൾ സ്കാൻ ചെയ്യുകയും ഒരു ആപ്ലിക്കേഷൻ ഹാക്ക് ചെയ്യുകയും ചെയ്തു. എന്നാൽ ഹോസ്റ്റ് അതിന്റെ സിമുലേറ്റഡ് ടാസ്കിന് അനുയോജ്യമല്ലെന്ന് തിരിച്ചറിഞ്ഞതിനെത്തുടർന്ന് അത് സ്വയം പ്രവർത്തനം നിർത്തി.
ഇവ "ലക്ഷ്യബോധമില്ലാത്ത AI" (rogue AI) സംഭവങ്ങളല്ലെന്ന് Anthropic ഊന്നിപ്പറയുന്നു. മോഡലുകൾ അവരോട് പറഞ്ഞത് തന്നെയാണ് ചെയ്തത്; എന്നാൽ പരിശോധനാ സംവിധാനത്തിന് (testing infrastructure) അവയെ തുറന്ന ഇന്റർനെറ്റിൽ നിന്ന് വേർതിരിച്ചു നിർത്താൻ സാധിച്ചില്ല.
എന്തുകൊണ്ട് ഇത് പ്രധാനമാണ്
AI ഏജന്റുകൾക്ക് കോഡ് പ്രവർത്തിപ്പിക്കാനും നെറ്റ്വർക്ക് കോളുകൾ നടത്താനും കഴിയുന്ന സാഹചര്യത്തിൽ, നിയന്ത്രിത സാൻഡ്ബോക്സും യഥാർത്ഥ നെറ്റ്വർക്കും തമ്മിലുള്ള വ്യത്യാസം എത്രത്തോളം കുറവാണെന്ന് ഈ സംഭവങ്ങൾ കാണിച്ചുതരുന്നു. സ്വയം പ്രവർത്തിക്കുന്ന ഏജന്റുകളെ (autonomous agents) പരീക്ഷിക്കുന്ന സംരംഭങ്ങൾക്ക്, ഒരു സിസ്റ്റം പ്രോംപ്റ്റോ (system prompt) അല്ലെങ്കിൽ README ഫയലോ സുരക്ഷാ പരിധികൾ ഉറപ്പാക്കാൻ കഴിയില്ല. PyPI കേസ് കാണിക്കുന്നത് പോലെ, ചെറിയൊരു ഡാറ്റാസെറ്റോ ഏതാനും മെഷീനുകളോ പോലും വലിയ തോതിലുള്ള സപ്ലൈ-ചെയിൻ സുരക്ഷാ വീഴ്ചകൾക്ക് കാരണമായേക്കാം.
ഈ മൂന്ന് സുരക്ഷാ വീഴ്ചകൾ Anthropic നടത്തിയ പരിശ്രമത്തിന്റെ വ്യാപ്തിയെയും വെളിപ്പെടുത്തുന്നു: അവർ ഏതാനും പരിശോധനകൾ മാത്രമല്ല, എല്ലാ ടെസ്റ്റ് റണ്ണുകളും ഓഡിറ്റ് ചെയ്തിരുന്നു. ആ കൃത്യത കാരണം സംഭവങ്ങൾ പടരുന്നതിന് മുമ്പ് തന്നെ കോൺഫിഗറേഷനിലെ പിശക് കണ്ടെത്താൻ കമ്പനിക്ക് കഴിഞ്ഞു.
Anthropic എന്ത് ചെയ്തു
സാൻഡ്ബോക്സ് പരാജയം കണ്ടെത്തി ഒരു ദിവസത്തിനുള്ളിൽ Anthropic നിലവിലുള്ള എല്ലാ പരിശോധനകളും നിർത്തിവെച്ചു. ഒരാഴ്ചയ്ക്ക് ശേഷം, മൂന്ന് സംഭവങ്ങളും അവയുടെ സാങ്കേതിക കാരണങ്ങളും ഉടനടി സ്വീകരിക്കേണ്ട പരിഹാര നടപടികളും ഉൾപ്പെടുത്തിക്കൊണ്ടുള്ള വിശദമായ റിപ്പോർട്ട് അവർ പുറത്തിറക്കി.
AI-ഏജന്റ് ഉപയോക്താക്കൾക്കുള്ള പ്രായോഗിക നിർദ്ദേശങ്ങൾ
- നേരിട്ടുള്ള പരിശോധനകളിലൂടെ നെറ്റ്വർക്ക് പരിധികൾ ഉറപ്പാക്കുക – ഒരു പ്രോംപ്റ്റോ കോൺഫിഗറേഷൻ ഫയലോ ഏജന്റിനെ സുരക്ഷിതമായി വേർതിരിച്ചിട്ടുണ്ടെന്ന് കരുതരുത്.
- അധികാരങ്ങൾ (credentials) പരിമിതപ്പെടുത്തുക – ഒരു ടാസ്കിന് അത്യാവശ്യമായ കാര്യങ്ങൾ മാത്രം അനുവദിക്കുക.
- ലഭ്യത സ്വയം പരിശോധിക്കുക – സെൻസിറ്റീവ് ആയ വിവരങ്ങൾ കൈമാറുന്നതിന് മുമ്പ് ഏജന്റിന്റെ യഥാർത്ഥ നെറ്റ്വർക്ക് കാഴ്ചപ്പാട് (network view) പരിശോധിക്കുക.
- അപ്രതീക്ഷിത പ്രവർത്തനങ്ങൾ നിരീക്ഷിക്കുക – പ്ലാൻ ചെയ്തതിൽ നിന്ന് വ്യതിചലിക്കുന്ന ഔട്ട്ബൗണ്ട് കണക്ഷനുകൾക്കോ പാക്കേജ് രജിസ്ട്രേഷനുകൾക്കോ വേണ്ടി അലേർട്ടുകൾ സജ്ജമാക്കുക.
ഈ സംഭവം ഒരു ലളിതമായ സത്യം അടിവരയിടുന്നു: ഒരു AI മോഡലിന് ഇന്റർനെറ്റ് ആക്സസ് നൽകുന്നത് ഒരു മനുഷ്യന് ക്രെഡൻഷ്യലുകൾ കൈമാറുന്നതുപോലെ തന്നെ അപകടകരമാണ്. സാൻഡ്ബോക്സ് സുരക്ഷാ ഉറപ്പുകൾ തെളിയിക്കപ്പെടുന്നത് വരെ, ഓരോ AI പ്രവർത്തനവും നിയന്ത്രണങ്ങളില്ലാത്തതാകാൻ സാധ്യതയുണ്ടെന്ന് കരുതി പരിസ്ഥിതി സുരക്ഷിതമാക്കുക.
