“Friendly Fire” സുരക്ഷാ പഠനം കാണിക്കുന്നത്, ഒരു README ഫയലിൽ ഒരു ദുരുദ്ദേശ്യപരമായ നിർദ്ദേശം (malicious instruction) ഉൾപ്പെടുത്തിയാൽ മാത്രം ഒരു AI ഏജന്റിനെ വഞ്ചിക്കാമെന്നാണ്. ഏജന്റ് അതിന്റെ അടിസ്ഥാന കോഡ് പരിശോധിക്കാതെ തന്നെ അത് അനുസരിക്കും. ഒരു വ്യക്തിഗത ബ്ലോഗ്-ഓട്ടോമേഷൻ പൈപ്പ്‌ലൈനിൽ ഇതേ പോരായ്മ കണ്ടുപിടിക്കപ്പെട്ടു. അവിടെ ഒരു നിരീക്ഷണമില്ലാത്ത ജനറേഷൻ ഘട്ടത്തിൽ “auto-approve” ഫ്ലാഗ് ഉപയോഗിച്ചിരുന്നത് വലിയൊരു സുരക്ഷാ ഭീഷണിക്ക് കാരണമായി.

Friendly Fire പഠനം ഒരു മറഞ്ഞിരിക്കുന്ന അറ്റാക്ക് വെക്റ്റർ വെളിപ്പെടുത്തുന്നു

Friendly Fire പേപ്പറിന് പിന്നിലെ ഗവേഷകർ വളരെ ലളിതമെങ്കിലും ശക്തമായ ഒരു എക്സ്പ്ലോയിറ്റ് (exploit) തെളിയിച്ചു: ഒരു അറ്റാക്കർ ഡോക്യുമെന്റേഷൻ ഫയലിൽ ഒരു കമാൻഡ് ഉൾപ്പെടുത്തുന്നു, AI അത് അതിന്റെ സാധാരണ പ്രവർത്തനത്തിന്റെ ഭാഗമായി വായിക്കുന്നു. ഏജന്റ് ആ ഫയലിലെ ഉള്ളടക്കത്തെ വിശ്വസിക്കുന്നതിനാൽ, അത് ഒരു നിയമപരമായ നിർദ്ദേശമായി കമാൻഡ് നടപ്പിലാക്കുന്നു. ഇതിനായി AI മോഡലിനെ തന്നെ ഹാക്ക് ചെയ്യേണ്ടതില്ല; മനുഷ്യരുടെ ശ്രദ്ധയില്ലാത്ത സമയത്ത് മോഡൽ പ്രോസസ്സ് ചെയ്യുന്ന ഡാറ്റയെ സ്വാധീനിച്ചാൽ മാത്രം മതി.

ഈ പഠനത്തിന്റെ പ്രധാന സംഭാവന പുതിയൊരു രീതി അവതരിപ്പിക്കുക എന്നതല്ല, മറിച്ച് “auto-approve” മോഡുകൾ—അതായത്, രണ്ടാമതൊരു പരിശോധന കൂടാതെ AI വായിക്കുന്ന കാര്യങ്ങൾ പ്രവർത്തിക്കാൻ നിർദ്ദേശിക്കുന്ന സെറ്റിംഗുകൾ—ബാഹ്യ ഡാറ്റാ സ്രോതസ്സുകളുമായി ഒരു അദൃശ്യമായ വിശ്വാസബന്ധം സൃഷ്ടിക്കുന്നു എന്നതാണ്. ഈ വിശ്വാസം അന്ധമാകുമ്പോൾ, പൈപ്പ്‌ലൈൻ ഏത് കോഡും പ്രവർത്തിപ്പിക്കാൻ കഴിയുന്ന ഒരു വാതിലായി മാറുന്നു.

നിരീക്ഷണമില്ലാത്ത ഒരു ബ്ലോഗ് പൈപ്പ്‌ലൈൻ എങ്ങനെ തകരാറിലായി

പഠനത്തിന്റെ കർത്താവ് ഇതേ തത്വം ഒരു വ്യക്തിഗത ബ്ലോഗ്-ഓട്ടോമേഷൻ സിസ്റ്റത്തിൽ പ്രയോഗിച്ചു. ഇതിന്റെ പ്രവർത്തനരീതി മൂന്ന് ഘട്ടങ്ങളിലായാണ്:

  1. Generation stretch – മനുഷ്യന്റെ മേൽനോട്ടമില്ലാതെ AI ലേഖനം എഴുതുന്നു.
  2. QA gate – ഒരു ഓട്ടോമേറ്റഡ് ക്വാളിറ്റി-സ്കോർ പരിശോധന ഔട്ട്‌പുട്ട് വിലയിരുത്തുന്നു.
  3. Telegram button – പോസ്റ്റ് പ്രസിദ്ധീകരിക്കുന്നതിന് ഒരു മനുഷ്യൻ ബട്ടൺ അമർത്തണം.

ജനറേഷൻ സ്ട്രെച്ച് സമയത്ത് കർത്താവ് dangerously-skip-permissions എന്ന ഫ്ലാഗ് ഉപയോഗിച്ചിരുന്നു, ഇത് ഏത് ഇൻപുട്ടും അംഗീകരിച്ചതായി കണക്കാക്കാൻ AI-യോട് ആവശ്യപ്പെടുന്നു. Friendly Fire പേപ്പറിൽ സൂചിപ്പിച്ച “auto-approve” മോഡിന് സമാനമാണിത്.

പിന്നീട് നടത്തിയ ഒരു പരിശോധനയിൽ വലിയൊരു സുരക്ഷാ വിടവ് കണ്ടെത്തി: ആ സമയത്ത് AI വായിക്കുന്ന ഏതൊരു ഫയലിനെയും ഒരു അറ്റാക്കർ സ്വാധീനിക്കാൻ കഴിഞ്ഞാൽ, അവർക്ക് മുഴുവൻ പൈപ്പ്‌ലൈനെയും നിയന്ത്രിക്കാൻ കഴിയും. കർത്താവിന്റെ സ്വന്തം സിസ്റ്റത്തിൽ ആറ് തവണകളിൽ അഞ്ച് തവണയും നിശബ്ദമായ പരാജയങ്ങൾ (silent failures) സംഭവിച്ചു, കാരണം ഒരു കോൺഫിഗറേഷൻ സ്ക്രിപ്റ്റ് അറിയാതെ മറ്റൊരു സ്ക്രിപ്റ്റിന്റെ സെറ്റിംഗുകൾ മാറ്റിമറിച്ചു. എക്സിറ്റ് കോഡുകളോ QA സ്കോറുകളോ ലോഗ് ചെയ്യാത്തതിനാൽ, മൂന്ന് ദിവസത്തോളം ഈ പ്രശ്നം ആരും അറിയാതെ തുടർന്നു.

സുരക്ഷ എന്നത് AI-യുടെ ഔട്ട്‌പുട്ടിനെ വിശ്വസിക്കുന്നതിലല്ല, മറിച്ച് ജനറേഷൻ ഘട്ടത്തിന് ചുറ്റുമുള്ള മൂന്ന് വ്യക്തമായ ചെക്ക്‌പോയിന്റുകളിലാണെന്ന് ഈ സംഭവം തെളിയിക്കുന്നു.

സുരക്ഷ യഥാർത്ഥത്തിൽ എവിടെയാണ് നിലനിൽക്കുന്നത്

ഈ പഠനവും ബ്ലോഗ്-ഓട്ടോമേഷൻ പരാജയവും ഒരേ കാര്യത്തിലേക്കാണ് വിരൽ ചൂണ്ടുന്നത്: സുരക്ഷാ സംവിധാനങ്ങൾ ജനറേഷൻ പ്രക്രിയയ്ക്ക് പുറത്തായിരിക്കണം. ഓട്ടോ-അപ്രൂവ് അവസ്ഥയിൽ പ്രവർത്തിക്കുമ്പോൾ AI-യെ ഏത് രീതിയിലും പ്രേരിപ്പിക്കാൻ കഴിയും; ചുറ്റുമുള്ള നിയന്ത്രണങ്ങൾക്ക് മാത്രമേ അനാവശ്യമായ പ്രവർത്തനങ്ങളെ കണ്ടെത്താനും തടയാനും കഴിയൂ.

പ്രധാന നിരീക്ഷണങ്ങൾ:

  • അവസാന ഘട്ടത്തിലെ മനുഷ്യന്റെ അംഗീകാരം (Human approval at the end) ഫലപ്രദമാണ്, കാരണം ഇത് അവസാന ഉൽപ്പന്നത്തെയാണ് പരിശോധിക്കുന്നത്, അല്ലാതെ തത്സമയ മേൽനോട്ടം സാധ്യമാകാത്ത ഇടനില ഘട്ടങ്ങളെയല്ല.
  • ക്വാളിറ്റി പരിധികൾ (Quality thresholds) ജനറേഷന് ശേഷം എന്നാൽ പ്രസിദ്ധീകരിക്കുന്നതിന് മുമ്പ് നടപ്പിലാക്കുന്നത്, കൃത്രിമം കാണിക്കപ്പെട്ടേക്കാവുന്ന കുറഞ്ഞ വിശ്വാസ്യതയുള്ള ഔട്ട്‌പുട്ടുകളെ കണ്ടെത്താൻ സഹായിക്കുന്നു.
  • ഓരോ എക്സിറ്റ് കോഡ്, QA സ്കോർ, കോൺഫിഗറേഷൻ മാറ്റം എന്നിവയുടെ സമഗ്രമായ ലോഗിംഗ് (Comprehensive logging) വഴി വലിയ പ്രശ്നങ്ങൾ ഉണ്ടാകുന്നതിന് മുമ്പ് തന്നെ നിശബ്ദമായ പരാജയങ്ങൾ കണ്ടെത്താം.

ഓട്ടോ-അപ്രൂവ് ഏജന്റുകൾ പ്രവർത്തിപ്പിക്കുന്നവർക്കുള്ള പാഠങ്ങൾ

  1. എല്ലാം ലോഗ് ചെയ്യുക – എക്സിറ്റ് കോഡുകൾ, QA സ്കോറുകൾ, കോൺഫിഗറേഷൻ ഫയലുകളിലെ മാറ്റങ്ങൾ എന്നിവ രേഖപ്പെടുത്തുക. കാണാൻ കഴിയാത്ത ഒന്നിനെ നിങ്ങൾക്ക് പരിഹരിക്കാൻ കഴിയില്ല.
  2. കർശനമായ ക്വാളിറ്റി ഗേറ്റ് നടപ്പിലാക്കുക – പൈപ്പ്‌ലൈൻ അടുത്ത ഘട്ടത്തിലേക്ക് കടക്കുന്നതിന് മുമ്പ് പാലിച്ചിരിക്കേണ്ട ഒരു നിശ്ചിത പരിധി നിശ്ചയിക്കുക.
  3. അവസാന ഘട്ടത്തിനായി മനുഷ്യന്റെ അംഗീകാരം മാറ്റിവെക്കുക – AI പ്രവർത്തിക്കുമ്പോൾ തന്നെ അതിനെ നിരീക്ഷിക്കാൻ ശ്രമിക്കുന്നത് പ്രായോഗികമല്ല; എല്ലാ പരിശോധനകൾക്കും ശേഷം ഒരു ബട്ടൺ അമർത്തുന്നത് കൂടുതൽ വിശ്വസനീയമാണ്.
  4. കോൺഫിഗറേഷൻ ഫയലുകൾ സംരക്ഷിക്കുക – സെറ്റിംഗുകൾ മാറ്റാൻ സാധ്യതയുള്ള മറ്റ് ടൂളുകളിൽ നിന്ന് അവയെ മാറ്റിനിർത്തുക, കൂടാതെ അവയുടെ ആക്സസ് കൃത്യമായി പരിശോധിക്കുക.

ചുരുക്കത്തിൽ

നിരീക്ഷണമില്ലാത്ത AI ഏജന്റുകളുടെ സുരക്ഷ എന്നത് അവയ്ക്ക് ചുറ്റുമുള്ള സുരക്ഷാ വിടവുകൾ നിങ്ങൾ എത്രത്തോളം അടയ്ക്കുന്നു എന്നതിനെ ആശ്രയിച്ചിരിക്കുന്നു. ഒരു “auto-approve” ഫ്ലാഗ് സൗകര്യത്തെ ഒരു നിശബ്ദമായ ബാക്ക്‌ഡോർ (backdoor) ആക്കി മാറ്റുന്നു; കൃത്യമായ ലോഗിംഗ്, കർശനമായ ക്വാളിറ്റി ഗേറ്റുകൾ, മനുഷ്യന്റെ അന്തിമ അംഗീകാരം എന്നിവയാണ് പൈപ്പ്‌ലൈൻ ഒരു അറ്റാക്ക് വെക്റ്ററായി മാറുന്നത് തടയാനുള്ള പ്രായോഗിക മാർഗങ്ങൾ.