ഓഗസ്റ്റ് 14 മുതൽ, ഓരോ ടൂൾ കോളിനും (tool call) ഉപയോക്താക്കളോട് "approve" ചെയ്യാൻ ആവശ്യപ്പെടുന്നത് Claude Code നിർത്തലാക്കുമെന്ന് Anthropic പ്രഖ്യാപിച്ചു. പകരം, ഏതെല്ലാം നടപടികൾക്ക് മനുഷ്യന്റെ പരിശോധന ആവശ്യമാണെന്ന് തീരുമാനിക്കാൻ ഒരു AI അധിഷ്ഠിത റിസ്ക് ക്ലാസിഫയർ (risk classifier) ഉപയോഗിക്കും. 1,053 ടെസ്റ്റർമാരെ ഉൾപ്പെടുത്തി നടത്തിയ പഠനത്തിൽ, 97% ക്ലിക്കുകളും പ്രോംപ്റ്റ് വായിക്കാതെയാണ് നടന്നതെന്ന് കണ്ടെത്തി. കൂടാതെ, ദോഷകരമായ നടപടികളിൽ 89% എണ്ണം ക്ലാസിഫയർ തിരിച്ചറിഞ്ഞപ്പോൾ, മനുഷ്യർക്ക് 13.6% മാത്രമേ തിരിച്ചറിയാൻ സാധിച്ചുള്ളൂ.
പഴയ "click to approve" മാതൃക പരാജയപ്പെട്ടത് എന്തുകൊണ്ട്
പഴയ പ്രവർത്തനരീതിയിൽ, കോഡ് പുഷ് ചെയ്യുന്നത് (pushing code), ഫയലുകൾ ഡിലീറ്റ് ചെയ്യുന്നത് എന്നിങ്ങനെയുള്ള ഓരോ ബാഹ്യ നടപടിയും ഒരു ബട്ടൺ ക്ലിക്ക് ചെയ്തുകൊണ്ട് മനുഷ്യൻ സ്ഥിരീകരിക്കേണ്ടി വരുമായിരുന്നു. പ്രായോഗികമായി, ഉപയോക്താക്കൾ ഈ ഡയലോഗുകളെ വെറുമൊരു ചടങ്ങായി മാത്രം കണ്ടുതരികയും യാന്ത്രികമായി (reflexively) അവ അംഗീകരിക്കുകയും ചെയ്തു. പഠനത്തിലെ കണക്കുകൾ ഈ പ്രശ്നം വ്യക്തമാക്കുന്നു: മിക്കവാറും എല്ലാ ക്ലിക്കുകളും യാന്ത്രികമായിരുന്നു, ശ്രദ്ധിക്കപ്പെട്ട ചുരുക്കം ചില മുന്നറിയിപ്പുകൾ പോലും ഏറ്റവും അപകടകരമായ പ്രവർത്തനങ്ങളെ തിരിച്ചറിയുന്നതിൽ പരാജയപ്പെട്ടു. ഒരു സുരക്ഷാ കവാടം ഇല്ലാതാകുമ്പോൾ, സിസ്റ്റത്തിന്റെ സുരക്ഷയും കുറയുന്നു.
പുതിയ ക്ലാസിഫയർ ചെയ്യുന്നത് എന്താണ്
Anthropic കൊണ്ടുവന്ന പുതിയ സംവിധാനം ഓരോ കാത്തിരിക്കുന്ന നടപടിയും വിലയിരുത്തുന്ന ഒരു ട്രെയിൻഡ് മോഡലാണ് (trained model). താഴെ പറയുന്ന മൂന്ന് വിഭാഗങ്ങളിൽപ്പെട്ട പ്രവർത്തനങ്ങൾ വരുമ്പോൾ മാത്രമേ ഇത് തടസ്സങ്ങൾ (interrupt) ഉണ്ടാക്കുന്നുള്ളൂ:
- Irreversible (തിരുത്താൻ കഴിയാത്തവ) – ഒരു റിപ്പോസിറ്ററിയിലേക്ക് force-push ചെയ്യുന്നത് അല്ലെങ്കിൽ ഒരു ഡാറ്റാബേസ് ടേബിൾ ഒഴിവാക്കുന്നത് (dropping a database table) പോലുള്ള, മാറ്റം വരുത്തിയിട്ട് പഴയപടിയാക്കാൻ കഴിയാത്ത നടപടികൾ.
- Destructive (നാശമുണ്ടാക്കുന്നവ) – ജോലികൾ ഇല്ലാതാക്കാൻ സാധ്യതയുള്ള ബൾക്ക് ഡിലീഷനുകൾ (bulk deletions) അല്ലെങ്കിൽ ഫയലുകൾ ഓവർറൈറ്റ് ചെയ്യുന്നത്.
- Outward-facing (പുറംലോകത്തേക്ക് ബന്ധപ്പെട്ടവ) – ഒരു pull request തുറക്കുകയോ Slack നോട്ടിഫിക്കേഷൻ അയക്കുകയോ ചെയ്യുന്നത് പോലെ, കോഡോ സന്ദേശങ്ങളോ ബാഹ്യ സംവിധാനങ്ങളിലേക്ക് എത്തിക്കുന്ന ഘട്ടങ്ങൾ.
ഒരു നടപടി ഈ മാനദണ്ഡങ്ങളിൽ ഒന്നിനും പരിധിയിൽ വരുന്നില്ലെങ്കിൽ, മോഡൽ അത് സ്വയമേവ മുന്നോട്ട് കൊണ്ടുപോകും. ഇത് ഉപയോക്താക്കൾ അവഗണിച്ചുകൊണ്ടിരുന്ന പ്രോംപ്റ്റുകളുടെ പ്രവാഹത്തിന് അറുതിവരുത്തുന്നു.
AI മാത്രം ഉപയോഗിക്കുന്ന രീതിയുടെ പരിമിതികൾ
ഈ ക്ലാസിഫയർ ഒരു സാർവത്രിക സുരക്ഷാ കവചമല്ല. ഇത് ദോഷകരമായ കാര്യങ്ങളെക്കുറിച്ചുള്ള പൊതുവായ ധാരണകൾ മാത്രമാണ് പഠിച്ചിട്ടുള്ളത്, ഏതെങ്കിലും ഒരു കോഡ്ബേസിന്റെ (codebase) പ്രത്യേകതകളല്ല. "tmp" എന്ന് പേരുള്ള ഒരു ഫോൾഡർ മിക്ക പ്രോജക്റ്റുകളിലും ദോഷകരമല്ലായിരിക്കാം, എന്നാൽ നിങ്ങളുടെ പ്രോജക്റ്റിൽ അത് നിർണ്ണായകമായ ബിൽഡ് ആർട്ടീഫാക്റ്റുകൾ (build artifacts) അടങ്ങിയതാകാം; അത്തരം സാഹചര്യത്തിൽ മോഡൽ അത് സുരക്ഷിതമാണെന്ന് കരുതിയേക്കാം. പഠനത്തിലെ പ്രകടനം എല്ലാ പ്രൊഡക്ഷൻ എൻവയോൺമെന്റുകളിലും (production environments) ഒരേപോലെ ലഭിക്കുമെന്ന് ഉറപ്പില്ല. എഡ്ജ് കേസുകൾ (Edge cases)—പ്രത്യേകിച്ച് കസ്റ്റം ടൂളിംഗോ സെൻസിറ്റീവ് ഇൻഫ്രാസ്ട്രക്ചറോ ഉൾപ്പെടുന്നവ—ഇപ്പോഴും വ്യക്തമായ പെർമിഷൻ സെറ്റിംഗുകളോ അധിക നിരീക്ഷണമോ ആവശ്യമാണ്.
ഉപയോക്താക്കൾ ഇപ്പോൾ ചെയ്യേണ്ടത്
- പുതിയ പെർമിഷൻ മോഡ് പരിശോധിക്കുക: Pro, Max, Team പ്ലാനുകൾ സ്വയമേവ ഈ ക്ലാസിഫയർ സ്വീകരിക്കും. നിങ്ങൾ ഒരു കസ്റ്റം പെർമിഷൻ വർക്ക്ഫ്ലോയാണ് ഉപയോഗിക്കുന്നതെങ്കിൽ, അത് നിങ്ങളുടെ സുരക്ഷാ നയങ്ങളുമായി (security policies) പൊരുത്തപ്പെടുന്നുണ്ടെന്ന് ഉറപ്പുവരുത്തുക.
- ഉയർന്ന റിസ്ക് ഉള്ള നടപടികൾ തിരിച്ചറിയുക: നിങ്ങളുടെ CI/CD പൈപ്പ്ലൈനുകളെയും (pipelines) ഡിപ്ലോയ്മെന്റ് സ്ക്രിപ്റ്റുകളെയും മൂന്ന് വിഭാഗങ്ങളുമായി താരതമ്യം ചെയ്യുക. ഡിഫോൾട്ട് ക്ലാസിഫയർ മതിയാകാത്ത സാഹചര്യത്തിൽ, തിരുത്താൻ കഴിയാത്തതോ നാശമുണ്ടാക്കുന്നതോ ആയ ഘട്ടങ്ങൾ ചെയ്യുന്ന സ്ക്രിപ്റ്റുകളിൽ വ്യക്തമായ സുരക്ഷാ സംവിധാനങ്ങൾ ഉൾപ്പെടുത്തുക.
- ക്ലാസിഫയർ അലേർട്ടുകൾ നിരീക്ഷിക്കുക: തടസ്സങ്ങളുടെ ആവൃത്തിയും (frequency) കൃത്യതയും നിരീക്ഷിക്കുക. നിങ്ങളുടെ ഫീഡ്ബാക്ക് Anthropic-നെ മോഡൽ കൂടുതൽ മെച്ചപ്പെടുത്താൻ സഹായിക്കും, കൂടാതെ ചില പ്രത്യേക വർക്ക്ഫ്ലോകൾക്കായി മാനുവൽ കൺഫർമേഷനുകൾ വീണ്ടും പ്രവർത്തനക്ഷമമാക്കാൻ ഇത് നിങ്ങളെ പ്രേരിപ്പിച്ചേക്കാം.
ഇനി ശ്രദ്ധിക്കേണ്ടത്
മനുഷ്യരുടെ യാന്ത്രികമായ ക്ലിക്കുകളിൽ നിന്ന് ഒരു ട്രെയിൻഡ് മോഡലിലേക്ക് മാറുന്നത്, പല CI പൈപ്പ്ലൈനുകളിലും നിലനിന്നിരുന്ന സുരക്ഷാ വിടവ് നികത്താനുള്ള വ്യക്തമായ ശ്രമമാണ്.
സ്രോതസ്സ്: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
