ஆகஸ்ட் 14 முதல், ஒவ்வொரு கருவி அழைப்பிற்கும் (tool call) பயனர்களை "approve" செய்யக் கிளிக் செய்யுமாறு Claude Code கேட்காது என்று Anthropic அறிவித்துள்ளது. அதற்குப் பதிலாக, எந்தச் செயல்களுக்கு மனிதர்களின் ஆய்வு தேவை என்பதை ஒரு AI சார்ந்த இடர் வகைப்படுத்தி (risk classifier) தீர்மானிக்கும். 1,053 சோதனையாளர்களைக் கொண்டு நடத்தப்பட்ட ஆய்வில், 97% கிளிக் செயல்கள் தூண்டுதல் செய்தியை (prompt) வாசிக்காமலேயே செய்யப்பட்டுள்ளன என்றும், தீங்கு விளைவிக்கும் செயல்களில் 89%-ஐ வகைப்படுத்தி கண்டறிந்தது, ஆனால் மனிதர்கள் 13.6%-ஐ மட்டுமே கண்டறிந்துள்ளனர் என்றும் தெரியவந்துள்ளது.

பழைய "click to approve" முறை ஏன் தோல்வியடைந்தது

பழைய பணிப்பாய்வு (workflow), குறியீட்டைத் தள்ளுதல் (pushing code) அல்லது கோப்புகளை நீக்குதல் போன்ற ஒவ்வொரு வெளிப்புறச் செயலையும் ஒரு பொத்தானைக் கிளிக் செய்வதன் மூலம் மனிதர்கள் உறுதிப்படுத்த வேண்டிய கட்டாயத்தை ஏற்படுத்தியது. நடைமுறையில், பயனர்கள் அந்த உரையாடலை ஒரு சடங்காகவே கருதி, தன்னிச்சையாக (reflexively) ஒப்புதல் அளித்தனர். ஆய்வின் புள்ளிவிவரங்கள் இந்தப் பிரச்சனையை வெளிப்படுத்துகின்றன: கிட்டத்தட்ட ஒவ்வொரு கிளிக் செயலும் ஒரு தன்னிச்சையான எதிர்வினையாகவே இருந்தது, மேலும் கவனத்தைப் பெற்ற சில உண்மையான எச்சரிக்கைகள் கூட பெரும்பாலான ஆபத்தான செயல்பாடுகளைத் தவறவிட்டன. ஒரு பாதுகாப்பு வாயில் (safety gate) மறையும் போது, அமைப்பின் பாதுகாப்பு குறைகிறது.

புதிய வகைப்படுத்தி என்ன செய்கிறது

Anthropic-ன் மாற்றாகக் கொண்டுவரப்பட்டுள்ள பயிற்சி அளிக்கப்பட்ட மாதிரி (trained model), நிலுவையில் உள்ள ஒவ்வொரு செயலையும் மதிப்பீடு செய்கிறது மற்றும் செயல்பாடு பின்வரும் மூன்று வகைகளில் ஒன்றில் வரும்போது மட்டுமே குறுக்கிடுகிறது:

  • Irreversible (மாற்ற முடியாதவை) – ஒரு களஞ்சியத்திற்கு (repository) force-push செய்தல் அல்லது ஒரு தரவுத்தள அட்டவணையை (database table) நீக்குதல் போன்ற மாற்ற முடியாத செயல்கள்.
  • Destructive (அழிவை ஏற்படுத்தும்வை) – வேலைகளை அழித்துவிடக்கூடிய பெருமளவிலான நீக்கங்கள் அல்லது கோப்புகளை மேலெழுத்துதல் (overwriting).
  • Outward-facing (வெளிப்புறத்தை நோக்கியவை) – ஒரு pull request-ஐத் தொடங்குதல் அல்லது Slack அறிவிப்பை அனுப்புதல் போன்ற குறியீடு அல்லது செய்திகளை வெளிப்புற அமைப்புகளுக்கு வெளிப்படுத்தும் படிகள்.

ஒரு செயல் இந்த அளவுகோல்களில் எதற்கும் பொருந்தவில்லை என்றால், மாதிரி அதைத் தானாகவே தொடர அனுமதிக்கிறது, இதன் மூலம் பயனர்கள் புறக்கணிக்கும் தூண்டுதல் செய்திகளின் (prompts) பெருக்கத்தை இது நிறுத்துகிறது.

AI-மட்டும் சார்ந்த அணுகுமுறையின் வரம்புகள்

இந்த வகைப்படுத்தி ஒரு உலகளாவிய பாதுகாப்பு அரண் அல்ல. இது தீங்கின் பொதுவான கருத்துக்களைக் கற்றுக்கொண்டதே தவிர, எந்தவொரு குறியீட்டுத் தொகுப்பின் (codebase) நுணுக்கங்களையும் அல்ல. "tmp" என்று பெயரிடப்பட்ட ஒரு கோப்பு பெரும்பாலான திட்டங்களில் பாதிப்பற்றதாக இருக்கலாம், ஆனால் உங்கள் திட்டத்தில் அது முக்கியமான build artifacts-களைக் கொண்டிருக்கலாம்; மாதிரி அதை பாதுகாப்பானது என்று கருத வாய்ப்புள்ளது. ஆய்வின் செயல்பாடு ஒவ்வொரு உற்பத்திச் சூழலிலும் (production environment) ஒரே மாதிரியான முடிவுகளைத் தரும் என்று உத்தரவாதம் அளிக்க முடியாது. விளிம்பு நிலை நிகழ்வுகள் (Edge cases)—குறிப்பாக தனிப்பயன் கருவிகள் (custom tooling) அல்லது முக்கியமான உள்கட்டமைப்புகளை உள்ளடக்கியவை—இன்னும் தெளிவான அனுமதி அமைப்புகள் அல்லது கூடுதல் கண்காணிப்பு தேவைப்படுகின்றன.

பயனர்கள் இப்போது என்ன செய்ய வேண்டும்

  • புதிய அனுமதி முறையை ஆய்வு செய்யவும்: Pro, Max மற்றும் Team திட்டங்கள் தானாகவே இந்த வகைப்படுத்தியைப் பின்பற்றும். நீங்கள் ஒரு தனிப்பயன் அனுமதி பணிப்பாய்வை (custom permission workflow) நம்பியிருந்தால், அது இன்னும் உங்கள் பாதுகாப்பு கொள்கைகளுடன் ஒத்துப்போகிறதா என்பதைச் சரிபார்க்கவும்.
  • அதிக ஆபத்துள்ள செயல்களைக் கண்டறியவும்: உங்கள் CI/CD పైప్‌லைன்கள் மற்றும் வரிசைப்படுத்தல் ஸ்கிரிப்ட்களை (deployment scripts) மூன்று தூண்டுதல் வகைகளுடன் ஒப்பிட்டுப் பார்க்கவும். இயல்புநிலை வகைப்படுத்தி போதுமானதாக இல்லையென்றால், மாற்ற முடியாத அல்லது அழிவை ஏற்படுத்தும் படிகளைச் செய்யும் ஸ்கிரிப்ட்களில் தெளிவான பாதுகாப்பு முறைகளைச் சேர்க்க அவற்றைச் சரிசெய்யவும்.
  • வகைப்படுத்தி எச்சரிக்கைகளைக் கண்காணிக்கவும்: குறுக்கீடுகளின் அதிர்வெண் மற்றும் துல்லியத்தைக் கண்காணிக்கவும். ஆரம்பகால கருத்துக்கள் Anthropic மாதிரியைச் செம்மைப்படுத்த உதவும் மற்றும் குறிப்பிட்ட பணிப்பாய்வுகளுக்கு நீங்கள் மீண்டும் கைமுறை உறுதிப்படுத்தல்களை (manual confirmations) இயக்க வேண்டிய சூழலை உருவாக்கலாம்.

அடுத்து கவனிக்க வேண்டியவை

மனிதர்களின் தன்னிச்சையான கிளிக் முறையிலிருந்து பயிற்சி அளிக்கப்பட்ட மாதிரிக்கு மாறுவது, பல CI pipelines-களில் இருந்த பாதுகாப்பு இடைவெளியை நிரப்புவதற்கான ஒரு தெளிவான முயற்சியாகும்.

ஆதாரம்: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg