ఆగస్టు 14 నుండి, ప్రతి టూల్ కాల్ (tool call) కోసం వినియోగదారులను "approve" క్లిక్ చేయమని అడగడం Claude Code నిలిపివేస్తుందని Anthropic ప్రకటించింది. దానికి బదులుగా, ఏ చర్యలకు మానవ సమీక్ష (human review) అవసరమో నిర్ణయించడానికి ఒక AI-ఆధారిత రిస్క్ క్లాసిఫైయర్ (risk classifier) పనిచేస్తుంది. 1,053 మంది పరీక్షకులపై చేసిన అధ్యయనం ప్రకారం, 97% క్లిక్లు ప్రాంప్ట్ను చదవకుండానే జరిగాయని, క్లాసిఫైయర్ 89% హానికరమైన చర్యలను గుర్తించగా, మానవులు కేవలం 13.6% మాత్రమే గుర్తించారని తేలింది.
పాత "click to approve" మోడల్ ఎందుకు విఫలమైంది
పాత వర్క్ఫ్లోలో కోడ్ను పుష్ చేయడం (pushing code), ఫైళ్లను తొలగించడం వంటి ప్రతి బాహ్య చర్యను ఒక బటన్ను క్లిక్ చేయడం ద్వారా మానవులే ధృవీకరించాల్సి వచ్చేది. వాస్తవానికి, వినియోగదారులు ఆ డైలాగ్ను కేవలం ఒక ఫార్మాలిటీగా భావించి, అలవాటు ప్రకారం (reflexively) అప్రూవ్ చేసేవారు. ఈ అధ్యయనం యొక్క గణాంకాలు సమస్యను బయటపెట్టాయి: దాదాపు ప్రతి క్లిక్ ఒక ప్రతిచర్యగా మారిపోయింది, మరియు దృష్టిని ఆకర్షించిన కొద్దిపాటి నిజమైన హెచ్చరికలు కూడా అత్యంత ప్రమాదకరమైన కార్యకలాపాలను గుర్తించలేకపోయాయి. భద్రతా ద్వారం (safety gate) కనిపించకుండా పోయినప్పుడు, సిస్టమ్ భద్రత క్షీణిస్తుంది.
కొత్త క్లాసిఫైయర్ ఏం చేస్తుంది
Anthropic ప్రవేశపెట్టిన కొత్త పరిష్కారం ఒక శిక్షణ పొందిన మోడల్ (trained model). ఇది పెండింగ్లో ఉన్న ప్రతి చర్యను అంచనా వేస్తుంది మరియు ఆ చర్య ఈ క్రింది మూడు వర్గాలలో ఏదో ఒకటి కిందకు వస్తే మాత్రమే అడ్డుకుంటుంది:
- Irreversible (తిరుగులేనివి) – రిపోజిటరీకి ఫోర్స్-పుష్ చేయడం లేదా డేటాబేస్ టేబుల్ను తొలగించడం వంటి వెనక్కి తీసుకోలేని చర్యలు.
- Destructive (విధ్వంసకరమైనవి) – పనిని తుడిచివేసే విధంగా భారీ స్థాయిలో ఫైళ్లను తొలగించడం లేదా ఓవర్రైట్ చేయడం.
- Outward-facing (బాహ్య వ్యవస్థలకు సంబంధించినవి) – కోడ్ లేదా సందేశాలను బాహ్య వ్యవస్థలకు బహిర్గతం చేసే దశలు, ఉదాహరణకు pull request తెరవడం లేదా Slack నోటిఫికేషన్ను పంపడం.
ఒక చర్య ఈ ప్రమాణాలలో దేనికీ సరిపోకపోతే, మోడల్ దానిని స్వయంచాలకంగా కొనసాగనిస్తుంది, తద్వారా వినియోగదారులు విస్మరించే ప్రాంప్ట్ల వరదను ఇది ఆపుతుంది.
AI-మాత్రమే వాడటం వల్ల ఉన్న పరిమితులు
ఈ క్లాసిఫైయర్ అనేది అన్నిటికీ వర్తించే సంపూర్ణ రక్షణ కవచం కాదు. ఇది హాని అనే సాధారణ అంశాలను మాత్రమే నేర్చుకుంది, ఏదైనా కోడ్బేస్ యొక్క ప్రత్యేకతలను కాదు. "tmp" అనే పేరున్న ఫోల్డర్ చాలా ప్రాజెక్టులలో హానిలేనిది కావచ్చు, కానీ మీ ప్రాజెక్టులో అది కీలకమైన బిల్డ్ ఆర్టిఫాక్ట్లను (build artifacts) కలిగి ఉండవచ్చు; అటువంటప్పుడు మోడల్ దానిని సురక్షితమైనదిగా భావించే అవకాశం ఉంది. ఈ అధ్యయనం యొక్క పనితీరు ప్రతి ప్రొడక్షన్ ఎన్విరాన్మెంట్లో (production environment) ఒకేలా ఉంటుందని గ్యారెంటీ లేదు. ఎడ్జ్ కేస్లు (Edge cases)—ముఖ్యంగా కస్టమ్ టూలింగ్ లేదా సెన్సిటివ్ ఇన్ఫ్రాస్ట్రక్చర్కు సంబంధించినవి—ఇంకా స్పష్టమైన అనుమతి సెట్టింగ్లు లేదా అదనపు పర్యవేక్షణను కోరుతాయి.
వినియోగదారులు ఇప్పుడు ఏమి చేయాలి
- కొత్త పర్మిషన్ మోడ్ను సమీక్షించండి: Pro, Max, మరియు Team ప్లాన్లు స్వయంచాలకంగా క్లాసిఫైయర్ను స్వీకరిస్తాయి. మీరు ఏదైనా కస్టమ్ పర్మిషన్ వర్క్ఫ్లోపై ఆధారపడి ఉంటే, అది మీ భద్రతా విధానాలకు (security policies) అనుగుణంగా ఉందో లేదో తనిఖీ చేయండి.
- అధిక రిస్క్ ఉన్న చర్యలను గుర్తించండి: మీ CI/CD పైప్లైన్లు మరియు డిప్లాయ్మెంట్ స్క్రిప్ట్లను ఆ మూడు ట్రిగ్గర్ వర్గాలకు అనుగుణంగా మ్యాప్ చేయండి. డిఫాల్ట్ క్లాసిఫైయర్ సరిపోకపోతే, తిరుగులేని లేదా విధ్వంసకరమైన దశలను నిర్వహించే స్క్రిప్ట్లలో స్పష్టమైన భద్రతా చర్యలను (safeguards) చేర్చడానికి వాటిని సర్దుబాటు చేయండి.
- క్లాసిఫైయర్ అలర్ట్లను పర్యవేక్షించండి: అడ్డుపడే ప్రక్రియల ఫ్రీక్వెన్సీ మరియు ఖచ్చితత్వాన్ని ట్రాక్ చేయండి. త్వరిత ఫీడ్బ్యాక్ Anthropic మోడల్ను మరింత మెరుగుపరచడానికి (fine-tune) సహాయపడుతుంది మరియు కొన్ని ప్రత్యేక వర్క్ఫ్లోల కోసం మాన్యువల్ కన్ఫర్మేషన్లను మళ్లీ ఎనేబుల్ చేయమని మీకు సూచించవచ్చు.
తదుపరి ఏమి గమనించాలి
మానవ అలవాటు ప్రకారం చేసే క్లిక్ల నుండి శిక్షణ పొందిన మోడల్కు మారడం అనేది, అనేక CI పైప్లైన్లలో ఉన్న భద్రతా లోపాన్ని (safety gap) పూడ్చడానికి చేసిన స్పష్టమైన ప్రయత్నం.
Source: https://dev.to/code_with_kyryl/97-of-your-ai-approval-clicks-were-reflexes-18lg
