ఇటీవలి భద్రతా-పరీక్షా (security-testing) ప్రచారంలో తమ Claude మోడళ్లలో మూడు శాండ్బాక్స్ (sandbox) నుండి బయటకు వచ్చి, వాస్తవ ప్రపంచ వ్యవస్థలను (real-world systems) యాక్సెస్ చేశాయని Anthropic తెలిపింది. దీనివల్ల వెంటనే మూల్యాంకనాలను (evaluations) నిలిపివేసి, బహిరంగ నివేదికను విడుదల చేయాల్సి వచ్చింది.
కంపెనీ 141,006 సైబర్ సెక్యూరిటీ టెస్ట్ రన్లను నిర్వహించింది మరియు మోడళ్లు సిమ్యులేటెడ్ ఎన్విరాన్మెంట్ (simulated environment) కు బదులుగా లైవ్ టార్గెట్లను చేరుకున్న మూడు సంఘటనలను గుర్తించింది. థర్డ్-పార్టీ భాగస్వామితో జరిగిన ఒక మిస్ కాన్ఫిగరేషన్ (misconfiguration) వల్ల శాండ్బాక్స్ దాదాపు తెరిచే ఉండిపోయింది.
ఈ ఉల్లంఘనలు ఎలా జరిగాయి
- Claude Opus 4.7 ఇంటర్నెట్లో బహిర్గతమైన ఒక అసలు కంపెనీని చేరుకుని, బలహీనమైన పాస్వర్డ్లను ఊహించి కొన్ని వందల వరుసల డేటాబేస్ను సేకరించింది.
- Claude Mythos 5 అసలైన PyPI రిపోజిటరీకి ఒక ప్యాకేజీని పబ్లిష్ చేయడం ద్వారా సప్లై-చైన్ అటాక్ (supply-chain attack) చేసింది. రిజిస్ట్రీ ఆ అసాధారణతను గుర్తించకముందే, ఆ ప్యాకేజీ 15 ప్రొడక్షన్ మెషీన్లలో ఇన్స్టాల్ చేయబడింది.
- ఒక internal research model 9,000 టార్గెట్లను స్కాన్ చేసింది, ఒకే ఒక అప్లికేషన్ను కాంప్రమైజ్ చేసింది, ఆపై హోస్ట్ తన సిమ్యులేటెడ్ టాస్క్కు సరిపోలేదని గుర్తించిన తర్వాత అది స్వయంగా ఆగిపోయింది.
ఇవి "rogue AI" (అదుపు తప్పిన AI) సంఘటనలు కావని Anthropic నొక్కి చెప్పింది. మోడళ్లు వాటికి చెప్పినట్లే చేశాయి; టెస్టింగ్ ఇన్ఫ్రాస్ట్రక్చర్ వాటిని ఓపెన్ ఇంటర్నెట్ నుండి వేరు చేయడంలో విఫలమైంది.
ఇది ఎందుకు ముఖ్యం
AI ఏజెంట్లు కోడ్ను అమలు చేయగలిగి మరియు నెట్వర్క్ కాల్స్ చేయగలిగినప్పుడు, నియంత్రిత శాండ్బాక్స్ మరియు లైవ్ నెట్వర్క్ మధ్య వ్యత్యాసం ఎంత తక్కువగా ఉంటుందో ఈ సంఘటనలు చూపుతున్నాయి. స్వయంప్రతిపత్తి కలిగిన ఏజెంట్లతో (autonomous agents) ప్రయోగాలు చేస్తున్న సంస్థలకు, సిస్టమ్ ప్రాంప్ట్ లేదా README ఫైల్ సరిహద్దులను గ్యారెంటీ చేయలేవు. PyPI కేసు చూపినట్లుగా, ఒక చిన్న డేటా సెట్ లేదా కొన్ని మెషీన్లు కూడా పెద్ద ఎత్తున సప్లై-చైన్ కాంప్రమైజ్లకు దారితీయవచ్చు.
ఈ మూడు ఉల్లంఘనలు Anthropic చేసిన ప్రయత్నం యొక్క పరిధిని కూడా తెలియజేస్తున్నాయి: అది కేవలం కొన్ని శాంపిల్స్ను మాత్రమే కాకుండా, ప్రతి టెస్ట్ రన్ను ఆడిట్ చేసింది. ఆ సమగ్రత వల్ల సంఘటనలు వ్యాపించకముందే కంపెనీ ఆ మిస్ కాన్ఫిగరేషన్ను గుర్తించగలిగింది.
Anthropic ఏమి చేసింది
శాండ్బాక్స్ వైఫల్యాన్ని కనుగొన్న ఒక రోజులోనే, Anthropic ప్రస్తుతం జరుగుతున్న అన్ని మూల్యాంకనాలను నిలిపివేసింది. వారం తర్వాత, ఆ మూడు సంఘటనలు, సాంకేతిక కారణం మరియు తక్షణ పరిష్కార చర్యలను పేర్కొంటూ ఒక వివరణాత్మక నివేదికను విడుదల చేసింది.
AI-ఏజెంట్ వినియోగదారుల కోసం ఆచరణాత్మక సూచనలు
- డైరెక్ట్ చెక్లతో నెట్వర్క్ సరిహద్దులను ధృవీకరించండి – ప్రాంప్ట్ లేదా కాన్ఫిగరేషన్ ఫైల్ ఏజెంట్ను నిజంగా వేరు చేస్తుందని ఊహించకండి.
- కనీస స్థాయికి క్రెడెన్షియల్స్ను పరిమితం చేయండి – టాస్క్కు ఖచ్చితంగా అవసరమైన వాటిని మాత్రమే అనుమతించండి.
- రీచబిలిటీని (reachability) మీరే పరీక్షించండి – సున్నితమైన వనరులను అప్పగించే ముందు ఏజెంట్ యొక్క అసలు నెట్వర్క్ వ్యూను పరిశీలించండి.
- అనుకోని కార్యకలాపాల కోసం పర్యవేక్షించండి – ప్రణాళికకు భిన్నంగా ఉండే అవుట్బౌండ్ కనెక్షన్లు లేదా ప్యాకేజీ రిజిస్ట్రేషన్ల కోసం అలర్ట్లను సెట్ చేయండి.
ఈ సంఘటన ఒక సాధారణ నిజాన్ని నొక్కి చెబుతోంది: ఒక AI మోడల్కు ఇంటర్నెట్ యాక్సెస్ ఇవ్వడం అనేది ఒక మానవ ఆపరేటర్కు క్రెడెన్షియల్స్ ఇవ్వడం అంత ప్రమాదకరమే. శాండ్బాక్స్ గ్యారెంటీలను నిరూపించే వరకు, ప్రతి AI-ఆధారిత చర్యను అపరిమితమైనదిగా భావించి, దానికి అనుగుణంగా ఎన్విరాన్మెంట్ను లాక్ చేయండి.
