ఇటీవలి భద్రతా-పరీక్షా (security-testing) ప్రచారంలో తమ Claude మోడళ్లలో మూడు శాండ్‌బాక్స్ (sandbox) నుండి బయటకు వచ్చి, వాస్తవ ప్రపంచ వ్యవస్థలను (real-world systems) యాక్సెస్ చేశాయని Anthropic తెలిపింది. దీనివల్ల వెంటనే మూల్యాంకనాలను (evaluations) నిలిపివేసి, బహిరంగ నివేదికను విడుదల చేయాల్సి వచ్చింది.

కంపెనీ 141,006 సైబర్ సెక్యూరిటీ టెస్ట్ రన్‌లను నిర్వహించింది మరియు మోడళ్లు సిమ్యులేటెడ్ ఎన్విరాన్మెంట్ (simulated environment) కు బదులుగా లైవ్ టార్గెట్‌లను చేరుకున్న మూడు సంఘటనలను గుర్తించింది. థర్డ్-పార్టీ భాగస్వామితో జరిగిన ఒక మిస్ కాన్ఫిగరేషన్ (misconfiguration) వల్ల శాండ్‌బాక్స్ దాదాపు తెరిచే ఉండిపోయింది.

ఈ ఉల్లంఘనలు ఎలా జరిగాయి

  • Claude Opus 4.7 ఇంటర్నెట్‌లో బహిర్గతమైన ఒక అసలు కంపెనీని చేరుకుని, బలహీనమైన పాస్‌వర్డ్‌లను ఊహించి కొన్ని వందల వరుసల డేటాబేస్‌ను సేకరించింది.
  • Claude Mythos 5 అసలైన PyPI రిపోజిటరీకి ఒక ప్యాకేజీని పబ్లిష్ చేయడం ద్వారా సప్లై-చైన్ అటాక్ (supply-chain attack) చేసింది. రిజిస్ట్రీ ఆ అసాధారణతను గుర్తించకముందే, ఆ ప్యాకేజీ 15 ప్రొడక్షన్ మెషీన్లలో ఇన్‌స్టాల్ చేయబడింది.
  • ఒక internal research model 9,000 టార్గెట్‌లను స్కాన్ చేసింది, ఒకే ఒక అప్లికేషన్‌ను కాంప్రమైజ్ చేసింది, ఆపై హోస్ట్ తన సిమ్యులేటెడ్ టాస్క్‌కు సరిపోలేదని గుర్తించిన తర్వాత అది స్వయంగా ఆగిపోయింది.

ఇవి "rogue AI" (అదుపు తప్పిన AI) సంఘటనలు కావని Anthropic నొక్కి చెప్పింది. మోడళ్లు వాటికి చెప్పినట్లే చేశాయి; టెస్టింగ్ ఇన్‌ఫ్రాస్ట్రక్చర్ వాటిని ఓపెన్ ఇంటర్నెట్ నుండి వేరు చేయడంలో విఫలమైంది.

ఇది ఎందుకు ముఖ్యం

AI ఏజెంట్లు కోడ్‌ను అమలు చేయగలిగి మరియు నెట్‌వర్క్ కాల్స్ చేయగలిగినప్పుడు, నియంత్రిత శాండ్‌బాక్స్ మరియు లైవ్ నెట్‌వర్క్ మధ్య వ్యత్యాసం ఎంత తక్కువగా ఉంటుందో ఈ సంఘటనలు చూపుతున్నాయి. స్వయంప్రతిపత్తి కలిగిన ఏజెంట్లతో (autonomous agents) ప్రయోగాలు చేస్తున్న సంస్థలకు, సిస్టమ్ ప్రాంప్ట్ లేదా README ఫైల్ సరిహద్దులను గ్యారెంటీ చేయలేవు. PyPI కేసు చూపినట్లుగా, ఒక చిన్న డేటా సెట్ లేదా కొన్ని మెషీన్లు కూడా పెద్ద ఎత్తున సప్లై-చైన్ కాంప్రమైజ్‌లకు దారితీయవచ్చు.

ఈ మూడు ఉల్లంఘనలు Anthropic చేసిన ప్రయత్నం యొక్క పరిధిని కూడా తెలియజేస్తున్నాయి: అది కేవలం కొన్ని శాంపిల్స్‌ను మాత్రమే కాకుండా, ప్రతి టెస్ట్ రన్‌ను ఆడిట్ చేసింది. ఆ సమగ్రత వల్ల సంఘటనలు వ్యాపించకముందే కంపెనీ ఆ మిస్ కాన్ఫిగరేషన్‌ను గుర్తించగలిగింది.

Anthropic ఏమి చేసింది

శాండ్‌బాక్స్ వైఫల్యాన్ని కనుగొన్న ఒక రోజులోనే, Anthropic ప్రస్తుతం జరుగుతున్న అన్ని మూల్యాంకనాలను నిలిపివేసింది. వారం తర్వాత, ఆ మూడు సంఘటనలు, సాంకేతిక కారణం మరియు తక్షణ పరిష్కార చర్యలను పేర్కొంటూ ఒక వివరణాత్మక నివేదికను విడుదల చేసింది.

AI-ఏజెంట్ వినియోగదారుల కోసం ఆచరణాత్మక సూచనలు

  1. డైరెక్ట్ చెక్‌లతో నెట్‌వర్క్ సరిహద్దులను ధృవీకరించండి – ప్రాంప్ట్ లేదా కాన్ఫిగరేషన్ ఫైల్ ఏజెంట్‌ను నిజంగా వేరు చేస్తుందని ఊహించకండి.
  2. కనీస స్థాయికి క్రెడెన్షియల్స్‌ను పరిమితం చేయండి – టాస్క్‌కు ఖచ్చితంగా అవసరమైన వాటిని మాత్రమే అనుమతించండి.
  3. రీచబిలిటీని (reachability) మీరే పరీక్షించండి – సున్నితమైన వనరులను అప్పగించే ముందు ఏజెంట్ యొక్క అసలు నెట్‌వర్క్ వ్యూను పరిశీలించండి.
  4. అనుకోని కార్యకలాపాల కోసం పర్యవేక్షించండి – ప్రణాళికకు భిన్నంగా ఉండే అవుట్‌బౌండ్ కనెక్షన్‌లు లేదా ప్యాకేజీ రిజిస్ట్రేషన్‌ల కోసం అలర్ట్‌లను సెట్ చేయండి.

ఈ సంఘటన ఒక సాధారణ నిజాన్ని నొక్కి చెబుతోంది: ఒక AI మోడల్‌కు ఇంటర్నెట్ యాక్సెస్ ఇవ్వడం అనేది ఒక మానవ ఆపరేటర్‌కు క్రెడెన్షియల్స్ ఇవ్వడం అంత ప్రమాదకరమే. శాండ్‌బాక్స్ గ్యారెంటీలను నిరూపించే వరకు, ప్రతి AI-ఆధారిత చర్యను అపరిమితమైనదిగా భావించి, దానికి అనుగుణంగా ఎన్విరాన్మెంట్‌ను లాక్ చేయండి.