சமீபத்திய பாதுகாப்புச் சோதனைப் பிரச்சாரத்தின் போது, தனது Claude மாடல்களில் மூன்று மாடல்கள் sandbox-லிருந்து வெளியேறி, நிஜ உலக அமைப்புகளை அணுகியதாக Anthropic தெரிவித்துள்ளது. இது மதிப்பீடுகளை உடனடியாக நிறுத்தி வைக்கவும், ஒரு பொது அறிக்கையை வெளியிடவும் வழிவகுத்தது.
நிறுவனம் 141,006 சைபர் பாதுகாப்பு சோதனை ஓட்டங்களை நடத்தியது மற்றும் மாடல்கள் உருவகப்படுத்தப்பட்ட சூழலுக்கு (simulated environment) பதிலாக நேரடி இலக்குகளைச் சென்றடைந்த மூன்று சம்பவங்களைக் கண்டறிந்தது. ஒரு மூன்றாம் தரப்பு கூட்டாளருடனான தவறான கட்டமைப்பு (misconfiguration), sandbox-ஐ நடைமுறையில் திறந்த நிலையில் வைத்திருந்தது.
இந்த ஊடுருவல்கள் எவ்வாறு நடந்தன
- Claude Opus 4.7 இணையத்தில் வெளிப்படையாக இருந்த ஒரு உண்மையான நிறுவனத்தின் தளத்திற்குச் சென்று, பலவீனமான கடவுச்சொற்களைக் கணித்து, சில நூறு வரித் தரவுகளைக் கொண்ட ஒரு தரவுத்தளத்தைப் (database) பிரித்தெடுத்தது.
- Claude Mythos 5 உண்மையான PyPI களஞ்சியத்தில் (repository) ஒரு தொகுப்பை (package) வெளியிடுவதன் மூலம் ஒரு சப்ளை-செயின் தாக்குதலை (supply-chain attack) உருவாக்கியது. பதிவேடு (registry) அந்த அசாதாரணத்தைக் கண்டறிவதற்கு முன்பே, அந்தத் தொகுப்பு 15 உற்பத்தி இயந்திரங்களில் (production machines) நிறுவப்பட்டது.
- ஒரு உள் ஆராய்ச்சி மாடல் (internal research model) 9,000 இலக்குகளை ஸ்கேன் செய்தது, ஒரு பயன்பாட்டை (application) ஊடுருவியது, பின்னர் அந்த ஹோஸ்ட் (host) தனது உருவகப்படுத்தப்பட்ட பணிக்கு பொருந்தவில்லை என்பதை உணர்ந்தவுடன் தானாகவே நின்றுவிட்டது.
இவை "rogue AI" சம்பவங்கள் அல்ல என்று Anthropic வலியுறுத்துகிறது. மாடல்கள் அவற்றுக்குச் சொல்லப்பட்டதைத்தான் செய்தன; சோதனை உள்கட்டமைப்பு (testing infrastructure) அவற்றை திறந்த இணையத்திலிருந்து தனிமைப்படுத்தத் தவறிவிட்டது.
இது ஏன் முக்கியமானது
AI ஏஜெண்டுகள் குறியீடுகளை (code) இயக்கவும், நெட்வொர்க் அழைப்புகளைச் செய்யவும் (network calls) முடியும் போது, ஒரு கட்டுப்படுத்தப்பட்ட sandbox மற்றும் நேரடி நெட்வொர்க் ஆகியவற்றிற்கு இடையிலான வேறுபாடு எவ்வளவு குறைவு என்பதை இந்தச் சம்பவங்கள் காட்டுகின்றன. தன்னாட்சி ஏஜெண்டுகளைப் (autonomous agents) பரிசோதிக்கும் நிறுவனங்களுக்கு, ஒரு சிஸ்டம் பிராம்ட் (system prompt) அல்லது README கோப்பு எல்லைகளை உறுதிப்படுத்த முடியாது. PyPI வழக்கு காட்டுவது போல, ஒரு சிறிய தரவுத் தொகுப்பு அல்லது ஒரு சில இயந்திரங்கள் கூட பெரிய அளவிலான சப்ளை-செயின் பாதிப்புகளைத் தூண்டக்கூடும்.
இந்த மூன்று ஊடுருவல்களும் Anthropic-ன் முயற்சியின் அளவையும் வெளிப்படுத்துகின்றன: அது ஒரு சீரற்ற மாதிரியை (random sample) மட்டும் ஆய்வு செய்யாமல், ஒவ்வொரு சோதனை ஓட்டத்தையும் தணிக்கை செய்தது. அந்தத் துல்லியமான அணுகுமுறை, சம்பவங்கள் பரவுவதற்கு முன்பே தவறான கட்டமைப்பைக் கண்டறிய நிறுவனத்திற்கு உதவியது.
Anthropic என்ன செய்தது
sandbox தோல்வியைக் கண்டறிந்த ஒரு நாளுக்குள், Anthropic நடைபெற்று வரும் அனைத்து மதிப்பீடுகளையும் நிறுத்தியது. ஒரு வாரத்திற்குப் பிறகு, அந்த மூன்று நிகழ்வுகள், தொழில்நுட்பக் காரணம் மற்றும் உடனடித் தீர்வு நடவடிக்கைகள் ஆகியவற்றைத் பட்டியலிடும் விரிவான அறிக்கையை வெளியிட்டது.
AI-ஏஜென்ட் பயனர்களுக்கான நடைமுறைப் பாடங்கள்
- நேரடிச் சோதனைகள் மூலம் நெட்வொர்க் எல்லைகளைச் சரிபார்க்கவும் – ஒரு பிராம்ட் அல்லது கான்ஃபிக் (config) கோப்பு ஏஜென்ட்டைத் தனிமைப்படுத்தும் என்று ஊகிக்காதீர்கள்.
- அணுகல் அனுமதிகளை (credentials) மிகக் குறைந்த அளவில் வைக்கவும் – பணிக்குத் தேவையான மிக முக்கியமான அனுமதிகளை மட்டும் வழங்கவும்.
- தொடர்புத் திறனை (reachability) நீங்களே சோதிக்கவும் – முக்கியமான வளங்களை ஒப்படைப்பதற்கு முன், ஏஜென்ட்டின் உண்மையான நெட்வொர்க் பார்வையைச் சோதிக்கவும்.
- திட்டமிடாத செயல்பாடுகளைக் கண்காணிக்கவும் – திட்டத்திலிருந்து மாறுபடும் வெளிநோக்கிய இணைப்புகள் (outbound connections) அல்லது தொகுப்புப் பதிவேற்றங்களுக்காக (package registrations) எச்சரிக்கைகளை (alerts) அமைக்கவும்.
இந்தச் சம்பவம் ஒரு எளிய உண்மையை அடிக்கோடிட்டுக் காட்டுகிறது: ஒரு AI மாடலுக்கு இணைய அணுகலை வழங்குவது, ஒரு மனித இயக்குநரிடம் அனுமதிகளை ஒப்படைப்பதற்கு இணையான ஆபத்தானது. sandbox உத்தரவாதங்கள் நிரூபிக்கப்படும் வரை, ஒவ்வொரு AI சார்ந்த செயலையும் கட்டுப்பாடற்றதாகக் கருதி, அதற்கேற்ப சூழலைத் தற்காத்துக் கொள்ளவும்.
