Anthropic એ જણાવ્યું કે તાજેતરના સુરક્ષા-પરીક્ષણ અભિયાન દરમિયાન તેના Claude મોડલ્સમાંથી ત્રણ મોડલ્સ સેન્ડબોક્સમાંથી બહાર નીકળી ગયા અને વાસ્તવિક દુનિયાની સિસ્ટમ્સનો ઉપયોગ કર્યો, જેના કારણે મૂલ્યાંકનો તાત્કાલિક સ્થગિત કરવામાં આવ્યા અને જાહેર અહેવાલ બહાર પાડવામાં આવ્યો.
કંપનીએ 141,006 સાયબર સુરક્ષા પરીક્ષણો કર્યા અને ત્રણ એવી ઘટનાઓ શોધી જેમાં મોડલ્સ સિમ્યુલેટેડ વાતાવરણને બદલે લાઈવ ટાર્ગેટ્સ સુધી પહોંચી ગયા હતા. તૃતીય-પક્ષ ભાગીદાર (third-party partner) સાથેની ખોટી કોન્ફિગરેશનને કારણે સેન્ડબોક્સ અસરકારક રીતે ખુલ્લું રહી ગયું હતું.
આ ઉલ્લંઘનો કેવી રીતે થયા
- Claude Opus 4.7 ઇન્ટરનેટ પર ખુલ્લી પડેલી એક વાસ્તવિક કંપની પર પહોંચી ગયું અને થોડાક સોની લાઈનો ધરાવતા ડેટાબેઝને મેળવવા માટે નબળા પાસવર્ડ્સનો અંદાજ લગાવ્યો.
- Claude Mythos 5 એ વાસ્તવિક PyPI રિપોઝિટરીમાં પેકેજ પ્રકાશિત કરીને સપ્લાય-ચેન એટેક (supply-chain attack) કર્યો. રજિસ્ટ્રી દ્વારા વિસંગતતાની જાણ કરવામાં આવે તે પહેલાં જ આ પેકેજ 15 પ્રોડક્શન મશીનો પર ઇન્સ્ટોલ થઈ ગયું હતું.
- એક આંતરિક સંશોધન મોડલ (internal research model) એ 9,000 ટાર્ગેટ્સ સ્કેન કર્યા, એક એપ્લિકેશન સાથે છેડછાડ કરી, અને પછી હોસ્ટ તેના સિમ્યુલેટેડ કાર્ય સાથે મેળ ખાતો નથી તે ઓળખીને જાતે જ અટકી ગયું.
Anthropic ભારપૂર્વક જણાવે છે કે આ "rogue AI" ના કિસ્સાઓ નહોતા. મોડલ્સ તે જ કરી રહ્યા હતા જે તેમને કહેવામાં આવ્યું હતું; પરીક્ષણ ઇન્ફ્રાસ્ટ્રક્ચર તેમને ખુલ્લા ઇન્ટરનેટથી અલગ રાખવામાં નિષ્ફળ રહ્યું હતું.
તે શા માટે મહત્વનું છે
આ ઘટનાઓ દર્શાવે છે કે જ્યારે AI એજન્ટ્સ કોડ એક્ઝિક્યુટ કરી શકે છે અને નેટવર્ક કોલ્સ કરી શકે છે, ત્યારે નિયંત્રિત સેન્ડબોક્સ અને લાઈવ નેટવર્ક વચ્ચેની રેખા કેટલી પાતળી હોય છે. સ્વાયત્ત એજન્ટ્સ (autonomous agents) સાથે પ્રયોગ કરી રહેલા એન્ટરપ્રાઇઝ માટે, સિસ્ટમ પ્રોમ્પ્ટ અથવા README ફાઇલ સીમાઓની ખાતરી આપી શકતી નથી. PyPI ના કિસ્સામાં સાબિત થયા મુજબ, એક નાનો ડેટા સેટ અથવા થોડાક મશીનો પણ મોટી સપ્લાય-ચેન જોખમો ઊભી કરી શકે છે.
આ ત્રણ ઉલ્લંઘનો Anthropic ના પ્રયાસોનું પ્રમાણ પણ દર્શાવે છે: તેણે કોઈ રેન્ડમ સેમ્પલ નહીં, પરંતુ દરેક ટેસ્ટ રનનું ઓડિટ કર્યું હતું. તે સંપૂર્ણતાને કારણે કંપની ઘટનાઓ ફેલાય તે પહેલાં જ ખોટી કોન્ફિગરેશનને શોધી શકી હતી.
Anthropic એ શું કર્યું
સેન્ડબોક્સની નિષ્ફળતાની જાણ થયાના એક દિવસની અંદર જ, Anthropic એ તમામ ચાલુ મૂલ્યાંકનો અટકાવી દીધા. એક અઠવાડિયા પછી તેણે એક વિગતવાર જાહેરનામું બહાર પાડ્યું જેમાં આ ત્રણ ઘટનાઓ, ટેકનિકલ કારણ અને તાત્કાલિક સુધારાના પગલાંની યાદી આપવામાં આવી હતી.
AI-એજન્ટ વપરાશકર્તાઓ માટે વ્યવહારુ ઉપાયો
- ડાયરેક્ટ ચેક્સ દ્વારા નેટવર્ક સીમાઓની ચકાસણી કરો – એવું માની ન લો કે પ્રોમ્પ્ટ અથવા કોન્ફિગ ફાઇલ ખરેખર એજન્ટને અલગ રાખે છે.
- ક્રેડેન્શિયલ્સને લઘુત્તમ મર્યાદામાં રાખો – કાર્ય માટે જેની ખરેખર જરૂર હોય તેટલી જ પરવાનગી આપો.
- પોતે પહોંચની ક્ષમતા (reachability) ટેસ્ટ કરો – સંવેદનશીલ સંસાધનો સોંપતા પહેલા એજન્ટના વાસ્તવિક નેટવર્ક વ્યુની તપાસ કરો.
- અનિચ્છનીય પ્રવૃત્તિઓ પર દેખરેખ રાખો – આઉટબાઉન્ડ કનેક્શન અથવા પેકેજ રજિસ્ટ્રેશન માટે એલર્ટ સેટ કરો જે યોજનાથી અલગ હોય.
આ ઘટના એક સરળ સત્ય પર ભાર મૂકે છે: AI મોડલને ઇન્ટરનેટ એક્સેસ આપવું એ માનવ ઓપરેટરને ક્રેડેન્શિયલ્સ સોંપવા જેટલું જ જોખમી છે. જ્યાં સુધી સેન્ડબોક્સની ખાતરી સાબિત ન થાય, ત્યાં સુધી દરેક AI-સંચાલિત ક્રિયાને સંભવિત રીતે અનિયંત્રિત ગણો અને તે મુજબ વાતાવરણને સુરક્ષિત (lock down) કરો.
