બ્રાઉઝર પ્રોમ્પ્ટ ઇન્જેક્શનમાં Anthropic ના Opus 5 એ શૂન્ય ટકા સફળતા દર હાંસલ કર્યો
Anthropic એ Opus 5 ના રિલીઝ સાથે AI સુરક્ષામાં એક મહત્વપૂર્ણ સિદ્ધિ હાંસલ કરી છે, જે સંભવિત રીતે ઓટોનોમસ એજન્ટ્સમાં રહેલી સૌથી જટિલ નબળાઈઓમાંથી એકનો ઉકેલ લાવી શકે છે. ડ્યુઅલ-લેયર ડિફેન્સ સિસ્ટમ લાગુ કરીને, આ મોડેલે બ્રાઉઝર-આધારિત પ્રોમ્પ્ટ ઇન્જેક્શન હુમલાઓ સામે લગભગ સંપૂર્ણ સુરક્ષા દર્શાવી છે.
AI એજન્ટ્સમાં પ્રોમ્પ્ટ ઇન્જેક્શનનું સંકટ
પ્રોમ્પ્ટ ઇન્જેક્શન વર્તમાન AI યુગની "Achilles' heel" (સૌથી મોટી નબળાઈ) બનીને રહી છે. આ નબળાઈ ત્યારે સર્જાય છે જ્યારે કોઈ હુમલાખોર વેબપેજની અંદર—ઘણીવાર અદ્રશ્ય ટેક્સ્ટ દ્વારા—દૂષિત સૂચનાઓ છુપાવે છે, જે AI એજન્ટ બ્રાઉઝિંગ કરતી વખતે વાંચે છે. એકવાર પ્રોસેસ થયા પછી, આ સૂચનાઓ મોડેલનું નિયંત્રણ લઈ શકે છે, તેને સુરક્ષા પ્રોટોકોલ બાયપાસ કરવા અથવા અનધિકૃત કાર્યો કરવા માટે મજબૂર કરી શકે છે. જોકે OpenAI જેવા ઉદ્યોગના અગ્રણીઓએ અગાઉ સૂચવ્યું હતું કે પ્રોમ્પ્ટ ઇન્જેક્શન એ LLMs ની એક એવી ખામી હોઈ શકે છે જેનો ઉકેલ લાવી શકાય તેમ નથી, Anthropic નો તાજેતરનો ડેટા તે નિરાશાવાદી દૃષ્ટિકોણને પડકારે છે.
શૂન્ય ટકા બેન્ચમાર્ક હાંસલ કરવો
Anthropic ના સિસ્ટમ કાર્ડ મુજબ, Opus 5 એ બ્રાઉઝર એજન્ટ્સ માટે ખાસ તૈયાર કરવામાં આવેલા 129 વિવિધ પરીક્ષણ પરિસ્થિતિઓમાં આશ્ચર્યજનક રીતે 0% હુમલા સફળતા દર હાંસલ કર્યો છે. આ અગાઉના સંસ્કરણો કરતા એક મોટું કદમ છે. સિક્યુરિટી ફર્મ Gray Swan દ્વારા કરવામાં આવેલા સામાન્ય પ્રોમ્પ્ટ ઇન્જેક્શન પરીક્ષણમાં, Opus 5 એ તેના પૂર્વવર્તી કરતા નોંધપાત્ર સુધારો દર્શાવ્યો છે; 15 પ્રયત્નો પછી, હુમલાખોરની સફળતાનો દર 5.5% (Opus 4.8 માં જોવા મળ્યો હતો) થી ઘટીને માત્ર 2.0% થઈ ગયો છે.
આ પ્રદર્શન Opus 5 ને Gray Swan IPI બેન્ચમાર્કની ટોચ પર લાવે છે, જે Mythos 5 (2.6%) અને Fable 5 (2.8%) જેવા અન્ય હાઈ-ટિયર મોડેલ્સ કરતા વધુ સારું પ્રદર્શન કરે છે.
સિક્રેટ સોસ: Auto Mode અને ડ્યુઅલ-લેયર ડિફેન્સ
આ સફળતા માત્ર મોડેલની બુદ્ધિને કારણે નથી, પરંતુ વિશિષ્ટ સોફ્ટવેર સાથેના તેના સંકલનને કારણે છે. "શૂન્ય ટકા" સફળતાનો દર ખાસ કરીને Claude Cowork જેવા ઉત્પાદનોમાં Auto Mode ના ઉપયોગ સાથે જોડાયેલ છે. Anthropic એજન્ટને સુરક્ષિત કરવા માટે એક અત્યાધુનિક બે-સ્તરીય ડિફેન્સ આર્કિટેક્ચરનો ઉપયોગ કરે છે:
- Pre-processing Scan: મુખ્ય LLM ટેક્સ્ટ પ્રોસેસ કરે તે પહેલાં એક સમર્પિત લેયર તમામ આવતા ડેટામાં છુપાયેલી અથવા હેરાફેરી કરતી સૂચનાઓ માટે સ્કેન કરે છે.
- Execution Blocking: એક ગૌણ લેયર એજન્ટના નિર્ધારિત કાર્યો પર દેખરેખ રાખે છે, બ્રાઉઝર એન્વાયરમેન્ટમાં કોઈપણ જોખમી કમાન્ડ્સ અમલમાં આવે તે પહેલાં તેને બ્લોક કરે છે.
રસપ્રદ વાત એ છે કે, ડેટા દર્શાવે છે કે માત્ર મોડેલ જ સંપૂર્ણ ઉકેલ (silver bullet) નથી. આ સુરક્ષા સોફ્ટવેર લેયર્સ વિના, Opus 5 ની નબળાઈ 3.7% છે. વાસ્તવમાં, વિશિષ્ટ Sonnet 5 મોડેલ અલગ રીતે 0.93% સફળતા દર સાથે થોડું વધુ સારું પ્રદર્શન કરે છે. મુખ્ય મોડેલ અને ડિફેન્સિવ સોફ્ટવેર સ્ટેક વચ્ચેનું સંકલન જ સુરક્ષાના સ્તરને લગભગ સંપૂર્ણતા સુધી લઈ જાય છે.
AI ના ભવિષ્ય માટે આ શા માટે મહત્વનું છે
ઓટોનોમસ AI એજન્ટ્સ બનાવતા ડેવલપર્સ અને ફાઉન્ડર્સ માટે, આ વિકાસ એક મૂળભૂત પરિવર્તન (paradigm shift) છે. જો પ્રોમ્પ્ટ ઇન્જેક્શનને માત્ર મોડેલ ટ્રેનિંગને બદલે આર્કિટેક્ચરલ લેયર્સ દ્વારા નિષ્પ્રિય કરી શકાય, તો વિશ્વસનીય, "agentic" વર્કફ્લો તરફનો માર્ગ—જ્યાં AI ઈમેલ, બ્રાઉઝર્સ અને સંવેદનશીલ ડેટાનું સંચાલન કરે છે—ખૂબ જ સુરક્ષિત બની જાય છે. Anthropic એ એક બ્લુપ્રિન્ટ પૂરી પાડી છે કે કેવી રીતે ઉદ્યોગ "અસંભવિત" ના કથનથી આગળ વધીને મજબૂત, પ્રોડક્શન-રેડી AI સ્વાયત્તતા તરફ આગળ વધી શકે છે.
મુખ્ય મુદ્દાઓ
- ઉદ્યોગ-અગ્રણી સુરક્ષા: Auto Mode નો ઉપયોગ કરતી વખતે Opus 5 એ 129 બ્રાઉઝર-આધારિત પ્રોમ્પ્ટ ઇન્જેક્શન પરિસ્થિતિઓમાં 0% સફળતા દર હાંસલ કર્યો.
- Defense-in-Depth: સુરક્ષા પ્રી-પ્રોસેસિંગ ડેટા સ્કેન અને સક્રિય એક્શન બ્લોકિંગ સાથેના ડ્યુઅલ-લેયર અભિગમ દ્વારા પ્રાપ્ત કરવામાં આવી છે.
- બેન્ચમાર્ક પ્રભુત્વ: Opus 5 Gray Swan IPI બેન્ચમાર્કનું નેતૃત્વ કરે છે, જે અગાઉના મોડેલ સંસ્કરણોની સરખામણીમાં હુમલાખોરની સફળતાના દરને નોંધપાત્ર રીતે ઘટાડે છે.
