பிரவுசர் ப்ராம்ப்ட் இன்ஜெக்ஷன்களில் Anthropic-ன் Opus 5 பூஜ்ஜிய சதவீத வெற்றியைப் பதிவு செய்துள்ளது
Opus 5-ன் வெளியீட்டுடன், Anthropic நிறுவனம் AI பாதுகாப்பில் ஒரு மகத்தான முன்னேற்றத்தை ஏற்படுத்தியுள்ளது, இது தன்னாட்சி முகவர்களின் (autonomous agents) மிகவும் தொடர்ச்சியான பாதிப்புகளில் ஒன்றைத் தீர்க்கக்கூடும். ஒரு இரு அடுக்கு பாதுகாப்பு அமைப்பை (dual-layer defense system) செயல்படுத்துவதன் மூலம், பிரவுசர் சார்ந்த ப்ராம்ப்ட் இன்ஜெக்ஷன் தாக்குதல்களுக்கு எதிராக இந்த மாடல் கிட்டத்தட்ட முழுமையான பாதுகாப்பைக் காட்டியுள்ளது.
AI முகவர்களில் ஏற்படும் ப்ராம்ப்ட் இன்ஜெக்ஷன் நெருக்கடி
தற்போதைய AI யுகத்தின் "அகிலிஸ் ஹீல்" (Achilles' heel - பலவீனமான புள்ளி) ஆக ப்ராம்ப்ட் இன்ஜெக்ஷன் தொடர்கிறது. ஒரு தாக்குதல் நடத்துபவர் இணையப் பக்கத்திற்குள்—பெரும்பாலும் கண்ணுக்குத் தெரியாத உரையின் மூலம்—தீங்கு விளைவிக்கும் அறிவுறுத்தல்களை மறைத்து வைக்கும்போது இந்த பாதிப்பு ஏற்படுகிறது; ஒரு AI முகவர் இணையத்தைப் பயன்படுத்தும்போது இதைப் படிக்கிறது. இவை செயலாக்கப்பட்டவுடன், இந்த அறிவுறுத்தல்கள் மாடலைத் தடம்மாற்றி (hijack), பாதுகாப்பு நெறிமுறைகளைத் தவிர்க்கவோ அல்லது அங்கீகரிக்கப்படாத செயல்களைச் செய்யவோ கட்டாயப்படுத்தலாம். OpenAI போன்ற முன்னணி நிறுவனங்கள், ப்ராம்ப்ட் இன்ஜெக்ஷன் என்பது LLM-களின் தீர்க்க முடியாத உள்ளார்ந்த குறைபாடு என்று முன்பு குறிப்பிட்டிருந்தாலும், Anthropic-ன் சமீபத்திய தரவுகள் அந்த எதிர்மறையான பார்வையை சவாலுக்கு உட்படுத்துகின்றன.
பூஜ்ஜிய சதவீத இலக்கை எட்டியது
Anthropic-ன் சிஸ்டம் கார்டு (system card) படி, பிரவுசர் முகவர்களுக்காக பிரத்யேகமாக வடிவமைக்கப்பட்ட 129 வெவ்வேறு சோதனைச் சூழல்களில், Opus 5 வியக்கத்தக்க வகையில் 0% தாக்குதல் வெற்றி விகிதத்தைப் பதிவு செய்துள்ளது. இது முந்தைய பதிப்புகளை விட ஒரு குறிப்பிடத்தக்க முன்னேற்றமாகும். பாதுகாப்பு நிறுவனமான Gray Swan நடத்திய பொதுவான ப்ராம்ப்ட் இன்ஜெக்ஷன் சோதனையில், Opus 5 தனது முந்தைய மாடலை விட வியத்தகு முன்னேற்றத்தைக் காட்டியது; 15 முயற்சிகளுக்குப் பிறகு, தாக்குதல் வெற்றி விகிதம் 5.5%-லிருந்து (Opus 4.8-ல் காணப்பட்டது) வெறும் 2.0% ஆகக் குறைந்தது.
இந்தச் செயல்பாடு Opus 5-ஐ Gray Swan IPI பெஞ்ச்மார்க்கில் (benchmark) முதலிடத்திற்கு கொண்டு செல்கிறது, மேலும் இது Mythos 5 (2.6%) மற்றும் Fable 5 (2.8%) போன்ற பிற உயர்தர மாடல்களை விடச் சிறப்பாகச் செயல்படுகிறது.
ரகசியத் தந்திரம்: Auto Mode மற்றும் இரு அடுக்கு பாதுகாப்பு
இந்த முன்னேற்றம் மாடலின் புத்திசாலித்தனத்தால் மட்டும் நிகழ்ந்ததல்ல, மாறாக சிறப்பு மென்பொருட்களுடனான அதன் ஒருங்கிணைப்பால் நிகழ்ந்தது. இந்த "பூஜ்ஜிய சதவீத" வெற்றி விகிதம், Claude Cowork போன்ற தயாரிப்புகளில் உள்ள Auto Mode பயன்பாட்டுடன் நேரடியாகத் தொடர்புடையது. முகவரைப் பாதுகாப்பதற்காக Anthropic ஒரு சிக்கலான இரு அடுக்கு பாதுகாப்பு கட்டமைப்பைப் பயன்படுத்துகிறது:
- Pre-processing Scan: முதன்மை LLM உரையைச் செயலாக்குவதற்கு முன்பே, வரும் அனைத்துத் தரவுகளையும் மறைக்கப்பட்ட அல்லது கையாளப்பட்ட அறிவுறுத்தல்களுக்காக ஒரு பிரத்யேக அடுக்கு ஸ்கேன் செய்கிறது.
- Execution Blocking: ஒரு இரண்டாம் அடுக்கு முகவரின் திட்டமிடப்பட்ட செயல்களைக் கண்காணிக்கிறது, பிரவுசர் சூழலில் அவை செயல்படுத்தப்படுவதற்கு முன்பே ஏதேனும் ஆபத்தான கட்டளைகளைத் தடுக்கிறது.
சுவாரஸ்யமாக, மாடல் மட்டுமே இதற்குத் தீர்வாகாது என்பதைத் தரவுகள் காட்டுகின்றன. இந்த பாதுகாப்பு மென்பொருள் அடுக்குகள் இல்லையென்றால், Opus 5-ன் பாதிப்பு விகிதம் 3.7% ஆக இருக்கும். உண்மையில், தனித்துச் செயல்படும்போது சிறப்பு Sonnet 5 மாடல் 0.93% வெற்றி விகிதத்துடன் சற்று சிறப்பாகச் செயல்படுகிறது. மைய மாடல் மற்றும் பாதுகாப்பு மென்பொருள் அடுக்கு ஆகியவற்றிற்கு இடையிலான ஒருங்கிணைப்பே (synergy) பாதுகாப்பை கிட்டத்தட்ட முழுமையடையச் செய்கிறது.
AI-ன் எதிர்காலத்திற்கு இது ஏன் முக்கியமானது
தன்னாட்சி AI முகவர்களை உருவாக்கும் டெவலப்பர்கள் மற்றும் நிறுவனர்களுக்கு (founders), இந்த வளர்ச்சி ஒரு மிகப்பெரிய மாற்றமாகும் (paradigm shift). மாடல் பயிற்சியை விட, கட்டமைப்பு அடுக்குகளின் (architectural layers) மூலம் ப்ராம்ப்ட் இன்ஜெக்ஷனை முறியடிக்க முடிந்தால், AI மின்னஞ்சல்கள், பிரவுசர்கள் மற்றும் முக்கியமான தரவுகளைக் கையாளும் நம்பகமான "ஏஜென்டிக்" (agentic) பணிப்பாய்வுகளை (workflows) உருவாக்குவது மிகவும் பாதுகாப்பானதாக மாறும். "தீர்க்க முடியாதது" என்ற கருத்திலிருந்து விலகி, வலுவான மற்றும் பயன்பாட்டிற்குத் தயாரான AI தன்னாட்சியை நோக்கித் தொழில்துறை எவ்வாறு நகர முடியும் என்பதற்கான ஒரு வரைபடத்தை (blueprint) Anthropic வழங்கியுள்ளது.
முக்கியக் குறிப்புகள்
- தொழில்துறையில் முன்னணியில் உள்ள பாதுகாப்பு: Auto Mode-ஐப் பயன்படுத்தும்போது, 129 பிரவுசர் சார்ந்த ப்ராம்ப்ட் இன்ஜெக்ஷன் சூழல்களில் Opus 5 0% வெற்றி விகிதத்தை எட்டியது.
- ஆழமான பாதுகாப்பு (Defense-in-Depth): தரவு முன்-செயலாக்க ஸ்கேன்கள் மற்றும் செயலற்ற நடவடிக்கை தடுப்பு ஆகியவற்றை உள்ளடக்கிய இரு அடுக்கு அணுகுமுறை மூலம் இந்த பாதுகாப்பு அடையப்படுகிறது.
- பெஞ்ச்மார்க் ஆதிக்கம்: Opus 5, Gray Swan IPI பெஞ்ச்மார்க்கில் முன்னணியில் உள்ளது, மேலும் முந்தைய மாடல் பதிப்புகளை விட தாக்குதல் வெற்றி விகிதத்தை கணிசமாகக் குறைத்துள்ளது.
