நீங்கள் ஒரு நிதிச் சேவை நிறுவனத்தில் மூத்த பயன்பாட்டுப் பாதுகாப்புப் பொறியாளர் (senior application security engineer) என்று கற்பனை செய்து பாருங்கள். நீங்கள் உள்நாட்டிலேயே உருவாக்கப்பட்ட அங்கீகாரக் குறியீட்டின் (authentication code) ஒரு பகுதியை ஒரு முன்னணி AI மாதிரியில் (frontier AI model) உள்ளீடு செய்து, அதில் உள்ள தர்க்கக் குறைபாடுகளை (logic flaws) கண்டறியச் சொல்கிறீர்கள். ஆனால் பகுப்பாய்விற்குப் பதிலாக, உங்களுக்கு ஒரு அறிவுரை கிடைக்கிறது. அந்தத் தகவலை நீங்கள் "ஒரு அமைப்பைச் சுரண்டுவதற்கு" (exploit a system) பயன்படுத்தக்கூடும் என்ற காரணத்தைக் கூறி அந்த மாதிரி மறுக்கிறது. நீங்கள் ஒரு குற்றவாளி அல்ல. குற்றவாளிகளைத் தடுப்பதற்காகவே பணியமர்த்தப்பட்டவர் நீங்கள். இருப்பினும், பாதுகாப்பு விதிமுறைகள் (guardrails) இருவரையும் வேறுபடுத்திப் பார்க்கத் தவறிவிடுகின்றன.

இந்தச் சூழல் இப்போது வழக்கமாகி வருகிறது. தீய நோக்கங்களுக்காகத் தவறாகப் பயன்படுத்துவதைத் தடுக்க பெரிய AI ஆய்வகங்கள் பாதுகாப்பு நெறிமுறைகளை (safety protocols) இறுக்கமாக்கும்போது, அவை முறையான இணையப் பாதுகாப்பு நிபுணர்களின் (cybersecurity professionals) பணிப்பாய்வுகளுடன் (workflows) நேரடியாக மோதிக்கொள்கின்றன. இதன் விளைவாக ஒரு வளர்ந்து வரும் முரண்பாடு உருவாகிறது: மென்பொருள் பொறியியலுக்கான பலமடங்குத் திறன் தரும் கருவிகளாகப் பிரச்சாரம் செய்யப்படும் அதே கருவிகள், முக்கியமான உள்கட்டமைப்பைப் பாதுகாக்கும் நிபுணர்களிடமிருந்து தடுத்து நிறுத்தப்படுகின்றன.

பாதுகாப்பு மற்றும்ப் பாதுகாப்பிற்கு இடையிலான உராய்வு

முக்கிய AI மேம்பாட்டாளர்கள் இணையப் பாதுகாப்பு சமூகத்தை முற்றிலும் புறக்கணித்துவிடவில்லை. OpenAI நிறுவனம் Trusted Access for Cyber என்ற திட்டத்தை நடத்துகிறது. Anthropic நிறுவனம் ஒரு Cyber Verification Program-ஐ இயக்குகிறது. இவை இரண்டும் சரிபார்க்கப்பட்ட பயனர்கள் சில மறுப்பு வழிமுறைகளைத் (refusal mechanisms) தவிர்த்து, முறையான ஆராய்ச்சிகளை மேற்கொள்ள அனுமதிக்கும் வகையில் வடிவமைக்கப்பட்டுள்ளன. கோட்பாட்டளவில், இந்த நுழைவாயில்கள் நல்லவர்களைத் தீயவர்களிடமிருந்து பிரிக்கின்றன.

நடைமுறையில், பல தாக்குதல் சார்ந்த பாதுகாப்பு ஆராய்ச்சியாளர்கள் (offensive security researchers) மற்றும் நெட்வொர்க் பாதுகாப்பாளர்கள் (network defenders) இவற்றை நிர்வாகத் தடைகளாகவே உணர்கிறார்கள். சரிபார்க்கும் செயல்முறைகள் வெளிப்படையற்றதாக இருக்கலாம். ஒப்புதல் பெறும் காலக்கெடு தெளிவற்றதாக இருக்கலாம். அங்கீகரிக்கப்பட்ட பின்னரும் கூட, பல்வேறு மாதிரி பதிப்புகள் அல்லது உரையாடல் தொடர்களில் (conversation threads) மேம்படுத்தப்பட்ட அணுகல் எப்போதும் நம்பகமானதாகச் செயல்படுவதில்லை என்று ஆராய்ச்சியாளர்கள் தெரிவிக்கின்றனர். தீவிரத் தாக்குதல்களின் போது பாதிப்புகளை (vulnerabilities) விரைவாகச் சரிசெய்யப் போராடும் குழுக்களுக்கு, இந்தத் தடை பெரும் பாதிப்பை ஏற்படுத்துகிறது.

வாஷிங்டனுக்கும் சிலிக்கான் வேலிக்கும் இடையிலான பதற்றம், அமெரிக்க அரசாங்கம் Anthropic நிறுவனத்தின் Mythos மற்றும் Fable மாதிரிகள் மீது ஏற்றுமதி கட்டுப்பாடுகளை விதித்தபோது ஒரு குறிப்பிடத்தக்க உச்சத்தை எட்டியது. தனிநபர்கள் இணையத் தாக்குதல்களைத் தூண்டுவதற்காக மாதிரிகளின் பாதுகாப்பு விதிமுறைகளைத் (safety guardrails) தந்திரமாகத் தவிர்த்ததாக வந்த அறிக்கைகளைத் தொடர்ந்து இந்தத் தடைகள் விதிக்கப்பட்டன. இந்த அமைப்புகளைத் தனித்துவமான ஆபத்தான ஏற்றுமதிப் பொருட்களாகக் கருத ஒழுங்குமுறை அமைப்புகள் விரைந்து செயல்பட்டன. இந்தக் கட்டுப்பாடுகள் பின்னர் நீக்கப்பட்டன அல்லது மாற்றியமைக்கப்பட்டன, ஆனால் இந்தச் சம்பவம் ஒரு தெளிவான செய்தியை அனுப்பியது: அதிகத் திறன் கொண்ட AI மாதிரிகள் பொதுவான தொழில்நுட்பக் கருவிகளாகப் பார்க்கப்படாமல், சாத்தியமான பேரழிவை ஏற்படுத்தும் கருவிகளாக (doomsday devices) அதிகளவில் பார்க்கப்படுகின்றன. அவற்றின் மீது நம்பியிருக்கும் பாதுகாப்பாளர்களாகிய அவர்களுக்கு, இந்தத் பார்வை அதிகக் கண்காணிப்பு, மெதுவான அணுகல் மற்றும் பாதுகாப்பு ஆராய்ச்சி என்பது மற்றொரு பெயரில் செய்யப்படும் ஹேக்கிங் (hacking) என்ற அடிப்படைச் சந்தேகமாக மாறுகிறது.

ஏன் பாதுகாப்பும் தாக்குதலும் பிரிக்க முடியாதவை

இந்த மோதலின் மையம் நிர்வாக ரீதியானது அல்ல. இது தொழில்நுட்ப ரீதியானது. ஒரு நெட்வொர்க்கைப் பாதுகாப்பதற்குத் தேவைப்படும் அதே திறன்கள், அதைத் தாக்குவதற்குத் தேவைப்படும் திறன்களுக்கு இணையானவை.

NCC Group நிறுவனத்தின் தலைமை விஞ்ஞானி Chris Anley ஒரு எளிய உதாரணத்தைப் பயன்படுத்துகிறார்: AI என்பது ஒரு சுத்தியல் போன்றது. அதைப் பயன்படுத்தி நீங்கள் ஒரு வீட்டைக் கட்டலாம் அல்லது ஒரு ஜன்னலை உடைக்கலாம். அந்தத் கருவிக்குத் வித்தியாசம் தெரியாது. இணையப் பாதுகாப்பில், இந்த இரட்டைத் தன்மை தவிர்க்க முடியாதது. ஒரு நிபுணர் ஒரு மாதிரியிடம் "இந்தக் குறியீட்டைச் சரிசெய்" (fix this code) என்று கேட்கும்போது, அந்தத் தேவை ஒரு பாதுகாப்பு நடவடிக்கையைத் தூண்டுகிறது. ஆனால் அந்தத் திருத்தத்தை உருவாக்கும் பகுப்பாய்வு செயல்முறை—பாதுகாப்பற்ற செயல்பாடுகளைக் கண்டறிதல், நம்பகமற்ற உள்ளீடுகளைக் (untrusted input) கண்டறிதல், செயல்பாட்டு ஓட்டங்களை (execution flows) வரைபடமாக்குதல்—அந்தப் பாதிப்பை எவ்வாறு தூண்ட முடியும் என்பதைத் தவிர்க்க முடியாமல் வெளிச்சம் போட்டுக் காட்டுகிறது. அந்த விளக்கம் தாக்குதலுக்கான ஒரு வரைபடமாக (roadmap) அமைகிறது.

AI பாதுகாப்புத் குழுக்கள் பெரும்பாலும் சுரண்டுதல் (exploitation) போன்றத் தொனியில் இருக்கும் எந்தவொரு தூண்டுதலையும் (prompt) நிராகரிக்கும் வகையில் மாதிரிகளுக்குப் பயிற்சியளிப்பதால், இந்த அமைப்புகள் அடிக்கடி மிகைப்பயன்பாடு (overcorrect) செய்கின்றன. பயனர் உள்ளீட்டை எவ்வாறு தூய்மைப்படுத்துவது (sanitize user input) என்று கேட்கும் ஒரு ஆராய்ச்சியாளருக்குப் பதில் கிடைக்கிறது. ஆனால் ஒரு ஆராய்ச்சியாளர் எவ்வாறு a