சைபர் தாக்குதல்களில் அமெரிக்காவின் முன்னணி மாடல்களுக்குப் பின் தங்கியுள்ள Kimi K3: டிஸ்டிலேஷன் (Distillation) இடைவெளி

பிரிட்டிஷ் AI பாதுகாப்பு நிறுவனம் (UK AISI) மற்றும் அமெரிக்க AI தரநிலைகள் மற்றும் கண்டுபிடிப்பு மையம் (CAISI) ஆகியவற்றின் கூட்டு மதிப்பீடு, சீன மற்றும் அமெரிக்க AI மாடல்களுக்கு இடையிலான ஆக்ரோஷமான சைபர் செயல்பாடுகளில் (offensive cyber operations) ஒரு குறிப்பிடத்தக்க திறன் இடைவெளியை வெளிப்படுத்தியுள்ளது. Moonshot AI-ன் Kimi K3 நம்பிக்கையளிப்பதாக இருந்தாலும், சிக்கலான மென்பொருள் சுரண்டல் (software exploitation) மற்றும் நெட்வொர்க் தாக்குதல்கள் போன்ற பணிகளில் முன்னணி அமெரிக்க மாடல்களை விட இது கணிசமாகப் பின் தங்கியுள்ளது.

ExploitBench: பாதிப்பு ஆராய்ச்சித் துறையில் உள்ள இடைவெளி

சுரண்டல் மேம்பாட்டுத் திறன்களை (exploit development skills) அளவிட, ஆராய்ச்சியாளர்கள் கார்னகி மெலன் பல்கலைக்கழகத்தின் ExploitBench என்ற அளவுகோலைப் பயன்படுத்தினர். இதில் 2023-க்குப் பிறகு Chrome-ன் V8 என்ஜினில் கண்டறியப்பட்ட 41 பாதிப்புகள் (vulnerabilities) இடம்பெற்றுள்ளன. இதன் முடிவுகள் செயல்பாட்டுத் திறனில் ஒரு பெரிய வேறுபாட்டைச் சுட்டிக்காட்டுகின்றன. முன்னணி அமெரிக்க மாடல்கள் சராசரியாக 76.2% மதிப்பெண்களைப் பெற்றன, ஆனால் Kimi K3 32.2% என்ற மிகக் குறைந்த மதிப்பெண்ணையே பெற்றது. Kimi K3 சீனாவின் GLM-5.2 (24.4%) ஐ விடச் சிறப்பாகச் செயல்பட்டாலும், சுரண்டலின் மிக உயர்ந்த நிலையான Arbitrary Code Execution (ACE)-ஐ எட்டத் தவறிவிட்டது.

இதற்கு நேர்மாறாக, உயர்தர அமெரிக்க மாடல்கள் சோதிக்கப்பட்ட 41 பணிகளில் 20 பணிகளில் வெற்றிகரமாக ACE-ஐச் சாதித்தன, இது இலக்கு அமைப்புகளின் மீது முழுமையான கட்டுப்பாட்டை வழங்குகிறது—இந்தச் சிக்கலான நுணுக்கத்தை Kimi K3-ஆல் நகலெடுக்க முடியவில்லை.

"The Last Ones" மூலம் நெட்வொர்க் தாக்குதல்களைச் உருவகப்படுத்துதல்

இந்த மதிப்பீட்டில் "The Last Ones" (TLO) என்ற முறையையும் பயன்படுத்தி மாடல்கள் சோதிக்கப்பட்டன. இது நான்கு துணை நெட்வொர்க்குகளில் (subnets) 20 ஹோஸ்ட்களை உள்ளடக்கிய, சிக்கலான 32-படிநிலை கார்ப்பரேட் நெட்வொர்க் தாக்குதலின் உருவகமாகும் (simulation). ஒரு ஏஜென்ட் (agent) பல கட்ட ஊடுருவல் பாதைகளை (multi-stage intrusion paths) கையாளும் திறனை அளவிடுவதற்காக இந்தத் தேர்வு வடிவமைக்கப்பட்டுள்ளது.

Kimi K3 32 படிகளில் சராசரியாக 17 படிகளை மட்டுமே எட்டியது, இது ஒரு நடுத்தரத் திறனை வெளிப்படுத்துகிறது. பத்து முயற்சிகளில் ஒன்றில் இது முழுமையான தாக்குதல் பாதையை முடித்தாலும், சராசரியாக 28.5 படிகளைச் செய்த அமெரிக்க மாடல்களின் நிலைத்தன்மை (consistency) இதற்கு இல்லை. பலவீனமான பாதுகாப்பு கொண்ட நிறுவன அமைப்புகளைத் தானாகத் தாக்கும் திறன் Kimi K3-க்கு இருந்தாலும், சிக்கலான, நீண்ட சங்கிலித் தொடர் செயல்பாடுகளைச் (long-chain operations) செய்வதற்குத் தேவையான நம்பகத்தன்மை மேற்கத்திய முன்னணி மாடல்களைப் போல இதற்கு இல்லை என்று இந்த முடிவுகள் தெரிவிக்கின்றன.

டிஸ்டிலேஷன் கோட்பாடு (The Distillation Theory): இந்த இடைவெளி ஏன் உள்ளது?

ஒரு முக்கியமான கேள்வி எஞ்சியிருக்கிறது: பொதுவான அளவுகோல்களில் (general benchmarks) சிறப்பாகச் செயல்பட்டாலும், சைபர் பணிகளில் சீன மாடல்கள் ஏன் பின் தங்கியிருக்கின்றன? இதற்கு "டிஸ்டிலேஷன்" (distillation) காரணமாக இருக்கலாம் என்று அறிக்கை கூறுகிறது—அதாவது, முன்னணி மாடல்களிலிருந்து (Anthropic-ன் Claude போன்ற) பெறப்பட்ட உயர்தர வெளியீடுகளைப் பயிற்சித் தரவாகப் பயன்படுத்தும் நடைமுறை இதுவாகும்.

Moonshot AI, Kimi K3-ஐப் பயிற்றுவிக்க டிஸ்டிலேஷன் முறையைப் பயன்படுத்தியிருந்தால், அவர்கள் முக்கியமான சைபர்-தாக்குதல் தரவுகளைத் தவறவிட்டிருக்க வாய்ப்புள்ளது. முன்னணி அமெரிக்க மாடல்கள் மேம்பட்ட ஆக்ரோஷமான வினவல்களைத் (offensive queries) தடுக்கும் கடுமையான பாதுகாப்பு வகைப்படுத்திகளைப் (safety classifiers) பயன்படுத்துகின்றன. இதன் விளைவாக, இந்த மாடல்களின் பொது வெளியீடுகளிலிருந்து உருவாக்கப்பட்ட தரவுத்தொகுப்பு (dataset), உயர்மட்டச் சுரண்டலுக்குத் தேவையான அறிவை இயற்கையாகவே கொண்டிருக்காது. இதனால்தான் Kimi K3 பொதுவான நிரலாக்கம் (programming) மற்றும் தர்க்கரீதியான சிந்தனையில் (reasoning) மேற்கத்திய மாடல்களுக்கு இணையாகச் செயல்பட்டாலும், சிறப்பு வாய்ந்த ஆக்ரோஷமான சைபர் பணிகளில் கணிசமாகத் தோல்வியடைகிறது என்பது விளக்கமளிக்கப்படுகிறது.

வளர்ந்து வரும் திறன்களும் தொடர்ச்சியான அபாயங்களும்

தற்போதைய இடைவெளி இருந்தபோதிலும், அமெரிக்க மற்றும் சீன மாடல்கள் இரண்டுமே முன்னேற்றப் பாதையில் (upward Elo-based trajectory) உள்ளன என்று CAISI-ன் காலவரிசை ஆய்வு காட்டுகிறது. திறந்தநிலை மாடல்களுக்கான (open models) செயல்திறன் இடைவெளியானது, 2025 தொடக்கத்தில் ஆறு முதல் பத்து மாதங்களாக இருந்தது, தற்போது நான்கு முதல் ஏழு மாதங்களாகக் குறைந்துள்ளது. இந்த இடைவெளி குறைவது பாதுகாப்பிற்குச் சமம் அல்ல என்று UK AISI எச்சரிக்கிறது; திறந்த எடை கொண்ட மாடல்களின் (open-weight models) வளர்ந்து வரும் திறன்கள், உலகளாவிய சைபர் பாதுகாப்பு சூழலில் "தொடர்ச்சியான மற்றும் மாற்ற முடியாத தவறான பயன்பாட்டு அபாயத்தை" (persistent and irreversible risk of misuse) குறிக்கின்றன.

முக்கியக் குறிப்புகள்

  • சைபர் செயல்திறன் இடைவெளி: ExploitBench-இல் Kimi K3 32.2% மதிப்பெண்களைப் பெற்றது, இது முன்னணி அமெரிக்க மாடல்களின் 76.2% சராசரியை விடக் கணிசமாகக் குறைவு; மேலும் இது Arbitrary Code Execution (ACE)-ஐச் சாதிக்கத் தவறிவிட்டது.
  • நெட்வொர்க் தாக்குதல் திறன்: TLO உருவகப்படுத்துதல்களில், Kimi K3 32-படிநிலை தாக்குதல் பாதையில் சராசரியாக 17 படிகளை மட்டுமே எட்டியது; இது பாதிப்புள்ள அமைப்புகளைத் தாக்க முடியும் என்பதை நிரூபித்தாலும், உயர்தர அமெரிக்க மாடல்களின் நம்பகத்தன்மை இதற்கு இல்லை.
  • டிஸ்டிலேஷனின் பங்கு: சைபர் திறன்களில் உள்ள பற்றாக்குறை டிஸ்டிலேஷன் நடைமுறைகளிலிருந்து உருவாகலாம்; ஏனெனில் Claude போன்ற மாடல்களின் தணிக்கை செய்யப்பட்ட பொது வெளியீடுகளைக் கொண்டு பயிற்றுவிப்பது, மேம்பட்ட சுரண்டலுக்குத் தேவையான ஆக்ரோஷமான தரவுகளைக் கொண்டிருக்காது.