സൈബർ എക്സ്പ്ലോയിറ്റുകളിൽ Kimi K3 അമേരിക്കൻ ഫ്രോണ്ടിയർ മോഡലുകൾക്ക് പിന്നിൽ: ഡിസ്റ്റിലേഷൻ ഗ്യാപ്പ്

ബ്രിട്ടീഷ് AI സെക്യൂരിറ്റി ഇൻസ്റ്റിറ്റ്യൂട്ടും (UK AISI), യു.എസ്. സെന്റർ ഫോർ AI സ്റ്റാൻഡേർഡ്സ് ആൻഡ് ഇന്നൊവേഷനും (CAISI) നടത്തിയ സംയുക്ത വിലയിരുത്തൽ, ചൈനീസ്, യു.എസ്. AI മോഡലുകൾ തമ്മിലുള്ള ആക്രമണാത്മക സൈബർ പ്രവർത്തനങ്ങളിലെ (offensive cyber operations) വലിയ ശേഷി വ്യത്യാസം വെളിപ്പെടുത്തിയിരിക്കുന്നു. Moonshot AI-യുടെ Kimi K3 പ്രതീക്ഷാജനകമാണെങ്കിലും, സങ്കീർണ്ണമായ സോഫ്റ്റ്‌വെയർ എക്സ്പ്ലോയിറ്റേഷനുകളും നെറ്റ്‌വർക്ക് ആക്രമണങ്ങളും നടത്തുന്നതിൽ അത് അമേരിക്കൻ ഫ്രോണ്ടിയർ മോഡലുകളെ അപേക്ഷിച്ച് ഗണ്യമായി പിന്നിലാണ്.

ExploitBench: സുരക്ഷാ വീഴ്ചകൾ സംബന്ധിച്ച ഗവേഷണത്തിലെ വ്യത്യാസം

എക്സ്പ്ലോയിറ്റ് വികസന ശേഷി അളക്കുന്നതിനായി, ഗവേഷകർ കാർണഗി മെലോൺ സർവ്വകലാശാലയുടെ ExploitBench ഉപയോഗിച്ചു. 2023-ന് ശേഷം Chrome-ന്റെ V8 എൻജിനിൽ കണ്ടെത്തിയ 41 സുരക്ഷാ വീഴ്ചകൾ (vulnerabilities) ഇതിൽ ഉൾപ്പെടുന്നു. ഇതിന്റെ ഫലങ്ങൾ പ്രകടനത്തിൽ വലിയ വ്യത്യാസം കാണിക്കുന്നു. മുൻനിര യു.എസ്. മോഡലുകൾ ശരാശരി 76.2% സ്കോർ ചെയ്തപ്പോൾ, Kimi K3 വെറും 32.2% മാത്രമാണ് നേടിയത്. Kimi K3 ചൈനയുടെ GLM-5.2-നെ (24.4%) മറികടന്നെങ്കിലും, ഏറ്റവും ഉയർന്ന നിലവാരത്തിലുള്ള എക്സ്പ്ലോയിറ്റേഷനായ Arbitrary Code Execution (ACE) കൈവരിക്കുന്നതിൽ പരാജയപ്പെട്ടു.

ഇതിനു വിപരീതമായി, മുൻനിര യു.എസ്. മോഡലുകൾ പരീക്ഷിച്ച 41 ടാസ്ക്കുകളിൽ 20 എണ്ണത്തിലും വിജയകരമായി ACE കൈവരിക്കുകയും ലക്ഷ്യമിട്ട സിസ്റ്റങ്ങളുടെ പൂർണ്ണ നിയന്ത്രണം നേടുകയും ചെയ്തു—Kimi K3-ന് എത്തിപ്പിടിക്കാൻ കഴിയാത്ത അത്രയും ഉയർന്ന സങ്കീർണ്ണതയാണിത്.

"The Last Ones" വഴി നെറ്റ്‌വർക്ക് ആക്രമണങ്ങൾ അനുകരിക്കൽ

നാല് സബ്നെറ്റുകളിലായി 20 ഹോസ്റ്റുകൾ ഉൾപ്പെട്ട, 32 ഘട്ടങ്ങളുള്ള സങ്കീർണ്ണമായ ഒരു കോർപ്പറേറ്റ് നെറ്റ്‌വർക്ക് ആക്രമണത്തിന്റെ സിമുലേഷനായ "The Last Ones" (TLO) ഉപയോഗിച്ചും മോഡലുകളെ പരീക്ഷിച്ചു. വിവിധ ഘട്ടങ്ങളിലൂടെയുള്ള കടന്നുകയറ്റ പാതകൾ (multi-stage intrusion paths) കൈകാര്യം ചെയ്യാനുള്ള ഒരു ഏജന്റിന്റെ ശേഷി അളക്കുന്നതിനാണ് ഈ പരീക്ഷണം രൂപകൽപ്പന ചെയ്തിരിക്കുന്നത്.

32 ഘട്ടങ്ങളിൽ ശരാശരി 17 ഘട്ടങ്ങൾ വരെ Kimi K3 പൂർത്തിയാക്കി, ഇത് ഒരു ഇടത്തരം ശേഷിയെയാണ് കാണിക്കുന്നത്. പത്ത് ശ്രമങ്ങളിൽ ഒരെണ്ണത്തിൽ അത് പൂർണ്ണമായ ആക്രമണ പാത പൂർത്തിയാക്കിയെങ്കിലും, ശരാശരി 28.5 ഘട്ടങ്ങൾ പൂർത്തിയാക്കുന്ന യു.എസ്. മോഡലുകളുടെ സ്ഥിരത അതിനുണ്ടായിരുന്നില്ല. ദുർബലമായ സുരക്ഷയുള്ള എൻ്റർപ്രൈസ് സിസ്റ്റങ്ങളെ സ്വയം ആക്രമിക്കാൻ Kimi K3-ന് കഴിയുമെങ്കിലും, സങ്കീർണ്ണവും നീണ്ട ശൃംഖലകളായുള്ളതുമായ പ്രവർത്തനങ്ങൾ നടപ്പിലാക്കാൻ പാശ്ചാത്യ ഫ്രോണ്ടിയർ മോഡലുകൾക്കുള്ള വിശ്വാസ്യത അതിനുണ്ടല്ല എന്ന് കണ്ടെത്തലുകൾ സൂചിപ്പിക്കുന്നു.

ഡിസ്റ്റിലേഷൻ തിയറി: എന്തുകൊണ്ടാണ് ഈ വ്യത്യാസം നിലനിൽക്കുന്നത്?

ഒരു പ്രധാന ചോദ്യം അവശേഷിക്കുന്നു: പൊതുവായ ബെഞ്ച്മാർക്കുകളിൽ മികച്ച പ്രകടനം കാഴ്ചവെക്കുമ്പോഴും ചൈനീസ് മോഡലുകൾ സൈബർ ജോലികളിൽ പിന്നിലായിരിക്കുന്നത് എന്തുകൊണ്ട്? ഫ്രോണ്ടിയർ മോഡലുകളിൽ നിന്നുള്ള (Anthropic-ന്റെ Claude പോലുള്ളവ) ഉയർന്ന നിലവാരമുള്ള ഔട്ട്‌പുട്ടുകൾ പരിശീലന ഡാറ്റയായി ഉപയോഗിക്കുന്ന "ഡിസ്റ്റിലേഷൻ" (distillation) എന്ന രീതി കാരണമാകാം എന്നാണ് റിപ്പോർട്ട് സൂചിപ്പിക്കുന്നത്.

Moonshot AI, Kimi K3-നെ പരിശീലിപ്പിക്കാൻ ഡിസ്റ്റിലേഷൻ ഉപയോഗിച്ചിട്ടുണ്ടെങ്കിൽ, അവർക്ക് നിർണ്ണായകമായ സൈബർ-ഓഫൻസീവ് ഡാറ്റ നഷ്ടപ്പെട്ടിട്ടുണ്ടാകാം. മുൻനിര യു.എസ്. മോഡലുകൾ അത്യാധുനികമായ ആക്രമണാത്മക ചോദ്യങ്ങളെ തടയുന്ന കർശനമായ സുരക്ഷാ ക്ലാസിഫയറുകൾ (safety classifiers) ഉപയോഗിക്കുന്നുണ്ട്. തൽഫലമായി, ഈ മോഡലുകളുടെ പബ്ലിക് ഔട്ട്‌പുട്ടുകളിൽ നിന്ന് നിർമ്മിച്ച ഒരു ഡാറ്റാസെറ്റിൽ ഉയർന്ന നിലവാരത്തിലുള്ള എക്സ്പ്ലോയിറ്റേഷന് ആവശ്യമായ അറിവ് സ്വാഭാവികമായും കുറവായിരിക്കും. പൊതുവായ പ്രോഗ്രാമിംഗിലും റീസണിംഗിലും (reasoning) Kimi K3 പാശ്ചാത്യ മോഡലുകളെപ്പോലെ പ്രവർത്തിക്കുമ്പോഴും, പ്രത്യേകമായ ആക്രമണാത്മക സൈബർ ജോലികളിൽ പരാജയപ്പെടുന്നത് ഇത് വ്യക്തമാക്കുന്നു.

വർദ്ധിച്ചുവരുന്ന ശേഷിയും നിലനിൽക്കുന്ന അപകടസാധ്യതകളും

നിലവിലെ വ്യത്യാസങ്ങൾക്കിടയിലും, യു.എസ്., ചൈനീസ് മോഡലുകൾ രണ്ടും Elo അടിസ്ഥാനത്തിൽ ഉയർച്ചാ പ്രവണതയിലാണെന്ന് CAISI-യുടെ ടൈം-സീരീസ് വിശകലനം കാണിക്കുന്നു. ഓപ്പൺ മോഡലുകൾ തമ്മിലുള്ള പ്രകടന വ്യത്യാസം 2025-ന്റെ തുടക്കത്തിൽ ആറ് മുതൽ പത്ത് മാസം വരെയായിരുന്നുവെങ്കിൽ, അടുത്ത കാലത്തായി അത് നാല് മുതൽ ഏഴ് മാസം വരെയായി കുറഞ്ഞു. ഈ വ്യത്യാസം കുറയുന്നത് സുരക്ഷയുടെ അടയാളമല്ലെന്ന് UK AISI മുന്നറിയിപ്പ് നൽകുന്നു; ഓപ്പൺ-വെയിറ്റ് മോഡലുകളുടെ വർദ്ധിച്ചുവരുന്ന ശേഷി ആഗോള സൈബർ സുരക്ഷാ രംഗത്ത് "ദുരുപയോഗം ചെയ്യപ്പെടാനുള്ള നിരന്തരവും മാറ്റാൻ കഴിയാത്തതുമായ അപകടസാധ്യത" (persistent and irreversible risk of misuse) ഉയർത്തുന്നു.

പ്രധാന കാര്യങ്ങൾ

  • സൈബർ പ്രകടനത്തിലെ വ്യത്യാസം: ExploitBench-ൽ Kimi K3 32.2% സ്കോർ ചെയ്തു, ഇത് മുൻനിര യു.എസ്. മോഡലുകളുടെ ശരാശരി 76.2%-നെ അപേക്ഷിച്ച് വളരെ പിന്നിലാണ്; കൂടാതെ Arbitrary Code Execution (ACE) കൈവരിക്കുന്നതിലും പരാജയപ്പെട്ടു.
  • നെറ്റ്‌വർക്ക് ആക്രമണ ശേഷി: TLO സിമുലേഷനുകളിൽ, 32 ഘട്ടങ്ങളുള്ള ആക്രമണ പാതയിൽ Kimi K3 ശരാശരി 17 ഘട്ടങ്ങൾ പൂർത്തിയാക്കി. ഇത് ദുർബലമായ സിസ്റ്റങ്ങളെ ലക്ഷ്യം വെക്കാൻ ഇതിന് കഴിയുമെങ്കിലും മുൻനിര യു.എസ്. മോഡലുകൾക്കുള്ള വിശ്വാസ്യത ഇതിനില്ലെന്ന് തെളിയിക്കുന്നു.
  • ഡിസ്റ്റിലേഷന്റെ പങ്ക്: സൈബർ നൈപുണ്യത്തിലെ കുറവ് ഡിസ്റ്റിലേഷൻ രീതികളിൽ നിന്ന് ഉണ്ടായതാകാം; Claude പോലുള്ള മോഡലുകളിൽ നിന്നുള്ള സെൻസർ ചെയ്ത പബ്ലിക് ഔട്ട്‌പുട്ടുകൾ ഉപയോഗിച്ച് പരിശീലിപ്പിക്കുമ്പോൾ അത്യാധുനിക എക്സ്പ്ലോയിറ്റേഷന് ആവശ്യമായ ആക്രമണാത്മക ഡാറ്റ (offensive data) ലഭിക്കാതെ വരുന്നു.