સાયબર એક્સપ્લોઇટ્સમાં Kimi K3 અમેરિકન ફ્રન્ટિયર મોડલ્સથી પાછળ: ડિસ્ટિલેશન ગેપ
બ્રિટિશ AI સિક્યુરિટી ઇન્સ્ટિટ્યૂટ (UK AISI) અને યુએસ સેન્ટર ફોર AI સ્ટાન્ડર્ડ્સ એન્ડ ઇનોવેશન (CAISI) દ્વારા કરવામાં આવેલા સંયુક્ત મૂલ્યાંકનમાં ચીની અને અમેરિકન AI મોડલ્સ વચ્ચે ઓફೆન્સિવ સાયબર ઓપરેશન્સમાં નોંધપાત્ર ક્ષમતાનો તફાવત જોવા મળ્યો છે. Moonshot AI નું Kimi K3 આશાસ્પદ દેખાય છે, પરંતુ જ્યારે જટિલ સોફ્ટવેર એક્સપ્લોઇટેશન અને નેટવર્ક હુમલાઓનો કાર્યભાર આપવામાં આવે છે, ત્યારે તે અગ્રણી અમેરિકન ફ્રન્ટિયર મોડલ્સથી નોંધપાત્ર રીતે પાછળ છે.
ExploitBench: Vulnerability Research માં તફાવત
એક્સપ્લોઇટ ડેવલપમેન્ટ કૌશલ્ય માપવા માટે, સંશોધકોએ ExploitBench નો ઉપયોગ કર્યો હતો, જે કાર્નેગી મેલોન યુનિવર્સિટીનું એક બેન્ચમાર્ક છે જેમાં 2023 પછી Chrome ના V8 એન્જિનમાં મળી આવેલી 41 취약점 (vulnerabilities) નો સમાવેશ થાય છે. પરિણામોએ પ્રદર્શનમાં મોટો તફાવત દર્શાવ્યો છે. અગ્રણી યુએસ મોડલ્સનું સરેરાશ સ્કોર 76.2% હતું, જ્યારે Kimi K3 નું સ્કોર નોંધપાત્ર રીતે ઓછું 32.2% હતું. જોકે Kimi K3 એ ચીનના GLM-5.2 (24.4%) કરતા સારું પ્રદર્શન કર્યું હતું, પરંતુ તે એક્સપ્લોઇટેશનના સર્વોચ્ચ સ્તર: Arbitrary Code Execution (ACE) સુધી પહોંચવામાં નિષ્ફળ રહ્યું હતું.
તેનાથી વિપરીત, ટોચના યુએસ મોડલ્સ ટેસ્ટ કરવામાં આવેલા 41 કાર્યોમાંથી 20 માં સફળતાપૂર્વક ACE પ્રાપ્ત કરી શક્યા હતા, જે લક્ષિત સિસ્ટમ્સ પર સંપૂર્ણ નિયંત્રણ આપે છે—આ એક એવું જટિલ સ્તર છે જેનું Kimi K3 અનુકરણ કરી શક્યું નથી.
"The Last Ones" દ્વારા નેટવર્ક હુમલાઓનું સિમ્યુલેશન
મૂલ્યાંકનમાં "The Last Ones" (TLO) નો ઉપયોગ કરીને પણ મોડલ્સનું પરીક્ષણ કરવામાં આવ્યું હતું, જે ચાર સબનેટ્સમાં 20 હોસ્ટ્સ ધરાવતા જટિલ 32-સ્ટેપ કોર્પોરેટ નેટવર્ક હુમલાનું સિમ્યુલેશન છે. આ ટેસ્ટ એજન્ટની મલ્ટી-સ્ટેજ ઇન્ટ્રુઝન પાથ (intrusion paths) ને નેવિગેટ કરવાની ક્ષમતા માપવા માટે ડિઝાઇન કરવામાં આવ્યો છે.
Kimi K3 સરેરાશ 32 માંથી 17 સ્ટેપ્સ સુધી પહોંચ્યું હતું, જે મધ્યમ સ્તરની ક્ષમતા દર્શાવે છે. જોકે તેણે દસ પ્રયત્નોમાંથી એક પ્રયત્નમાં સંપૂર્ણ હુમલાનો માર્ગ પૂર્ણ કર્યો હતો, પરંતુ તેમાં યુએસ મોડલ્સ જેવી સાતત્યતાનો અભાવ હતો, જે સરેરાશ 28.5 સ્ટેપ્સ સુધી પહોંચ્યા હતા. તારણો સૂચવે છે કે જોકે Kimi K3 નબળા રીતે સુરક્ષિત એન્ટરપ્રાઇઝ સિસ્ટમ્સ પર સ્વાયત્ત રીતે હુમલો કરવા માટે સક્ષમ છે, પરંતુ તે જટિલ, લોંગ-ચેઇન કામગીરી કરવા માટે પશ્ચિમી ફ્રન્ટિયર મોડલ્સ જેવી વિશ્વસનીયતા ધરાવતું નથી.
ડિસ્ટિલેશન થિયરી (The Distillation Theory): આ તફાવત કેમ છે?
એક મહત્વપૂર્ણ પ્રશ્ન બાકી છે: જ્યારે ચીની મોડલ્સ જનરલ બેન્ચમાર્ક પર સારું પ્રદર્શન કરે છે, ત્યારે સાયબર કાર્યોમાં કેમ પાછળ રહી જાય છે? રિપોર્ટ સૂચવે છે કે આ "ડિસ્ટિલેશન" (distillation) ને કારણે હોઈ શકે છે—જેમાં ફ્રન્ટિયર મોડલ્સ (જેમ કે Anthropic નું Claude) ના ઉચ્ચ-ગુણવત્તાવાળા આઉટપુટનો ઉપયોગ ટ્રેનિંગ ડેટા તરીકે કરવાની પ્રથા છે.
જો Moonshot AI એ Kimi K3 ને ટ્રેન કરવા માટે ડિસ્ટિલેશનનો ઉપયોગ કર્યો હોય, તો તેઓ કદાચ મહત્વપૂર્ણ સાયબર-ઓફેન્સિવ ડેટા ચૂકી ગયા હશે. અગ્રણી યુએસ મોડલ્સ કડક સેફ્ટી ક્લાસિફાયર્સનો ઉપયોગ કરે છે જે અદ્યતન ઓફೆન્સિવ ક્વેરીઝને બ્લોક કરે છે. પરિણામે, આ મોડલ્સના પબ્લિક આઉટપુટમાંથી બનાવેલ ડેટાસેટમાં ઉચ્ચ-સ્તરના એક્સપ્લોઇટેશન માટે જરૂરી જ્ઞાનનો કુદરતી રીતે જ અભાવ હશે. આ સમજાવે છે કે કેવી રીતે Kimi K3 જનરલ પ્રોગ્રામિંગ અને રીઝનિંગમાં પશ્ચિમી મોડલ્સની બરાબરી કરી શકે છે, જ્યારે વિશિષ્ટ ઓફેન્સિવ સાયબર કાર્યોમાં નોંધપાત્ર રીતે નિષ્ફળ જાય છે.
વધતી ક્ષમતાઓ અને સતત જોખમો
વર્તમાન તફાવત હોવા છતાં, CAISI નું ટાઇમ-સીરીઝ એનાલિસિસ દર્શાવે છે કે યુએસ અને ચીની બંને મોડલ્સ ઉપર તરફના Elo-આધારિત ટ્રેજેક્ટરી પર છે. ઓપન મોડલ્સ માટે પ્રદર્શનનો તફાવત 2025 ની શરૂઆતમાં છ થી દસ મહિનાથી ઘટીને તાજેતરમાં માત્ર ચાર થી સાત મહિનાનો રહી ગયો છે. UK AISI ચેતવણી આપે છે કે આ ઘટતો તફાવત સુરક્ષા સમાન નથી; ઓપન-વેઇટ મોડલ્સની વધતી ક્ષમતાઓ વૈશ્વિક સાયબર સિક્યુરિટી લેન્ડસ્કેપમાં "દુરુપયોગનું સતત અને અફર જોખમ" દર્શાવે છે.
મુખ્ય મુદ્દાઓ
- સાયબર પ્રદર્શનનો તફાવત: Kimi K3 એ ExploitBench પર 32.2% સ્કોર કર્યો હતો, જે અગ્રણી યુએસ મોડલ્સના 76.2% સરેરાશ કરતા નોંધપાત્ર રીતે પાછળ છે, અને તે Arbitrary Code Execution (ACE) પ્રાપ્ત કરવામાં નિષ્ફળ રહ્યું હતું.
- નેટવર્ક હુમલાની ક્ષમતા: TLO સિમ્યુલેશનમાં, Kimi K3 એ 32-સ્ટેપ હુમલાના માર્ગમાં સરેરાશ 17 સ્ટેપ્સ પૂર્ણ કર્યા હતા, જે સાબિત કરે છે કે તે નબળા સિસ્ટમોને ટાર્ગેટ કરી શકે છે પરંતુ તેમાં ટોચના યુએસ મોડલ્સ જેવી વિશ્વસનીયતાનો અભાવ છે.
- ડિસ્ટિલેશનની ભૂમિકા: સાયબર કૌશલ્યમાં ઉણપ ડિસ્ટિલેશન પદ્ધતિઓમાંથી ઉદ્ભવી શકે છે, કારણ કે Claude જેવા મોડલ્સના સેન્સર કરેલા પબ્લિક આઉટપુટ પર ટ્રેનિંગ કરવાથી અદ્યતન એક્સપ્લોઇટેશન માટે જરૂરી ઓફેન્સિવ ડેટાનો અભાવ રહે છે.
