Kimi K3 يتخلف عن النماذج الأمريكية الرائدة في الهجمات السيبرانية: فجوة التقطير
كشف تقييم مشترك أجراه معهد أمن الذكاء الاصطناعي البريطاني (UK AISI) ومركز معايير وابتكارات الذكاء الاصطناعي الأمريكي (CAISI) عن فجوة كبيرة في القدرات المتعلقة بالعمليات السيبرانية الهجومية بين نماذج الذكاء الاصطناعي الصينية والأمريكية. وبينما يُظهر نموذج Kimi K3 من شركة Moonshot AI إمكانات واعدة، إلا أنه لا يزال متأخراً بشكل ملحوظ عن النماذج الأمريكية الرائدة عند تكليفه بمهام استغلال البرمجيات المعقدة والهجمات الشبكية.
ExploitBench: الفجوة في أبحاث الثغرات الأمنية
لقياس مهارات تطوير الثغرات، استخدم الباحثون ExploitBench، وهو معيار مرجعي من جامعة كارنيجي ميلون يتضمن 41 ثغرة أمنية تم اكتشافها في محرك V8 الخاص بمتصفح Chrome بعد عام 2023. وسلطت النتائج الضوء على انقسام حاد في الأداء؛ حيث حققت النماذج الأمريكية الرائدة متوسط درجة بلغ 76.2%، بينما سجل Kimi K3 درجة أقل بكثير بلغت 32.2%. ورغم تفوق Kimi K3 على نموذج GLM-5.2 الصيني (24.4%)، إلا أنه فشل في الوصول إلى أعلى مستوى من الاستغلال: تنفيذ التعليمات البرمجية العشوائية (Arbitrary Code Execution - ACE).
وفي المقابل، نجحت النماذج الأمريكية من الفئة الأولى في تحقيق ACE في 20 من أصل 41 مهمة تم اختبارها، مما منحها سيطرة كاملة على الأنظمة المستهدفة، وهو مستوى من التعقيد لم يتمكن Kimi K3 من محاكاته.
محاكاة الهجمات الشبكية عبر "The Last Ones"
كما اختبر التقييم النماذج باستخدام "The Last Ones" (TLO)، وهي محاكاة لهجوم معقد على شبكة شركات يتكون من 32 خطوة ويشمل 20 مضيفاً عبر أربع شبكات فرعية. صُمم هذا الاختبار لقياس قدرة الوكيل (agent) على التنقل عبر مسارات الاختراق متعددة المراحل.
وصل Kimi K3 إلى متوسط 17 خطوة من أصل 32، مما أظهر قدرة متوسطة. وبينما أكمل مسار الهجوم الكامل في محاولة واحدة من أصل عشر محاولات، إلا أنه افتقر إلى الاتساق الذي أظهرته النماذج الأمريكية، والتي بلغ متوسط خطواتها 28.5 خطوة. وتشير النتائج إلى أنه بينما يستطيع Kimi K3 مهاجمة أنظمة الشركات ذات الدفاعات الضعيفة بشكل مستقل، فإنه يفتقر إلى الموثوقية التي تتمتع بها النماذج الغربية الرائدة لتنفيذ عمليات معقدة وطويلة السلسلة.
نظرية التقطير: لماذا توجد هذه الفجوة؟
يبقى سؤال جوهري: لماذا تتخلف النماذج الصينية في المهام السيبرانية حتى عندما تؤدي بشكل جيد في المعايير العامة؟ يشير التقرير إلى أن هذا قد يعود إلى "التقطير" (distillation) — وهي ممارسة استخدام مخرجات عالية الجودة من النماذج الرائدة (مثل Claude من شركة Anthropic) كبيانات للتدريب.
إذا كانت Moonshot AI قد استخدمت التقطير لتدريب Kimi K3، فمن المرجح أنها افتقدت بيانات هجومية سيبرانية بالغة الأهمية. فالنماذج الأمريكية الرائدة تستخدم مصنفات سلامة صارمة تمنع الاستعلامات الهجومية المتقدمة. وبناءً على ذلك، فإن مجموعة البيانات المبنية من المخرجات العامة لهذه النماذج ستكون بطبيعتها خالية من المعرفة المطلوبة للاستغلال عالي المستوى. وهذا يفسر كيف يمكن لـ Kimi K3 أن يضاهي النماذج الغربية في البرمجة العامة والاستدلال، بينما يفشل بشكل كبير في المهام السيبرانية الهجومية المتخصصة.
قدرات متنامية ومخاطر مستمرة
على الرغم من الفجوة الحالية، يظهر تحليل السلاسل الزمنية الذي أجراه CAISI أن كلاً من النماذج الأمريكية والصينية تسير في مسار تصاعدي بناءً على تصنيف Elo. وقد تقلصت فجوة الأداء للنماذج المفتوحة من ستة إلى عشرة أشهر في بداية عام 2025 إلى ما بين أربعة إلى سبعة أشهر فقط مؤخراً. ويحذر معهد UK AISI من أن تقلص هذه الفجوة لا يعني الأمان؛ إذ تمثل القدرات المتزايدة للنماذج ذات الأوزان المفتوحة (open-weight models) "خطراً مستمراً ولا يمكن الرجوع عنه من سوء الاستخدام" في المشهد العالمي للأمن السيبراني.
أهم النقاط المستخلصة
- فجوة الأداء السيبراني: سجل Kimi K3 نسبة 32.2% في ExploitBench، متخلفاً بشكل كبير عن متوسط 76.2% للنماذج الأمريكية الرائدة، وفشل في تحقيق تنفيذ التعليمات البرمجية العشوائية (ACE).
- القدرة على الهجوم الشبكي: في محاكاة TLO، حقق Kimi K3 متوسط 17 خطوة في مسار هجوم مكون من 32 خطوة، مما يثبت قدرته على استهداف الأنظمة الضعيفة ولكنه يفتقر إلى الموثوقية التي تتمتع بها النماذج الأمريكية من الفئة الأولى.
- دور التقطير: قد ينبع العجز في المهارات السيبرانية من ممارسات التقطير، حيث إن التدريب على المخرجات العامة الخاضعة للرقابة من نماذج مثل Claude يفتقر إلى البيانات الهجومية اللازمة للاستغلال المتقدم.
