عقب‌ماندگی Kimi K3 از مدل‌های پیشرو ایالات متحده در اکسپلویت‌های سایبری: شکاف تقطیر (Distillation)

ارزیابی مشترک مؤسسه امنیت هوش مصنوعی بریتانیا (UK AISI) و مرکز استانداردها و نوآوری هوش مصنوعی ایالات متحده (CAISI)، شکاف توانمندی قابل‌توجهی را در عملیات سایبری تهاجمی بین مدل‌های هوش مصنوعی چینی و آمریکایی آشکار کرده است. اگرچه Kimi K3 محصول Moonshot AI نویدبخش به نظر می‌رسد، اما در انجام وظایف پیچیده اکسپلویت نرم‌افزاری و حملات شبکه‌ای، همچنان به‌طور قابل‌توجهی از مدل‌های پیشرو (frontier models) آمریکایی عقب‌تر است.

ExploitBench: شکاف در تحقیقات آسیب‌پذیری

برای سنجش مهارت‌های توسعه اکسپلویت، پژوهشگران از ExploitBench استفاده کردند؛ بنچمارکی از دانشگاه کارنگی ملون که شامل ۴۱ آسیب‌پذیری یافت‌شده در موتور V8 کروم پس از سال ۲۰۲۳ است. نتایج، شکاف عملکردی شدیدی را نشان داد. مدل‌های پیشرو ایالات متحده به میانگین امتیاز ۷۶.۲٪ دست یافتند، در حالی که Kimi K3 با امتیاز بسیار پایین‌تر ۳۲.۲٪ ظاهر شد. اگرچه Kimi K3 از مدل GLM-5.2 چین (۲۴.۴٪) عملکرد بهتری داشت، اما نتوانست به بالاترین سطح اکسپلویت، یعنی اجرای کد دلخواه (Arbitrary Code Execution یا ACE)، دست یابد.

در مقابل، مدل‌های سطح‌بالای ایالات متحده در ۲۰ مورد از ۴۱ وظیفه آزمایش‌شده، با موفقیت به ACE دست یافتند که امکان کنترل کامل بر سیستم‌های هدف را فراهم می‌کند؛ سطحی از پیچیدگی که Kimi K3 قادر به بازسازی آن نبود.

شبیه‌سازی حملات شبکه‌ای از طریق "The Last Ones"

این ارزیابی همچنین مدل‌ها را با استفاده از "The Last Ones" (TLO) مورد آزمایش قرار داد؛ شبیه‌سازی یک حمله پیچیده ۳۲ مرحله‌ای به شبکه سازمانی که شامل ۲۰ میزبان (host) در چهار زیرشبکه است. این تست برای سنجش توانایی یک عامل (agent) در پیمودن مسیرهای نفوذ چندمرحله‌ای طراحی شده است.

Kimi K3 به‌طور میانگین به ۱۷ مرحله از ۳۲ مرحله دست یافت که نشان‌دهنده توانمندی متوسط است. اگرچه این مدل در یک مورد از هر ده تلاش، مسیر کامل حمله را تکمیل کرد، اما فاقد ثبات مدل‌های ایالات متحده بود که به‌طور میانگین ۲۸.۵ مرحله را طی می‌کردند. یافته‌ها نشان می‌دهند که اگرچه Kimi K3 قادر است به‌طور خودکار به سیستم‌های سازمانی با دفاع ضعیف حمله کند، اما فاقد قابلیت اطمینان مدل‌های پیشرو غربی برای اجرای عملیات‌های پیچیده و زنجیره‌ای طولانی است.

نظریه تقطیر (Distillation): چرا این شکاف وجود دارد؟

یک سوال حیاتی باقی می‌ماند: چرا مدل‌های چینی حتی زمانی که در بنچمارک‌های عمومی عملکرد خوبی دارند، در وظایف سایبری عقب می‌مانند؟ گزارش پیشنهاد می‌کند که این موضوع ممکن است به دلیل "تقطیر" (distillation) باشد؛ یعنی استفاده از خروجی‌های باکیفیت مدل‌های پیشرو (مانند Claude شرکت Anthropic) به عنوان داده‌های آموزشی.

اگر Moonshot AI از روش تقطیر برای آموزش Kimi K3 استفاده کرده باشد، احتمالاً داده‌های حیاتی مربوط به حملات سایبری را از دست داده است. مدل‌های پیشرو ایالات متحده از طبقه‌بندی‌کننده‌های امنیتی (safety classifiers) سخت‌گیرانه‌ای استفاده می‌کنند که پرس‌وجوهای (queries) تهاجمی پیشرفته را مسدود می‌کنند. در نتیجه، مجموعه‌داده‌ای که از خروجی‌های عمومی این مدل‌ها ساخته شده باشد، طبیعتاً فاقد دانش لازم برای اکسپلویت‌های سطح بالا خواهد بود. این موضوع توضیح می‌دهد که چگونه Kimi K3 می‌تواند در برنامه‌نویسی و استدلال عمومی با مدل‌های غربی برابری کند، اما در وظایف تخصصی سایبری تهاجمی به‌طور قابل‌توجهی شکست بخورد.

توانمندی‌های رو به رشد و ریسک‌های مداوم

علی‌رغم شکاف فعلی، تحلیل سری زمانی CAISI نشان می‌دهد که هم مدل‌های ایالات متحده و هم مدل‌های چینی در یک مسیر صعودی مبتنی بر Elo قرار دارند. شکاف عملکردی برای مدل‌های متن‌باز (open models) از شش تا ده ماه در ابتدای سال ۲۰۲۵، به تازگی به چهار تا هفت ماه کاهش یافته است. UK AISI هشدار می‌دهد که این کاهش شکاف به معنای امنیت نیست؛ افزایش توانمندی‌های مدل‌های با وزن‌های باز (open-weight models)، نشان‌دهنده یک "ریسک مداوم و جبران‌ناپذیر از سوءاستفاده" در چشم‌انداز امنیت سایبری جهانی است.

نکات کلیدی

  • شکاف عملکرد سایبری: Kimi K3 در ExploitBench امتیاز ۳۲.۲٪ را کسب کرد که به‌طور قابل‌توجهی از میانگین ۷۶.۲٪ مدل‌های پیشرو ایالات متحده عقب‌تر است و نتوانست به اجرای کد دلخواه (ACE) دست یابد.
  • توانایی حمله شبکه‌ای: در شبیه‌سازی‌های TLO، Kimi K3 به‌طور میانگین ۱۷ مرحله از یک مسیر حمله ۳۲ مرحله‌ای را طی کرد، که ثابت می‌کند می‌تواند سیستم‌های آسیب‌پذیر را هدف قرار دهد اما فاقد قابلیت اطمینان مدل‌های سطح‌بالای ایالات متحده است.
  • نقش تقطیر (Distillation): کمبود مهارت‌های سایبری ممکن است ناشی از روش‌های تقطیر باشد، زیرا آموزش بر روی خروجی‌های عمومی سانسورشده مدل‌هایی مانند Claude، فاقد داده‌های تهاجمی لازم برای اکسپلویت‌های پیشرفته است.