Kimi K3 מפגרת אחרי מודלי קצה אמריקאיים בניצול פרצות סייבר: פער הדיסטילציה
הערכה משותפת של המכון הבריטי לאבטחת בינה מלאכותית (UK AISI) והמרכז האמריקאי לתקנים וחדשנות בבינה מלאכותית (CAISI) חשפה פער יכולות משמעותי במבצעי סייבר התקפיים בין מודלי בינה מלאכותית סיניים לאמריקאיים. בעוד ש-Kimi K3 של Moonshot AI מראה הבטחה, הוא נותר מאחור משמעותית אחרי מודלי קצה אמריקאיים מובילים כאשר הוא נדרש לביצוע ניצול תוכנה מורכב והתקפות רשת.
ExploitBench: הפער במחקר פגיעויות
כדי למדוד מיומנויות פיתוח ניצולים (exploits), החוקרים השתמשו ב-ExploitBench, מדד (benchmark) מאוניברסיטת קרנגי מלון הכולל 41 פגיעויות שנמצאו במנוע ה-V8 של Chrome לאחר שנת 2023. התוצאות הדגישו פער ביצועים חריף. מודלים אמריקאיים מובילים השיגו ציון ממוצע של 76.2%, בעוד ש-Kimi K3 קיבל ציון נמוך משמעותית של 32.2%. למרות ש-Kimi K3 הציג ביצועים טובים יותר מ-GLM-5.2 הסיני (24.4%), הוא נכשל בהגעה לרמת הניצול הגבוהה ביותר: הרצת קוד שרירותית (Arbitrary Code Execution - ACE).
לעומת זאת, מודלים אמריקאיים מהשורה הראשונה הצליחו להשיג ACE ב-20 מתוך 41 המשימות שנבדקו, מה שהעניק שליטה מלאה על מערכות היעד – רמת תחכום ש-Kimi K3 לא הצליח לשכפל.
סימולציה של התקפות רשת באמצעות "The Last Ones"
ההערכה בחנה גם מודלים באמצעות "The Last Ones" (TLO), סימולציה של התקפת רשת ארגונית מורכבת בת 32 שלבים הכוללת 20 מארחים (hosts) על פני ארבע תת-רשתות. מבחן זה נועד למדוד את יכולתו של סוכן (agent) לנווט בנתיבי חדירה רב-שלביים.
Kimi K3 הגיע לממוצע של 17 שלבים מתוך 32, מה שמראה על יכולת בינונית. למרות שהוא השלים את נתיב ההתקפה המלא בניסיון אחד מתוך עשרה, חסרה לו העקביות של המודלים האמריקאיים, שהגיעו לממוצע של 28.5 שלבים. הממצאים מצביעים על כך שבעוד ש-Kimi K3 מסוגל לתקוף באופן אוטונומי מערכות ארגוניות המוגנות באופן חלש, חסרה לו האמינות של מודלי קצה מערביים לביצוע פעולות מורכבות ורבות-שלבים (long-chain operations).
תיאוריית הדיסטילציה: מדוע קיים הפער
שאלה קריטית נותרה בעינה: מדוע מודלים סיניים מפגרים במשימות סייבר גם כשהם מציגים ביצועים טובים במדדים כלליים? הדו"ח מציע שזה עשוי לנבוע מ"דיסטילציה" (distillation) – הפרקטיקה של שימוש בפלטים באיכות גבוהה ממודלי קצה (כמו Claude של Anthropic) כנתוני אימון.
אם Moonshot AI השתמשה בדיסטילציה כדי לאמן את Kimi K3, סביר להניח שהם פספסו נתונים קריטיים של סייבר התקפי. מודלים אמריקאיים מובילים משתמשים במסווגי בטיחות (safety classifiers) קשיחים שחוסמים שאילתות התקפיות מתקדמות. כתוצאה מכך, סט נתונים שנבנה מתוך הפלטים הציבוריים של מודלים אלו יהיה מרוקן מטבעו מהידע הנדרש בדיוק לצורך ניצול ברמה גבוהה. זה מסביר כיצד Kimi K3 יכול להשתוות למודלים מערביים בתכנות ובהסקה כללית, אך נכשל משמעותית במשימות סייבר התקפיות מתמחות.
יכולות גדלות וסיכונים מתמשכים
למרות הפער הנוכחי, ניתוח סדרות הזמן של CAISI מראה שגם המודלים האמריקאיים וגם הסיניים נמצאים במסלול עולה מבוסס Elo. פער הביצועים עבור מודלים פתוחים הצטמצם משישה עד עשרה חודשים בתחילת 2025, לארבעה עד שבעה חודשים בלבד לאחרונה. ה-UK AISI מזהיר כי צמצום הפער אינו שווה לבטיחות; היכולות הגדלות של מודלים בעלי משקלים פתוחים (open-weight models) מייצגות "סיכון מתמשך ובלתי הפיך לשימוש לרעה" בנוף אבטחת הסייבר העולמי.
נקודות מפתח
- פער ביצועי סייבר: Kimi K3 קיבל ציון של 32.2% ב-ExploitBench, מפגר משמעותית אחרי הממוצע של 76.2% של מודלים אמריקאיים מובילים, ונכשל בהשגת הרצת קוד שרירותית (ACE).
- יכולת התקפת רשת: בסימולציות TLO, Kimi K3 הגיע לממוצע של 17 שלבים בנתיב התקפה של 32 שלבים, מה שמוכיח שהוא יכול להתמקד במערכות פגיעות אך חסרה לו האמינות של מודלים אמריקאיים מהשורה הראשונה.
- תפקיד הדיסטילציה: המחסור במיומנויות סייבר עשוי לנבוע משיטות דיסטילציה, שכן אימון על פלטים ציבוריים מצונזרים ממודלים כמו Claude חסר את הנתונים ההתקפיים הדרושים לניצול מתקדם.
