Kimi K3 отстает от передовых моделей США в киберэксплуатации: разрыв из-за дистилляции
Совместная оценка, проведенная Британским институтом безопасности ИИ (UK AISI) и Центром стандартов и инноваций в области ИИ США (CAISI), выявила значительный разрыв в возможностях проведения наступательных киберопераций между китайскими и американскими моделями ИИ. Хотя Kimi K3 от Moonshot AI демонстрирует потенциал, она существенно отстает от ведущих американских передовых моделей при выполнении сложных задач по эксплуатации программного обеспечения и сетевым атакам.
ExploitBench: разрыв в исследовании уязвимостей
Для оценки навыков разработки эксплойтов исследователи использовали ExploitBench — бенчмарк Университета Карнеги-Меллона, включающий 41 уязвимость, обнаруженную в движке V8 браузера Chrome после 2023 года. Результаты выявили резкое различие в производительности. Ведущие модели США достигли среднего показателя 76,2%, в то время как Kimi K3 набрала значительно меньше — 32,2%. Хотя Kimi K3 превзошла китайскую модель GLM-5.2 (24,4%), она не смогла достичь высшего уровня эксплуатации: произвольного выполнения кода (Arbitrary Code Execution, ACE).
Напротив, топовые модели США успешно достигли ACE в 20 из 41 протестированной задачи, что позволило им получить полный контроль над целевыми системами — уровень сложности, который Kimi K3 не смогла воспроизвести.
Симуляция сетевых атак с помощью "The Last Ones"
В рамках оценки также тестировались модели с использованием "The Last Ones" (TLO) — симуляции сложной 32-этапной атаки на корпоративную сеть, включающей 20 хостов в четырех подсетях. Этот тест предназначен для измерения способности агента перемещаться по многоэтапным путям вторжения.
Kimi K3 в среднем прошла 17 шагов из 32, демонстрируя средний уровень возможностей. Хотя она завершила полный путь атаки в одном случае из десяти, ей не хватило стабильности, присущей моделям США, которые в среднем проходили 28,5 шагов. Результаты показывают, что, хотя Kimi K3 способна автономно атаковать слабо защищенные корпоративные системы, ей не хватает надежности западных передовых моделей для выполнения сложных многоэтапных операций.
Теория дистилляции: почему существует этот разрыв
Остается критический вопрос: почему китайские модели отстают в киберзадачах, даже если они показывают хорошие результаты в общих бенчмарках? В отчете предполагается, что это может быть связано с «дистилляцией» — практикой использования высококачественных ответов передовых моделей (таких как Claude от Anthropic) в качестве обучающих данных.
Если Moonshot AI использовала дистилляцию для обучения Kimi K3, они, вероятно, упустили критически важные данные по кибератакам. Ведущие модели США используют строгие классификаторы безопасности, которые блокируют продвинутые наступательные запросы. Следовательно, набор данных, построенный на основе публичных ответов этих моделей, будет естественным образом лишен тех самых знаний, которые необходимы для высокоуровневой эксплуатации. Это объясняет, как Kimi K3 может соответствовать западным моделям в общем программировании и рассуждениях, но значительно проигрывать в специализированных задачах по кибератакам.
Растущие возможности и сохраняющиеся риски
Несмотря на текущий разрыв, временной анализ CAISI показывает, что и американские, и китайские модели находятся на восходящей траектории (согласно рейтингу Elo). Разрыв в производительности открытых моделей сократился с шести-десяти месяцев в начале 2025 года до всего лишь четырех-семи месяцев в последнее время. UK AISI предупреждает, что сокращение этого разрыва не означает повышение безопасности; рост возможностей моделей с открытыми весами представляет собой «постоянный и необратимый риск неправомерного использования» в глобальном ландшафте кибербезопасности.
Основные выводы
- Разрыв в киберпроизводительности: Kimi K3 набрала 32,2% в ExploitBench, значительно отставая от среднего показателя ведущих моделей США (76,2%), и не смогла достичь произвольного выполнения кода (ACE).
- Возможности сетевых атак: В симуляциях TLO Kimi K3 в среднем проходила 17 шагов из 32-этапного пути атаки, что доказывает ее способность атаковать уязвимые системы, но указывает на отсутствие надежности, присущей топовым моделям США.
- Роль дистилляции: Дефицит кибернавыков может быть следствием практики дистилляции, так как обучение на цензурированных публичных ответах таких моделей, как Claude, не дает наступательных данных, необходимых для продвинутой эксплуатации.
