Является ли Kimi K3 продуктом дистилляции? Эксперты оспаривают обвинения
Геополитическая напряженность вокруг искусственного интеллекта достигла точки кипения: официальные лица США обвиняют китайские компании в промышленном шпионаже. Хотя в обвинениях утверждается, что Moonshot AI использовала модель Fable от Anthropic для обучения своей модели Kimi K3, ведущие исследователи ИИ утверждают, что техническая реальность разработки больших языковых моделей (LLM) представляет собой гораздо более сложную картину.
Обвинения в дистилляции моделей и краже интеллектуальной собственности
Советник Белого дома по науке Майкл Крациос выдвинул серьезные обвинения против Moonshot — компании, стоящей за Kimi K3, которая на данный момент является крупнейшей доступной LLM с открытыми весами. Крациос утверждает, что Moonshot занималась «масштабной скрытой промышленной дистилляцией» с целью кражи запатентованных технологий США. Это утверждение поддерживает министр финансов Скотт Бессент, отметивший, что в китайских моделях стали появляться «водяные знаки» американских LLM.
Дистилляция — это процесс, при котором меньшая модель обучается путем запросов к более крупной «передовой» (frontier) модели для извлечения ее способностей к рассуждению и знаний. Это часто включает в себя обучение с учителем (SFT), когда промпты и ответы целевой модели используются для обучения новой; иногда это приводит к тому, что новая модель перенимает «манеры» или специфические особенности общения оригинала.
Почему эксперты сомневаются в теории дистилляции
Несмотря на политический вес этих заявлений, исследовательское сообщество в области ИИ настроено скептически. Брейден Хэнкок, исследователь из Laude Institute и соучредитель Snorkel AI, указывает на существенную проблему с временными рамками: модель Fable от Anthropic стала общедоступной только с 1 июля. «Невозможно дистиллировать такой объем данных, обучить модель и выпустить ее за две недели», — отметил Хэнкок.
Кроме того, Нейтан Ламберт из Института ИИ Аллена утверждает, что дистилляция через SFT становится менее эффективной по мере того, как модели приближаются к уровню frontier. Чтобы достичь уровня производительности, наблюдаемого у Kimi K3, модели, скорее всего, потребовались бы масштабные циклы обучения с подкреплением (RL). Этот процесс требует участия десятков миллионов агентов для оценки ответов — задача, которая была бы непомерно дорогой и медленной, если бы она выполнялась через API конкурента.
Роль оборудования и технической экспертизы
Спор не ограничивается программным обеспечением. Крациос также заявил, что Moonshot обошла экспортный контроль для получения доступа к передовому оборудованию Nvidia, особо упомянув чипы Grace Blackwell 300 и серверы, оснащенные GB300. Хотя экспорт этих чипов в Китай запрещен, такие эксперты, как Сэм Бресник из Джорджтаунского университета, предполагают, что черные рынки и сложные глобальные цепочки поставок крайне затрудняют мониторинг этих потоков оборудования.
Однако многие исследователи утверждают, что акцент на дистилляции подрывает техническую легитимность китайских команд разработчиков ИИ. Учитывая, что основатели компании являются выпускниками таких элитных учебных заведений, как Университет Карнеги-Меллона, эксперты полагают, что Moonshot способна на оригинальные исследования, а не просто на «паразитирование» на чужих достижениях.
Последствия для глобальной гонки ИИ
Этот спор подчеркивает растущий разрыв между политическими нарративами и технической реальностью. По мере того как индустрия движется в сторону сложного обучения с подкреплением и огромных требований к вычислительным мощностям, дискуссия о том, «крадут» ли компании интеллект или просто продвигаются вперед за счет превосходного инжиниринга, будет продолжать формировать международную торговую политику и регулирование ИИ.
Основные выводы
- Технический скептицизм: Эксперты утверждают, что из-за быстрого выпуска Kimi K3 математически маловероятно, что она была построена исключительно путем дистилляции Fable от Anthropic.
- Больше, чем просто тонкая настройка: Хотя дистилляция через обучение с учителем (SFT) существует, достижение уровня производительности frontier-моделей, вероятно, требует продвинутого обучения с подкреплением, которое невозможно легко «скопировать».
- Проблемы с оборудованием: Обвинения в незаконном доступе к запрещенным чипам Nvidia Blackwell добавляют уровень геополитической сложности в дискуссию о прогрессе китайского ИИ.
