Новая модель Kimi K3 от Moonshot AI обошла GPT-5.6 в бенчмарке AA-Briefcase, набрав 1527 баллов против 1495 у последней. Эта победа сопровождается моделью ценообразования, которая делает модель с открытыми весами (open-weight) объемом 2,8 триллиона параметров удивительно дешевым вариантом для задач программирования на длинных дистанциях.

Почему этот бенчмарк важен

AA-Briefcase измеряет производительность на продолжительных реальных рабочих нагрузках, а не на разрозненных вопросах на эрудицию. Более высокий балл означает, что модель способна удерживать контекст, планировать действия наперед и придерживаться задачи на протяжении тысяч токенов — именно с такими условиями сталкиваются разработчики при создании ассистентов, генераторов кода или инструментов для исследований. Преимущество Kimi K3 над GPT-5.6 показывает, что открытые модели теперь могут конкурировать там, где традиционно доминировали закрытые решения.

Техническая картина

  • Размер — 2,8 триллиона параметров, крупнейшая модель с открытыми весами, выпущенная на сегодняшний день.
  • Архитектура — Stable LatentMoE (Mixture-of-Experts) с 896 экспертами, из которых 16 активны в любой момент времени.
  • Контекстное окно — более 1 миллиона токенов, чего достаточно для целых книг или объемных кодовых баз.
  • Внимание (Attention) — Kimi Delta Attention, кастомная модификация, которая, по заявлениям, повышает эффективность масштабирования.

Эти решения дают модели возможность справляться с задачами «длительного планирования» (long-horizon), но они также повышают требования к вычислительным мощностям, что отражается на показателях скорости и стоимости.

Привлекательное ценообразование

Moonshot разделяет стоимость токенов на три категории:

Тип использования Стоимость за 1 млн токенов
Входные данные — промах кэша (cache miss) $3.00
Входные данные — попадание в кэш (cache hit) $0.30
Выходные данные $15.00

Компания утверждает, что при нагрузках, связанных с программированием, показатель попадания в кэш (cache-hit rate) составляет 90%. Если это правда, то это очень дешевый вариант для кодинг-агентов.

Компромиссы, которые вы почувствуете

  • Скорость — модель обрабатывает около 62 токенов в секунду, что ниже медианного значения по отрасли. Длинный промпт может обрабатываться несколько минут, что критично для интерактивного использования.
  • Стоимость рассуждений — Kimi K3 по умолчанию работает с «максимальными усилиями для рассуждений» (max reasoning effort) и не предлагает возможности их снизить. Поэтому простые запросы расходуют тот же бюджет токенов, что и сложные, увеличивая затраты на рутинные задачи.
  • Скрытое использование токенов — некоторые пользователи сообщают о значительном системном промпте, который модель вставляет автоматически; это добавляет токены, которые тарифицируются, но не видны в запросе пользователя.

Эти факторы означают, что низкая заявленная цена на практике может быть нивелирована более медленным временем отклика и повышенным потреблением токенов.

Доступность и перспективы

API уже доступен, что позволяет разработчикам начать эксперименты немедленно. Сами веса модели будут выпущены 27 июля, после чего станет возможен self-hosting. До этого момента пользователям придется полагаться на облачный сервис Moonshot и мириться с соответствующей задержкой и структурой ценообразования.

Контраргументы со стороны сторонников закрытых моделей

Основной вывод

Главный вывод заключается в сокращающемся разрыве между закрытыми и открытыми моделями. Kimi K3 доказывает, что модели с открытыми весами способны справляться со сложными задачами длительного планирования.