Новая модель Kimi K3 от Moonshot AI обошла GPT-5.6 в бенчмарке AA-Briefcase, набрав 1527 баллов против 1495 у последней. Эта победа сопровождается моделью ценообразования, которая делает модель с открытыми весами (open-weight) объемом 2,8 триллиона параметров удивительно дешевым вариантом для задач программирования на длинных дистанциях.
Почему этот бенчмарк важен
AA-Briefcase измеряет производительность на продолжительных реальных рабочих нагрузках, а не на разрозненных вопросах на эрудицию. Более высокий балл означает, что модель способна удерживать контекст, планировать действия наперед и придерживаться задачи на протяжении тысяч токенов — именно с такими условиями сталкиваются разработчики при создании ассистентов, генераторов кода или инструментов для исследований. Преимущество Kimi K3 над GPT-5.6 показывает, что открытые модели теперь могут конкурировать там, где традиционно доминировали закрытые решения.
Техническая картина
- Размер — 2,8 триллиона параметров, крупнейшая модель с открытыми весами, выпущенная на сегодняшний день.
- Архитектура — Stable LatentMoE (Mixture-of-Experts) с 896 экспертами, из которых 16 активны в любой момент времени.
- Контекстное окно — более 1 миллиона токенов, чего достаточно для целых книг или объемных кодовых баз.
- Внимание (Attention) — Kimi Delta Attention, кастомная модификация, которая, по заявлениям, повышает эффективность масштабирования.
Эти решения дают модели возможность справляться с задачами «длительного планирования» (long-horizon), но они также повышают требования к вычислительным мощностям, что отражается на показателях скорости и стоимости.
Привлекательное ценообразование
Moonshot разделяет стоимость токенов на три категории:
| Тип использования | Стоимость за 1 млн токенов |
|---|---|
| Входные данные — промах кэша (cache miss) | $3.00 |
| Входные данные — попадание в кэш (cache hit) | $0.30 |
| Выходные данные | $15.00 |
Компания утверждает, что при нагрузках, связанных с программированием, показатель попадания в кэш (cache-hit rate) составляет 90%. Если это правда, то это очень дешевый вариант для кодинг-агентов.
Компромиссы, которые вы почувствуете
- Скорость — модель обрабатывает около 62 токенов в секунду, что ниже медианного значения по отрасли. Длинный промпт может обрабатываться несколько минут, что критично для интерактивного использования.
- Стоимость рассуждений — Kimi K3 по умолчанию работает с «максимальными усилиями для рассуждений» (max reasoning effort) и не предлагает возможности их снизить. Поэтому простые запросы расходуют тот же бюджет токенов, что и сложные, увеличивая затраты на рутинные задачи.
- Скрытое использование токенов — некоторые пользователи сообщают о значительном системном промпте, который модель вставляет автоматически; это добавляет токены, которые тарифицируются, но не видны в запросе пользователя.
Эти факторы означают, что низкая заявленная цена на практике может быть нивелирована более медленным временем отклика и повышенным потреблением токенов.
Доступность и перспективы
API уже доступен, что позволяет разработчикам начать эксперименты немедленно. Сами веса модели будут выпущены 27 июля, после чего станет возможен self-hosting. До этого момента пользователям придется полагаться на облачный сервис Moonshot и мириться с соответствующей задержкой и структурой ценообразования.
Контраргументы со стороны сторонников закрытых моделей
Основной вывод
Главный вывод заключается в сокращающемся разрыве между закрытыми и открытыми моделями. Kimi K3 доказывает, что модели с открытыми весами способны справляться со сложными задачами длительного планирования.
