API Kimi K3 на бумаге выглядит дешевым, но скрытые комиссии и отсутствие технических подробностей могут сделать его гораздо дороже, чем обещают рекламные заголовки.
Что упускают из виду в рекламной шумихе
В материалах к запуску Moonshot AI заявляется о модели с 2,8 триллионами параметров, которая является «дешевой» и «открытой». В пресс-релизе также обещают скорый выпуск весов для скачивания. Ни одно из этих утверждений не подтверждается на деле.
- Веса недоступны — Moonshot установила крайний срок для публикации публичного чекпоинта на 27 июля 2026 года. До этого момента пользователи вынуждены обращаться к хостинговому API, так что обещание «открытого исходного кода» не дает ничего полезного.
- Не все 2,8 трлн параметров активны — это число описывает общую емкость архитектуры. Благодаря архитектуре Mixture-of-Experts, K3 направляет каждый токен через 16 из 896 экспертных подсетей. Moonshot не сообщила, сколько параметров задействуется при одном запросе, что делает невозможным расчет объема памяти и вычислительных мощностей.
Цены, которые выглядят привлекательно — пока не начнешь считать слова
Опубликованные тарифы:
- Входные данные с попаданием в кэш: $0,30 за 1 миллион токенов
- Входные данные без кэша: $3,00 за 1 миллион токенов
- Выходные данные: $15,00 за 1 миллион токенов
Эти тарифы кажутся скромными, но они не учитывают объем токенов.
Недавний тест показал, что объем выходных данных K3 составил 130 миллионов токенов, что более чем в два раза превышает показатель в 63 миллиона токенов у других ведущих моделей при выполнении тех же задач. Многословность модели напрямую раздувает счет за вывод: в два раза больше слов означает в два раза больше затрат. При генерации кода, написании эссе или создании чат-агентов тариф в $15 за миллион токенов может стать основной статьей расходов.
Что это значит для разных категорий пользователей
Разработчики и исследователи
Если вы тестируете K3 для помощи в написании кода или исследований на основе данных, установите жесткие ограничения на количество выходных токенов. A/B-тест, в котором K3 сравнивается с базовой моделью с идентичными лимитами на вывод, покажет, вызвано ли повышенное потребление токенов самой моделью или дизайном промптов.
Команды, ориентированные на экономию бюджета
Скидка за попадание в кэш применяется только при повторении одного и того же входного запроса. Создавайте стабильные префиксы промптов, которые генерируют идентичные входные строки, чтобы перевести больше запросов в тарифный сегмент $0,30; это работает только для высокоповторяющихся рабочих нагрузок (например, шаблонных запросов). Большинство разнообразных входных данных попадут под тариф без кэша в $3,00.
Компании, рассматривающие возможность самостоятельного хостинга
Ожидание выпуска чекпоинта — разумное решение. Самостоятельный хостинг модели избавляет от оплаты за каждый токен, но добавляет скрытые расходы на лицензирование и инфраструктуру. Пока веса не станут публичными, использование хостингового API остается единственным реалистичным вариантом.
Продакшн-среды
Не переходите на новую модель только потому, что заявленная цена кажется ниже, чем у конкурентов. Проведите пилотный проект, в котором будет измеряться стоимость выполнения одной задачи (включая скрытые накладные расходы из-за более длинных ответов), а не стоимость одного токена. Только тогда вы сможете решить, экономит ли K3 деньги.
На что обратить внимание в дальнейшем
- Выпуск чекпоинта 27 июля 2026 года — публикация весов запланирована на эту дату.
- Раскрытие количества активных параметров — знание того, сколько из 2,8 трлн параметров задействуется на один токен, позволит пользователям точно подобрать оборудование.
Итог
Заявленная цена на вывод в $15 за миллион токенов в K3 — это лишь половина правды. Ее склонность генерировать в два раза больше токенов, чем аналоги, может свести на нет любую заявленную экономию, особенно при выполнении задач с длинными ответами. Пока веса не будут опубликованы, а количество активных параметров не станет ясным, относитесь к K3 как к премиальному и потенциально многословному сервису, а не как к дешевой альтернативе. Проводите тесты с ограниченным бюджетом токенов, устанавливайте лимиты на вывод и переходите на модель только после того, как измерите реальную стоимость выполнения одной задачи.
