API Kimi K3 виглядає дешевим на папері, але приховані збори та відсутність технічних деталей можуть зробити його набагато дорожчим, ніж обіцяють заголовки.

Що залишається поза увагою хайпу

Маркетингові матеріали Moonshot AI хвастаються моделлю на 2,8 трильйона параметрів, яка є «дешевою» та «відкритою». У пресрелізі також обіцяють незабаром надати ваги для завантаження. Жодна з цих заяв не підтверджується фактами.

  • Ваги недоступні – Moonshot встановила дедлайн для публічного чекпоїнту на 27 липня 2026 року. До того часу користувачі змушені використовувати хостований API, тому обіцянка «відкритого вихідного коду» не дає нічого практичного.
  • Не всі 2,8 Т параметрів є активними – Це число описує загальну потужність архітектури. Дизайн K3 на основі Mixture-of-Experts спрямовує кожен токен через 16 із 896 експертних підмереж. Moonshot не повідомила, скільки параметрів задіюється на один запит, що робить неможливим оцінювання обсягів пам'яті та обчислювальних ресурсів.

Ціни, що виглядають привабливо — поки не почнете рахувати слова

Опубліковані тарифи:

  • Вхідні дані з кешу (cache-hit): $0,30 за 1 мільйон токенів
  • Вхідні дані без кешу (uncached): $3,00 за 1 мільйон токенів
  • Вихідні дані: $15,00 за 1 мільйон токенів

Ці тарифи здаються скромними, але вони не враховують обсяг токенів.

Нещодавній тест показав, що обсяг вихідних даних K3 становить 130 мільйонів токенів, що більш ніж удвічі перевищує 63 мільйони, які генерують інші провідні моделі під час виконання тих самих завдань. Багатослівність моделі безпосередньо збільшує рахунок за вихідні дані — удвічі більше слів означає удвічі вищу вартість. Для генерації коду, есе або чат-агентів тариф у $15 за мільйон токенів може стати основною статтею витрат.

Що це означає для різних користувачів

Розробники та дослідники

Якщо ви тестуєте K3 для допомоги в написанні коду або досліджень на основі даних, встановіть жорсткі ліміти на кількість вихідних токенів. A/B тестування, де K3 порівнюється з базовою моделлю з ідентичними обмеженнями на вихідні дані, покаже, чи зумовлена висока кількість токенів самою моделлю, чи дизайном промптів.

Команди, що дбають про бюджет

Знижка за використання кешу (cache-hit) діє лише тоді, коли вхідні дані повторюються. Створюйте стабільні префікси промптів, які генерують ідентичні рядки вводу, щоб перевести більше запитів на тариф $0,30; це працює лише для дуже однотипних завдань (наприклад, шаблонних запитів). Більшість різноманітних вхідних даних підпадатимуть під тариф $3,00 без кешування.

Компанії, що розглядають можливість самостійного хостингу

Чекати на реліз чекпоїнту — розумне рішення. Самостійний хостинг моделі позбавляє оплати за кожен токен, але додає нерозголошені витрати на ліцензування та інфраструктуру. Поки ваги не стануть публічними, хостований API залишається єдиним реальним варіантом.

Продуктивні середовища

Не переходьте на нову модель лише тому, що її ціна в заголовках здається нижчою за конкурентів. Проведіть пілотний проєкт, який вимірюватиме вартість виконання одного завдання, включаючи приховані витрати через довші відповіді, а не вартість за токен. Тільки тоді ви зможете вирішити, чи заощаджує K3 кошти.

На що звернути увагу далі

  • Реліз чекпоїнту 27 липня 2026 року – ваги заплановані до випуску на цю дату.
  • Розкриття кількості активних параметрів – знання того, скільки з 2,8 Т параметрів працює на один токен, дозволило б користувачам точно підібрати обладнання.

Підсумок

Заявлена ціна на вихідні дані K3 у $15 за мільйон токенів відображає лише половину правди. Її схильність генерувати вдвічі більше токенів, ніж конкуренти, може звести нанівець будь-яку заявлену економію, особливо при виконанні завдань із довгими відповідями. Поки ваги не будуть опубліковані, а кількість активних параметрів не стане зрозумілою, ставтеся до K3 як до преміального, потенційно багатослівного сервісу, а не як до дешевої альтернативи. Проводьте тести бюджету токенів, встановлюйте ліміти на вихідні дані та переходьте на модель лише після того, як виміряєте реальну вартість виконання одного завершеного завдання.