Нова модель Kimi K3 від Moonshot AI перевершила GPT-5.6 у бенчмарку AA-Briefcase, набравши 1527 балів проти 1495 у останньої. Ця перемога супроводжується моделлю ціноутворення, яка робить цю open-weight модель із 2,8 трильйонами параметрів напрочуд дешевим варіантом для написання розлогого коду.
Чому цей бенчмарк має значення
AA-Briefcase вимірює продуктивність на тривалих реальних робочих навантаженнях, а не на окремих запитаннях на загальну ерудицію. Вищий бал означає, що модель здатна утримувати контекст, планувати наперед і залишатися в межах завдання протягом тисяч токенів — саме в таких умовах працюють розробники, створюючи асистентів, генератори коду або дослідницькі інструменти. Перевага Kimi K3 над GPT-5.6 демонструє, що відкрита модель тепер може конкурувати там, де традиційно домінували закриті аналоги.
Технічна картина
- Розмір — 2,8 трильйона параметрів, найбільша open-weight модель, випущена на сьогодні.
- Архітектура — Stable LatentMoE (Mixture-of-Experts) з 896 експертами, з яких 16 є активними в будь-який момент.
- Контекстне вікно — понад 1 мільйон токенів, достатньо для цілих книг або великих баз коду.
- Увага — Kimi Delta Attention, спеціальна модифікація, яка, за заявами, покращує ефективність масштабування.
Ці рішення надають моделі можливість виконувати завдання з «довгостроковим горизонтом» планування, але вони також підвищують вимоги до обчислювальних ресурсів, що відображається на показниках швидкості та вартості.
Ціни, що привертають увагу
Moonshot розділяє ціноутворення за токенами на три категорії:
| Тип використання | Вартість за 1 млн токенів |
|---|---|
| Вхідні дані – промах кешу | $3.00 |
| Вхідні дані – влучання в кеш | $0.30 |
| Вихідні дані | $15.00 |
Компанія заявляє, що при роботі з кодом рівень влучання в кеш становить 90%. Якщо це правда, то це дуже дешевий варіант для агентів програмування.
Компроміси, які ви відчуєте
- Швидкість — модель обробляє близько 62 токенів на секунду, що нижче середнього показника по ринку. Довгий промпт може оброблятися хвилинами, що важливо для інтерактивного використання.
- Вартість міркування — Kimi K3 за замовчуванням працює з «максимальним зусиллям для міркування» (max reasoning effort) і не пропонує можливості його знизити. Через це прості запити споживають такий самий бюджет токенів, як і складні, що збільшує витрати на рутинні завдання.
- Приховане використання токенів — деякі користувачі повідомляють про значний системний промпт, який модель вставляє автоматично, додаючи токени, які тарифікуються, але не відображаються у запиті користувача.
Ці фактори означають, що низька заявлена ціна на практиці може бути нівельована повільнішою обробкою та вищим споживанням токенів.
Доступність та подальші плани
API вже доступний, що дозволяє розробникам розпочати експерименти негайно. Ваги моделі будуть випущені 27 липня, після чого стане можливим самостійне хостування. До того часу користувачі мають покладатися на хостинговий сервіс Moonshot і миритися з відповідною затримкою та структурою ціноутворення.
Контраргумент від табору закритих моделей
Головний висновок
Головний висновок полягає у скороченні розриву між закритими та відкритими моделями. Kimi K3 доводить, що open-weight моделі здатні виконувати складні завдання з довгостроковим горизонтом планування.
