Kimi K3 mpya ya Moonshot AI imeshinda GPT-5.6 kwenye kipimo cha AA-Briefcase, ikipata alama 1,527 dhidi ya alama 1,495 za hiyo ya mwisho. Ushindi huu unakuja na mfumo wa bei unaofanya modeli hii ya open-weight yenye vigezo (parameters) trilioni 2.8 kuwa chaguo la bei nafuu kwa ajili ya kazi za uandishi wa kodi (coding) za muda mrefu.

Kwa nini kipimo hiki ni muhimu

AA-Briefcase inapima utendaji kwenye mzigo wa kazi wa ulimwengu halisi unaoendelea badala ya maswali ya trivia yaliyojitenga. Alama ya juu inamaanisha kuwa modeli inaweza kudumisha muktadha (context), kupanga mbele na kubaki kwenye kazi kwa maelfu ya tokeni – hali halisi inayowakabili watengenezaji (developers) wanapounda wasaidizi, viumbaji wa kodi (code generators) au wasaidizi wa utafiti. Ubora wa Kimi K3 dhidi ya GPT-5.6 unaonyesha kuwa modeli huru (open model) sasa inaweza kushindana pale washindani waliofungwa (closed rivals) walipotawala kwa muda mrefu.

Picha ya kiufundi

  • Ukubwa – vigezo (parameters) trilioni 2.8, modeli kubwa zaidi ya open-weight iliyotolewa hadi sasa.
  • Usanifu (Architecture) – Stable LatentMoE (Mixture-of-Experts) yenye wataalamu (experts) 896, ambapo 16 huwa hai kwa wakati wowote.
  • Dirisha la muktadha (Context window) – Zaidi ya tokeni milioni 1, zinazotosha kubeba vitabu vyote au misingi ya kodi (codebases) mirefu.
  • Attention – Kimi Delta Attention, marekebisho maalum yanayodaiwa kuboresha ufanisi wa upanuzi (scaling efficiency).

Chaguzi hizi huipa modeli uwezo wa kushughulikia kazi za “long-horizon”, lakini pia huongeza mahitaji ya kompyuta (compute requirements), jambo ambalo linaonekana katika takwimu za kasi na gharama.

Bei inayovutia macho

Moonshot imegawanya bei ya tokeni katika makundi matatu:

Aina ya matumizi Gharama kwa kila tokeni milioni 1
Input – cache miss $3.00
Input – cache hit $0.30
Output $15.00

Kampuni inasema kuwa kazi za uandishi wa kodi zina kiwango cha cache-hit cha 90%. Ikiwa ni kweli, ni chaguo la bei nafuu sana kwa ajili ya coding agents.

Mapungufu utakayoyahisi

  • Kasi – Modeli inachakata takriban tokeni 62 kwa sekunde, ikiwa chini ya wastani wa sekta. Prompt ndefu inaweza kuchukua dakika kadhaa, jambo ambalo ni muhimu kwa matumizi ya mwingiliano (interactive use).
  • Gharama ya ufikiri (Reasoning cost) – Kimi K3 inafanya kazi kwa “max reasoning effort” kwa asili na haina sehemu ya kuipunguza. Kwa hivyo, maswali rahisi hutumia bajeti ile ile ya tokeni kama maswali magumu, jambo linaloongeza gharama kwa kazi za kawaida.
  • Matumizi ya tokeni yaliyofichika – Baadhi ya watumiaji wanaripoti kuwa kuna system prompt kubwa ambayo modeli huiongeza kiotomatiki, ikiongeza tokeni ambazo zinahesabiwa lakini hazionekani katika ombi la mtumiaji.

Sababu hizi zina maana kwamba bei ya chini inayotangazwa inaweza kufutika na kasi ndogo ya utendaji na matumizi makubwa ya tokeni katika vitendo.

Upatikanaji na njia ya mbele

API ipo hewani leo, ikiruhusu watengenezaji kufanya majaribio mara moja. Uzito wa modeli (model weights) wenyewe utatolewa Julai 27, baada ya hapo kujihost (self-hosting) kutakuwa inawezekana. Mpaka wakati huo, watumiaji lazima wategemee huduma ya Moonshot na kukubali ucheleweshaji (latency) na muundo wa bei unaohusika.

Hoja kinyume kutoka upande wa modeli zilizofungwa

Hitimisho linalojitokeza

Hitimisho kuu ni upungufu wa pengo kati ya modeli zilizofungwa na modeli huru. Kimi K3 inathibitisha kuwa modeli za open-weight zinaweza kushughulikia kazi tata za muda mrefu (long-horizon).