API Kimi K3 na papierze wygląda tanio, ale ukryte opłaty i brak szczegółów technicznych mogą sprawić, że będzie znacznie droższe, niż sugerują to nagłówkowe liczby.

Czego nie uwzględnia szum medialny

Materiały promocyjne Moonshot AI chwalą się modelem o 2,8 biliona parametrów, który jest „tani” i „otwarty”. Komunikat prasowy obiecuje również rychłe udostępnienie wag do pobrania. Żadne z tych twierdzeń nie znajduje potwierdzenia w rzeczywistości.

  • Wagi nie są dostępne – Moonshot wyznaczył termin udostępnienia publicznego checkpointu na 27 lipca 2026 r. Do tego czasu użytkownicy muszą korzystać z hostowanego API, więc obietnica „open-source” nie dostarcza niczego użytecznego.
  • 2,8 biliona parametrów nie jest wszystkich aktywnych – Liczba ta opisuje całkowitą pojemność architektury. Projekt K3 oparty na Mixture-of-Experts kieruje każdy token przez 16 z 896 podsieci eksperckich. Moonshot nie podał informacji, ile parametrów jest uruchamianych na jedno zapytanie, co uniemożliwia oszacowanie zapotrzebowania na pamięć i moc obliczeniową.

Cennik, który wygląda dobrze – dopóki nie policzysz słów

Opublikowane stawki:

  • Input z wykorzystaniem cache: 0,30 USD za 1 milion tokenów
  • Input bez wykorzystania cache: 3,00 USD za 1 milion tokenów
  • Output: 15,00 USD za 1 milion tokenów

Stawki te wydają się skromne, ale ignorują wolumen tokenów.

Niedawny test wykazał, że output K3 wyniósł 130 milionów tokenów, czyli ponad dwukrotnie więcej niż 63 miliony generowane przez inne wiodące modele w tych samych zadaniach. Gadatliwość modelu bezpośrednio zwiększa rachunek za output – dwukrotnie większa liczba słów oznacza dwukrotnie wyższy koszt. W przypadku generowania kodu, esejów czy agentów czatowych, stawka 15 USD za milion tokenów może zdominować wydatki.

Co to oznacza dla różnych użytkowników

Deweloperzy i badacze

Jeśli testujesz K3 pod kątem pomocy w programowaniu lub badań opartych na danych, wprowadź sztywne limity na liczbę generowanych tokenów. Test A/B, w którym zestawisz K3 z modelem bazowym o identycznych limitach wyjściowych, pokaże, czy wyższe zużycie tokenów wynika z modelu, czy z konstrukcji promptu.

Zespoły dbające o budżet

Zniżka za cache-hit ma zastosowanie tylko wtedy, gdy powtarza się ten sam input. Twórz stabilne prefiksy promptów, które generują identyczne ciągi wejściowe, aby przenieść więcej zapytań do progu 0,30 USD; działa to jednak tylko w przypadku wysoce powtarzalnych obciążeń (np. zapytań szablonowych). Większość zróżnicowanych danych wejściowych zostanie rozliczona według stawki 3,00 USD za input bez cache.

Firmy rozważające self-hosting

Warto poczekać na wydanie checkpointu. Hostowanie modelu eliminuje opłaty za token, ale dodaje nieujawnione koszty licencyjne i infrastrukturalne. Dopóki wagi nie zostaną upublicznione, jedyną realistyczną opcją pozostaje hostowane API.

Środowiska produkcyjne

Nie przełączaj się tylko dlatego, że cena nagłówkowa wydaje się niższa niż u konkurencji. Przeprowadź pilotaż, który mierzy koszt ukończonego zadania, wliczając w to ukryte koszty wynikające z dłuższych odpowiedzi, zamiast skupiać się na koszcie pojedynczego tokena. Dopiero wtedy będziesz mógł zdecydować, czy K3 faktycznie przynosi oszczędności.

Na co zwrócić uwagę w przyszłości

  • Wydanie checkpointu 27 lipca 2026 r. – wagi mają zostać udostępnione tego dnia.
  • Ujawnienie liczby aktywnych parametrów – wiedza o tym, ile z 2,8 biliona parametrów jest uruchamianych na token, pozwoliłaby użytkownikom na dokładne dobranie sprzętu.

Podsumowanie

Reklamowana cena outputu K3 na poziomie 15 USD za milion tokenów to tylko połowa prawdy. Skłonność modelu do generowania dwukrotnie większej liczby tokenów niż konkurencja może zniwelować wszelkie oszczędności, zwłaszcza w przypadku zadań wymagających długich odpowiedzi. Dopóki wagi nie zostaną udostępnione, a liczba aktywnych parametrów nie zostanie wyjaśniona, traktuj K3 jako usługę premium, potencjalnie gadatliwą, a nie tanią alternatywę. Przeprowadzaj testy budżetu tokenów, narzucaj limity wyjściowe i przełączaj się dopiero po zmierzeniu rzeczywistego kosztu ukończonego zadania.