Kimi K3'ün API'si kağıt üzerinde ucuz görünüyor, ancak gizli ücretler ve eksik teknik detaylar, onu manşetlerdeki rakamlardan çok daha pahalı hale getirebilir.
Reklamların atladığı noktalar
Moonshot AI'nın lansman materyalleri, "ucuz" ve "açık" olan 2,8 trilyon parametreli bir modelden övgüyle bahsediyor. Basın bülteni ayrıca yakında indirilebilir ağırlıklar (weights) vaat ediyor. Ancak bu iddiaların hiçbiri geçerliliğini korumuyor.
- Ağırlıklar (weights) mevcut değil – Moonshot, halka açık bir checkpoint için 27 Temmuz 2026 tarihini belirledi. O zamana kadar kullanıcılar barındırılan (hosted) API'yi çağırmak zorunda kalacak, bu nedenle "açık kaynak" vaadi kullanılabilir hiçbir şey sunmuyor.
- 2,8 T parametrenin tamamı aktif değil – Bu sayı, mimarinin toplam kapasitesini tanımlıyor. K3'ün Mixture-of-Experts tasarımı, her bir token'ı 896 uzman alt ağından 16 tanesi üzerinden yönlendiriyor. Moonshot, bir istek için kaç parametrenin çalıştığını belirtmedi; bu da bellek ve hesaplama tahminlerini imkansız kılıyor.
Kelimeleri sayana kadar iyi görünen fiyatlandırma
Yayınlanan oranlar:
- Cache-hit giriş: 1 milyon token başına 0,30 $
- Cache-hit olmayan (uncached) giriş: 1 milyon token başına 3,00 $
- Çıkış (Output): 1 milyon token başına 15,00 $
Bu oranlar mütevazı görünüyor ancak token hacmini göz ardı ediyorlar.
Yakın zamanda yapılan bir test, K3'ün çıktısını 130 milyon token olarak ölçtü; bu, aynı görevlerde diğer lider modeller tarafından üretilen 63 milyon token'ın iki katından fazladır. Modelin kelime kalabalığı (verbosity), çıktı faturasını doğrudan şişiriyor; iki kat daha fazla kelime, iki kat daha fazla maliyet anlamına geliyor. Kod üretimi, makaleler veya sohbet ajanları için, milyon token başına 15 dolarlık oran harcamaların büyük kısmını oluşturabilir.
Farklı kullanıcılar için ne anlama geliyor?
Geliştiriciler ve araştırmacılar
K3'ü kodlama yardımı veya veri odaklı araştırma için test ediyorsanız, token çıktısına kesin sınırlar (hard caps) getirin. K3'ü, özdeş çıktı limitlerine sahip bir temel modelle karşılaştıran bir A/B testi, yüksek token kullanımının modelden mi yoksa istem (prompt) tasarımından mı kaynaklandığını gösterecektir.
Bütçe odaklı ekipler
Cache-hit indirimi yalnızca aynı giriş tekrarlandığında geçerlidir. Daha fazla isteği 0,30 dolarlık kademeye sokmak için özdeş giriş dizeleri üreten kararlı istem ön ekleri (prompt prefixes) oluşturun; bu yalnızca son derece tekrarlayan iş yükleri (örneğin, şablon sorgular) için işe yarar. Çoğu değişken girdi, 3,00 dolarlık cache-hit olmayan orana geri dönecektir.
Kendi bünyesinde barındırmayı (self-hosting) düşünen şirketler
Checkpoint sürümünü beklemek akıllıca olacaktır. Modeli barındırmak, token başına ücretleri ortadan kaldırır ancak açıklanmamış lisanslama ve altyapı maliyetleri ekler. Ağırlıklar halka açılana kadar, barındırılan API tek gerçekçi seçenek olmaya devam ediyor.
Üretim ortamları (Production environments)
Sırf manşet fiyatı rakiplerinden daha düşük görünüyor diye geçiş yapmayın. Token başına maliyet yerine, uzun yanıtlardan kaynaklanan gizli ek maliyetler de dahil olmak üzere tamamlanan görev başına maliyeti ölçen bir pilot çalışma yürütün. Ancak o zaman K3'ün tasarruf sağlayıp sağlamayacağına karar verebilirsiniz.
Sırada ne var?
- 27 Temmuz 2026 checkpoint sürümü – ağırlıkların bu tarihte yayınlanması planlanıyor.
- Aktif parametre açıklaması – 2,8 T parametrenin kaç tanesinin token başına çalıştığını bilmek, kullanıcıların donanımı doğru şekilde boyutlandırmasına olanak tanır.
Özetle
K3'ün ilan edilen milyon token başına 15 dolarlık çıktı fiyatı hikayenin sadece yarısını anlatıyor. Akranlarından iki kat daha fazla token üretme eğilimi, özellikle uzun cevaplı görevler için manşetlerdeki tüm tasarrufları yok edebilir. Ağırlıklar yayınlanana ve aktif parametre sayıları netleşene kadar, K3'ü ucuz bir alternatiften ziyade, potansiyel olarak kelime kalabalığı yapan (verbose) premium bir hizmet olarak değerlendirin. Token bütçesi testleri yapın, çıktı limitlerini uygulayın ve ancak tamamlanan iş başına gerçek maliyeti ölçtükten sonra geçiş yapın.
