Kimi K3 baharu daripada Moonshot AI telah mengatasi GPT-5.6 dalam penanda aras AA-Briefcase, dengan skor 1,527 berbanding 1,495 bagi model tersebut. Kemenangan ini disertakan dengan model harga yang menjadikan model pemberat terbuka (open-weight) dengan 2.8 trilion parameter ini sebagai pilihan yang sangat murah untuk tugasan pengekodan berformat panjang.

Mengapa penanda aras ini penting

AA-Briefcase mengukur prestasi pada beban kerja dunia nyata yang berterusan dan bukannya soalan trivia yang terasing. Skor yang lebih tinggi bermakna sesebuah model dapat mengekalkan konteks, merancang lebih awal dan kekal pada tugasan merentasi beribu-ribu token – tepat seperti keadaan yang dihadapi pembangun semasa membina pembantu, penjana kod atau pembantu penyelidikan. Kelebihan Kimi K3 berbanding GPT-5.6 menunjukkan bahawa model terbuka kini boleh bersaing di kawasan yang sebelum ini didominasi oleh pesaing tertutup.

Gambaran teknikal

  • Saiz – 2.8 trilion parameter, model pemberat terbuka terbesar yang dikeluarkan setakat ini.
  • Seni bina – Stable LatentMoE (Mixture-of-Experts) dengan 896 pakar, di mana 16 daripadanya aktif pada bila-bila masa.
  • Tetingkap konteks – Melebihi 1 juta token, cukup untuk memuatkan keseluruhan buku atau pangkalan kod yang panjang.
  • Perhatian (Attention) – Kimi Delta Attention, satu pengubahsuaian tersuai yang didakwa dapat meningkatkan kecekapan penskalaan.

Pilihan-pilihan ini memberikan model tersebut keupayaan untuk mengendalikan tugasan "jangka panjang" (long-horizon), tetapi ia juga meningkatkan keperluan pengkomputeran, yang dapat dilihat pada angka kelajuan dan kos.

Harga yang menarik perhatian

Moonshot membahagikan harga token kepada tiga kategori:

Jenis penggunaan Kos bagi setiap 1 Juta token
Input – cache miss $3.00
Input – cache hit $0.30
Output $15.00

Syarikat tersebut menyatakan bahawa beban kerja pengekodan mencatatkan kadar cache-hit sebanyak 90%. Jika benar, ini merupakan pilihan yang sangat murah untuk ejen pengekodan.

Kompromi yang akan anda rasai

  • Kelajuan – Model ini memproses kira-kira 62 token sesaat, di bawah median industri. Prompt yang panjang boleh mengambil masa beberapa minit, yang mana ia penting untuk penggunaan interaktif.
  • Kos penaakulan – Kimi K3 berjalan dengan “max reasoning effort” secara lalai dan tidak menawarkan pilihan untuk mengurangkannya. Oleh itu, pertanyaan mudah akan menggunakan bajet token yang sama seperti pertanyaan kompleks, sekali gus meningkatkan kos untuk tugasan rutin.
  • Penggunaan token tersembunyi – Sesetengah pengguna melaporkan adanya prompt sistem yang agak besar yang dimasukkan oleh model secara automatik, menambah token yang dikenakan caj tetapi tidak kelihatan dalam permintaan pengguna.

Faktor-faktor ini bermakna harga rendah yang dihebahkan boleh diimbangi oleh tempoh pemprosesan yang lebih perlahan dan penggunaan token yang lebih tinggi dalam praktiknya.

Ketersediaan dan hala tuju masa depan

API tersebut telah dilancarkan hari ini, membolehkan pembangun mencubanya dengan segera. Pemberat model itu sendiri akan dikeluarkan pada 27 Julai, selepas itu pengehosan sendiri (self-hosting) akan menjadi mungkin. Sehingga itu, pengguna mesti bergantung kepada perkhidmatan hos Moonshot dan menerima kependaman (latency) serta struktur harga yang berkaitan.

Hujah balas daripada kem model tertutup

Kesimpulan utama yang muncul

Kesimpulan utamanya ialah jurang antara model tertutup dan model terbuka semakin mengecil. Kimi K3 membuktikan bahawa model pemberat terbuka boleh mengendalikan tugasan yang kompleks dan berjangka panjang.