Moonshot AI’s new Kimi K3 topped GPT-5.6 on the AA-Briefcase benchmark, scoring 1,527 against the latter’s 1,495. The win comes with a pricing model that makes the 2.8-trillion-parameter open-weight model a surprisingly cheap option for long-form coding tasks.
Mengapa benchmark ini penting
AA-Briefcase mengukur performa pada beban kerja dunia nyata yang berkelanjutan, bukan sekadar pertanyaan trivia yang terisolasi. Skor yang lebih tinggi berarti sebuah model dapat mempertahankan konteks, merencanakan langkah ke depan, dan tetap fokus pada tugas selama ribuan token – kondisi yang tepat dihadapi pengembang saat membangun asisten, generator kode, atau pembantu riset. Keunggulan Kimi K3 atas GPT-5.6 menunjukkan bahwa model terbuka kini dapat bersaing di ranah yang selama ini didominasi oleh pesaing model tertutup (closed model).
Gambaran teknis
- Ukuran – 2,8 triliun parameter, model open-weight terbesar yang dirilis hingga saat ini.
- Arsitektur – Stable LatentMoE (Mixture-of-Experts) dengan 896 ahli (experts), di mana 16 di antaranya aktif pada satu waktu.
- Jendela konteks – Lebih dari 1 juta token, cukup untuk menampung seluruh buku atau basis kode (codebase) yang panjang.
- Atensi – Kimi Delta Attention, sebuah modifikasi khusus yang diklaim dapat meningkatkan efisiensi penskalaan.
Pilihan-pilihan ini memberikan kapasitas bagi model untuk menangani tugas "jangka panjang" (long-horizon), namun hal ini juga meningkatkan kebutuhan komputasi, yang terlihat pada angka kecepatan dan biaya.
Harga yang menarik perhatian
Moonshot membagi penetapan harga token ke dalam tiga kategori:
| Tipe penggunaan | Biaya per 1 Juta token |
|---|---|
| Input – cache miss | $3.00 |
| Input – cache hit | $0.30 |
| Output | $15.00 |
Perusahaan menyatakan bahwa beban kerja pemrograman mengalami tingkat cache-hit sebesar 90%. Jika benar, ini merupakan opsi yang sangat murah untuk agen pemrograman (coding agents).
Kompromi yang akan Anda rasakan
- Kecepatan – Model ini memproses sekitar 62 token per detik, di bawah median industri. Prompt yang panjang dapat memakan waktu beberapa menit, yang mana sangat berpengaruh untuk penggunaan interaktif.
- Biaya penalaran – Kimi K3 berjalan dengan "upaya penalaran maksimal" (max reasoning effort) secara default dan tidak menyediakan pengaturan untuk menurunkannya. Oleh karena itu, kueri sederhana akan menghabiskan anggaran token yang sama dengan kueri kompleks, sehingga membengkakkan biaya untuk tugas-tugas rutin.
- Penggunaan token tersembunyi – Beberapa pengguna melaporkan adanya system prompt yang cukup besar yang disuntikkan model secara otomatis, menambahkan token yang ditagihkan tetapi tidak terlihat dalam permintaan pengguna.
Faktor-faktor ini berarti harga rendah yang menjadi sorotan dapat terkompensasi oleh waktu penyelesaian yang lebih lambat dan konsumsi token yang lebih tinggi dalam praktiknya.
Ketersediaan dan langkah ke depan
API sudah aktif hari ini, memungkinkan pengembang untuk segera bereksperimen. Bobot model (model weights) itu sendiri akan dirilis pada 27 Juli, setelah itu self-hosting menjadi memungkinkan. Hingga saat itu, pengguna harus mengandalkan layanan hosted Moonshot dan menerima latensi serta struktur harga yang terkait.
Argumen tandingan dari kubu model tertutup
Kesimpulan utama
Kesimpulan utamanya adalah semakin menyempitnya celah antara model tertutup dan model terbuka. Kimi K3 membuktikan bahwa model open-weight dapat menangani pekerjaan yang kompleks dan berjangka panjang.
