Kimi K3 kehabisan tenaga sementara GPT-5.6-SOL berhasil mencapai garis finis pada tiga prompt berat—sebuah masalah probabilitas, skenario inersia katrol, dan skrip Python ransel yang rumit. Kesenjangan ini menunjukkan mengapa penganggaran token dan latensi sangat penting saat Anda membutuhkan model yang dapat melakukan penalaran melalui matematika, fisika, dan kode multi-langkah tanpa terhenti.
Mengapa tolok ukur ini penting
Pengembang dan peneliti sering kali memilih LLM berdasarkan skor utama, bukan pada bagaimana model tersebut berperilaku di bawah tekanan dunia nyata. Dalam pengujian berdampingan ini, setiap model menangani masalah yang memaksa rantai penalaran yang panjang. GPT-5.6-SOL memberikan jawaban yang lengkap dan benar di ketiga domain; Kimi K3 menghabiskan anggaran tokennya atau mengalami timeout sebelum menghasilkan sesuatu yang dapat digunakan.
Pengaturan pengujian
- Matematika – pertanyaan probabilitas yang memerlukan penghitungan probabilitas tumpang tindih pola serta ekspektasi dan varians (momen kedua).
- Fisika – memodelkan inersia katrol dan hilangnya energi saat kabel bertegangan pegas mengendur.
- Pemrograman – menulis solusi Python untuk masalah pengemasan ransel dengan dependensi kompleks dan aturan tie-break, lalu memeriksa output terhadap enam kasus uji independen.
Apa yang dikatakan angka-angka tersebut
GPT-5.6-SOL
- Matematika – menghasilkan solusi lengkap dan benar dengan nilai ekspektasi dan varians yang dipaparkan dengan jelas.
- Fisika – membangun model inersia dengan benar dan memperhitungkan hilangnya energi, sesuai dengan jawaban analitis.
- Pemrograman – menghasilkan kode yang berhasil dikompilasi, dijalankan, dan lolos dari keenam pemeriksaan eksternal. Sebuah asersi tes internal salah, mengingatkan kita bahwa tes yang dihasilkan model tidaklah sempurna.
Kimi K3
- Matematika – mencapai batas maksimum token (pertama pada 6.500 token, lalu pada 10.000 token) dan berhenti tanpa menunjukkan jawaban apa pun.
- Fisika – kehabisan token sebelum ada output yang terlihat.
- Pemrograman – mengalami timeout setelah 245 detik, tidak memberikan apa pun untuk dievaluasi.
Efisiensi penalaran vs. kekuatan mentah
Implikasinya jelas bagi siapa pun yang membangun alur kerja produksi: model yang menghabiskan banyak token tanpa memberikan output dapat menghambat proses hilir, meningkatkan biaya, dan membuat pengguna frustrasi.
Keandalan dan biaya tersembunyi dari kode yang “sempurna”
Bahkan model pemenang pun melakukan kesalahan: kasus uji yang dihasilkan sendiri oleh GPT-5.6-SOL mengandung asersi yang salah. Ini menunjukkan bahwa validasi yang dihasilkan model bukanlah pengganti peninjauan manusia. Saat model menulis kode, Anda tetap perlu menjalankan pemeriksaan independen.
Apa yang perlu diperhatikan selanjutnya
- Pelacakan alasan selesai (finish reason tracking) – catat apakah respons berakhir karena mencapai batas token, timeout, atau berhenti secara alami.
- Jumlah token penalaran – bandingkan berapa banyak token yang dihabiskan setiap model untuk pertimbangan internal dibandingkan dengan output akhir.
- Pemantauan latensi – ukur waktu nyata (wall-clock time) untuk setiap langkah; model yang membutuhkan waktu beberapa menit per kueri mungkin tidak cocok untuk aplikasi interaktif.
Pengembang harus memperlakukan metrik ini sebagai sinyal utama, bukan sekadar jawaban akhir.
Kesimpulan
GPT-5.6-SOL mengungguli Kimi K3 dalam hal kelengkapan. Pengujian ini juga mengingatkan kita bahwa bahkan model yang “berhasil menjawab dengan benar” pun masih dapat menghasilkan pemeriksaan internal yang cacat, sehingga pengawasan manusia tetap sangat penting. Melacak alasan selesai, penggunaan token, dan latensi akan membantu Anda memilih alat yang tepat untuk pekerjaan tersebut tanpa terjebak dalam timeout yang tidak terdeteksi.
