Claude Opus 5 kini berbiaya tiga kali lipat lebih mahal daripada Opus 4.8 untuk beban kerja yang sama, meskipun kedua model mencantumkan harga per token yang sama. Penyebabnya adalah fitur default “adaptive thinking”, yang secara diam-diam mengonsumsi token output sebagai penalaran tersembunyi (hidden reasoning). Mematikan fitur tersebut mengembalikan kesetaraan biaya tanpa mengurangi akurasi.
Mengapa terdapat perbedaan harga
Kedua versi mengenakan biaya $5 per satu juta token input dan $25 per satu juta token output. Dalam benchmark kami, tagihan Opus 5 adalah 3,1 × lebih tinggi daripada Opus 4.8 saat menjalankan prompt yang identik. Biaya tambahan tersebut bukan berasal dari harga daftar yang lebih tinggi; melainkan sudah tercakup dalam cara Opus 5 memperhitungkan proses berpikir internalnya.
Apa yang dilakukan adaptive thinking
Saat adaptive thinking diaktifkan, model melakukan penalaran internal tambahan sebelum mengeluarkan jawaban akhir. Penalaran tersebut dihitung sebagai token output, meskipun tidak pernah sampai ke pengguna. Pada kueri yang sederhana, antara 42% hingga 95% dari token output yang ditagihkan adalah penalaran tersembunyi ini. Oleh karena itu, masalah aritmatika sederhana yang seharusnya menghasilkan jawaban satu digit dapat menghasilkan puluhan token yang tidak terlihat, sehingga membengkakkan biaya secara drastis.
Fitur ini bukanlah bug—desainer Claude sengaja membuatnya untuk meningkatkan kualitas jawaban pada tugas-tugas kompleks. Dalam praktiknya, penalaran tersembunyi ini sering kali memberikan peningkatan akurasi yang moderat pada prompt yang sulit, terutama saat model harus merangkai beberapa langkah atau berinteraksi dengan alat eksternal.
Cara mengontrol biaya
Model ini menerima satu parameter tunggal yang menonaktifkan adaptive thinking:
{
"thinking": {"type": "disabled"}
}
Menerapkan pengaturan ini pada Opus 5 menurunkan biaya per tugasnya menjadi persis sama dengan biaya Opus 4.8, sementara kebenaran hasilnya tetap sama pada beban kerja sederhana yang kami uji.
Kapan harus menonaktifkan
- Ekstraksi data dari teks
- Operasi pemformatan (misalnya, konversi JSON)
- Pemanggilan satu langkah di mana jawabannya adalah pencarian langsung atau perhitungan sepele
Menonaktifkan penalaran dalam kasus-kasus ini menghilangkan "pajak token" tersembunyi dan menjaga tagihan tetap terprediksi.
Kapan harus tetap mengaktifkannya
- Tugas yang memerlukan rantai logika mendalam atau penalaran yang bernuansa
- Alur kerja agen (agent workflows) yang memanggil alat eksternal secara berulang kali
Dalam skenario yang padat penggunaan alat (tool-heavy), selisih biaya menyempit menjadi sekitar 33% karena model menghabiskan lebih sedikit untuk penalaran internal saat melakukan pengulangan (looping) melalui pemanggilan alat.
Perbedaan penting lainnya
- Context window: Opus 5 dapat menampung hingga satu juta token, yang kami verifikasi dengan mengambil string target yang ditempatkan pada token 969.950.
- Cache floor: Ukuran cache minimum turun menjadi 512 token, setengah dari batas minimum Opus 4.8, yang memengaruhi seberapa banyak percakapan sebelumnya yang dapat digunakan kembali oleh model tanpa melakukan tokenisasi ulang.
Apa yang perlu diperhatikan selanjutnya
Pengembang harus memantau laporan penggunaan untuk “reasoning tokens” atau item baris serupa yang menunjukkan bahwa adaptive thinking sedang aktif. Seiring semakin banyaknya aplikasi yang mengadopsi Claude untuk operasi gaya agen, pertukaran (trade-off) antara biaya dan kualitas akan menjadi keputusan optimasi utama. Pembaruan di masa mendatang mungkin memungkinkan pengguna untuk mengatur kedalaman penalaran daripada sekadar sakelar on/off, yang dapat memperhalus kurva biaya.
Kesimpulan: Adaptive thinking bawaan Opus 5 membengkakkan penggunaan token pada tugas-tugas mudah. Nonaktifkan dengan pengaturan sederhana di atas agar biayanya sesuai dengan Opus 4.8, dan hanya aktifkan jika penalaran tambahan tersebut sebanding dengan biaya tambahan yang dikeluarkan.
