Claude Opus 5 kini menelan kos tiga kali ganda lebih tinggi daripada Opus 4.8 untuk beban kerja yang sama, walaupun kedua-dua model menyenaraikan harga per token yang sama. Punca utamanya ialah ciri "adaptive thinking" lalai, yang secara senyap menggunakan token output sebagai penaakulan tersembunyi. Menutup ciri tersebut akan mengembalikan kesetaraan kos tanpa menjejaskan ketepatan.

Mengapa jurang harga ini berlaku

Kedua-dua versi mengenakan caj $5 bagi setiap satu juta token input dan $25 bagi setiap satu juta token output. Dalam penanda aras kami, bil Opus 5 adalah 3.1 kali lebih tinggi daripada Opus 4.8 apabila menjalankan prom yang serupa. Caj tambahan tersebut bukan berpunca daripada harga senarai yang lebih tinggi; ia sudah terbina dalam cara Opus 5 mengira proses pemikiran dalamannya.

Apa yang dilakukan oleh adaptive thinking

Apabila adaptive thinking diaktifkan, model akan melakukan penaakulan dalaman tambahan sebelum mengeluarkan jawapan akhir. Penaakulan tersebut dikira sebagai token output, walaupun ia tidak pernah sampai kepada pengguna. Bagi pertanyaan yang mudah, antara 42% hingga 95% daripada token output yang dibilkan adalah penaakulan tersembunyi ini. Oleh itu, masalah aritmetik mudah yang sepatutnya menghasilkan jawapan satu digit boleh menjana berpuluh-puluh token yang tidak kelihatan, sekali gus meningkatkan kos secara mendadak.

Ciri ini bukanlah pepijat—pereka Claude bertujuan untuk meningkatkan kualiti jawapan bagi tugasan yang kompleks. Dalam praktiknya, penaakulan tersembunyi ini sering memberikan peningkatan ketepatan yang sederhana pada prom yang sukar, terutamanya apabila model perlu merangka rantaian pelbagai langkah atau berinteraksi dengan alatan luaran.

Cara mengawal kos

Model ini menerima satu parameter tunggal yang mematikan adaptive thinking:

{
  "thinking": {"type": "disabled"}
}

Menggunakan tetapan ini pada Opus 5 akan mengurangkan perbelanjaan setiap tugasan kepada jumlah yang sama seperti yang dikenakan oleh Opus 4.8, manakala ketepatan hasil tetap sama bagi beban kerja mudah yang kami uji.

Bila perlu dimatikan

  • Pengekstrakan data daripada teks
  • Operasi pemformatan (cth., penukaran JSON)
  • Panggilan satu langkah di mana jawapan adalah carian terus atau pengiraan mudah

Mematikan fungsi pemikiran dalam kes-kes ini menghapuskan "cukai token tersembunyi" dan memastikan bil lebih mudah diramal.

Bila perlu dikekalkan

  • Tugasan yang memerlukan rantaian logik yang mendalam atau penaakulan yang bernuansa
  • Aliran kerja ejen yang memanggil alatan luaran secara berulang kali

Dalam senario yang banyak menggunakan alatan, jurang kos mengecil kepada kira-kira 33% kerana model membelanjakan kurang untuk penaakulan dalaman semasa melakukan gelung panggilan alatan.

Perbezaan ketara yang lain

  • Tetingkap konteks: Opus 5 boleh memuatkan sehingga satu juta token, yang kami sahkan dengan mengambil semula rentetan sasaran yang diletakkan pada token 969,950.
  • Lantai cache: Saiz cache minimum menurun kepada 512 token, separuh daripada lantai Opus 4.8, yang mempengaruhi jumlah perbualan terdahulu yang boleh digunakan semula oleh model tanpa melakukan penokenan semula.

Apa yang perlu diperhatikan seterusnya

Pembangun harus memantau laporan penggunaan untuk “reasoning tokens” atau item baris serupa yang menunjukkan bahawa adaptive thinking sedang aktif. Memandangkan lebih banyak aplikasi menggunakan Claude untuk operasi gaya ejen, imbangan antara kos dan kualiti akan menjadi keputusan pengoptimuman utama. Kemas kini masa hadapan mungkin membenarkan pengguna melaraskan kedalaman penaakulan dan bukannya suis "semua atau tiada", yang boleh melicinkan lengkung kos.

Rumusan: Adaptive thinking lalai pada Opus 5 meningkatkan penggunaan token bagi tugasan mudah. Matikan ia dengan tetapan mudah di atas untuk menyamai kos Opus 4.8, dan hanya aktifkan apabila penaakulan tambahan tersebut mewajarkan perbelanjaan tambahan.