API prompt-caching baru dari Claude Opus 5 memangkas tagihan token untuk aplikasi bergaya chat dengan membiarkan model melewatkan pembacaan ulang teks yang tidak berubah. Permintaan pertama membayar premi yang moderat; setiap pemanggilan berikutnya hanya berbiaya sekitar sepersepuluh dari tarif dasar, mengubah pengeluaran berulang menjadi biaya satu kali.
Mengapa pengembang membayar dua kali untuk kata-kata yang sama
Sebagian besar antarmuka percakapan membangun kembali seluruh prompt pada setiap giliran: prompt sistem sebanyak 8.000 token, PDF yang dilampirkan, dan seluruh riwayat dialog dikirim bersama-sama ke model setiap kali pengguna mengajukan pertanyaan lanjutan. Model memproses ulang setiap token meskipun sebagian besar teks tersebut tidak pernah berubah. Dengan harga saat ini, redundansi tersebut dapat mendominasi biaya bot yang sibuk.
Bagaimana cache mengubah perhitungan biaya
API ini membuat entri cache untuk setiap “blok” token hingga breakpoint yang ditentukan. Ketika permintaan berikutnya berisi blok yang sama di bagian depan, layanan akan membacanya dari cache alih-alih melakukan tokenisasi ulang. Pembagian harga mencerminkan penghematan kerja yang dilakukan:
- Cache write – TTL 5 menit: 1,25 × harga dasar
- Cache write – TTL 1 jam: 2 × harga dasar
- Cache read (hit): 0,1 × harga dasar
Dalam praktiknya, panggilan pertama ke blok baru memakan biaya sedikit lebih mahal daripada permintaan normal. Setiap panggilan berikutnya yang mengenai cache 90% lebih murah, sehingga pengeluaran bersih turun drastis seiring mendalamnya percakapan.
"Aturan emas" untuk menyusun prompt
Efektivitas cache bergantung pada di mana Anda menempatkan konten statis versus dinamis. Letakkan semua yang tetap sama di bagian depan, dan dorong bagian yang selalu berubah ke bagian akhir. Urutan yang andal terlihat seperti ini:
- Tools – definisi dari fungsi eksternal apa pun yang mungkin dipanggil oleh model.
- System instructions – perilaku tingkat tinggi yang Anda ingin model ikuti.
- Documents – konteks panjang seperti PDF, basis pengetahuan, atau kutipan kebijakan.
- User questions – kueri langsung yang bervariasi di setiap giliran.
Jika Anda mengubah token apa pun sebelum breakpoint, entri cache akan dibatalkan dan model harus memproses ulang semua yang mengikutinya.
Batasan tersembunyi yang perlu Anda patuhi
- Minimum block size – Opus 5 hanya menyimpan cache blok yang berisi setidaknya 512 token. Apa pun yang lebih kecil akan sepenuhnya melewati cache.
- Timestamp bug – memasukkan timestamp yang berubah di dalam blok yang di-cache menjamin kegagalan cache (miss), karena teks blok tersebut tidak akan pernah cocok secara persis.
- 20-block look-back – layanan hanya memindai 20 blok terakhir untuk mencari kecocokan. Sesi berdurasi panjang yang melompat maju dengan cepat dapat melampaui jendela cache.
- Parallel requests – mengirim beberapa permintaan identik pada saat yang sama semuanya akan gagal (miss), karena cache baru terisi setelah permintaan pertama selesai. Hangatkan cache dengan satu panggilan, lalu kirim sisanya.
Melihat penghematan dalam respons API Anda
Setiap respons melaporkan tiga penghitung token:
cache_read_input_tokens– token yang berasal dari cache hit.cache_creation_input_tokens– token yang ditulis ke cache dalam permintaan ini.input_tokens– token baru yang tidak di-cache.
Jumlahkan ketiga angka tersebut untuk mendapatkan total token yang dipertimbangkan model untuk giliran tersebut. Jika kedua kolom cache bernilai nol, permintaan tersebut gagal mengenai cache; periksa ukuran blok dan penempatan breakpoint Anda.
Kesimpulan: Dengan menempatkan konteks yang tidak dapat diubah di bagian depan dan membiarkan API prompt-caching Claude Opus 5 melakukan pekerjaan berat, Anda mengubah pengeluaran token berulang menjadi biaya satu kali. Hasilnya adalah pengurangan biaya yang drastis untuk chatbot apa pun yang berulang kali merujuk pada prompt sistem atau kumpulan dokumen yang sama—asalkan Anda mematuhi batas minimum token, menghindari penanda yang dapat berubah di dalam blok yang di-cache, dan menjaga konten yang memenuhi syarat cache tetap dalam cakupan 20 blok.
