API prompt-caching baharu Claude Opus 5 memangkas bil token bagi aplikasi gaya sembang dengan membolehkan model melangkau pembacaan semula teks yang tidak berubah. Permintaan pertama dikenakan premium yang kecil; setiap capaian seterusnya hanya menelan kos kira-kira satu persepuluh daripada kadar asas, menukarkan perbelanjaan berulang kepada caj sekali sahaja.

Mengapa pembangun membayar dua kali untuk perkataan yang sama

Kebanyakan antara muka perbualan membina semula keseluruhan prompt pada setiap pusingan: prompt sistem sebanyak 8,000 token, PDF yang dilampirkan, dan sejarah dialog penuh dihantar bersama-sama ke model setiap kali pengguna bertanya soalan susulan. Model memproses semula setiap token walaupun sebahagian besar teks tersebut tidak pernah berubah. Pada harga semasa, redundansi tersebut boleh mendominasi kos bot yang sibuk.

Bagaimana cache mengubah pengiraan

API ini mencipta entri cache untuk setiap "blok" token sehingga ke titik henti (breakpoint) yang ditetapkan. Apabila permintaan seterusnya mengandungi blok yang sama di bahagian hadapan, perkhidmatan akan membacanya daripada cache dan bukannya melakukan tokenisasi semula. Pecahan harga mencerminkan kerja yang dijimatkan:

  • Cache write – TTL 5 minit: 1.25 × harga asas
  • Cache write – TTL 1 jam: 2 × harga asas
  • Cache read (hit): 0.1 × harga asas

Dalam praktiknya, panggilan pertama ke blok baharu menelan kos sedikit lebih tinggi daripada permintaan biasa. Setiap panggilan kemudian yang mencapai cache adalah 90% lebih murah, jadi perbelanjaan bersih menurun secara mendadak apabila perbualan semakin mendalam.

"Peraturan emas" untuk menstruktur prompt

Keberkesanan cache bergantung pada di mana anda meletakkan kandungan statik berbanding kandungan dinamik. Letakkan semua yang kekal sama di bahagian hadapan, dan letakkan bahagian yang sentiasa berubah di bahagian akhir. Susunan yang boleh dipercayai adalah seperti berikut:

  1. Tools – definisi sebarang fungsi luaran yang mungkin dipanggil oleh model.
  2. System instructions – tingkah laku tahap tinggi yang anda mahu model ikuti.
  3. Documents – konteks panjang seperti PDF, pangkalan pengetahuan, atau petikan polisi.
  4. User questions – pertanyaan langsung yang berubah pada setiap pusingan.

Jika anda mengubah mana-mana token sebelum titik henti, entri cache akan terbatal dan model mesti memproses semula semua yang menyusul.

Had tersembunyi yang perlu anda patuhi

  • Saiz blok minimum – Opus 5 hanya menyimpan cache blok yang mengandungi sekurang-kurangnya 512 token. Apa-apa yang lebih kecil akan terlepas daripada cache sepenuhnya.
  • Pepijat cap masa (Timestamp bug) – memasukkan cap masa yang berubah di dalam blok yang disimpan dalam cache akan menjamin kegagalan capaian (miss), kerana teks blok tersebut tidak akan sepadan dengan tepat.
  • Imbasan balik 20-blok – perkhidmatan hanya mengimbas 20 blok terakhir untuk padanan. Sesi yang berjalan lama yang melompat ke hadapan dengan cepat boleh melepasi tetingkap cache.
  • Permintaan selari – menghantar beberapa permintaan yang serupa pada masa yang sama akan menyebabkan semuanya gagal (miss), kerana cache hanya diisi selepas permintaan pertama selesai. Panaskan cache dengan satu panggilan, kemudian buat permintaan selebihnya.

Melihat penjimatan dalam respons API anda

Setiap respons melaporkan tiga pengira token:

  • cache_read_input_tokens – token yang datang daripada capaian cache (cache hit).
  • cache_creation_input_tokens – token yang ditulis ke dalam cache dalam permintaan ini.
  • input_tokens – token baharu yang tidak disimpan dalam cache.

Tambahkan ketiga-tiga nombor tersebut untuk mendapatkan jumlah token yang dipertimbangkan oleh model untuk pusingan tersebut. Jika kedua-dua medan cache adalah sifar, permintaan tersebut telah terlepas cache; semak saiz blok dan penempatan titik henti anda.

Rumusan: Dengan meletakkan konteks yang tidak berubah di bahagian hadapan dan membiarkan API prompt-caching Claude Opus 5 melakukan kerja berat, anda menukarkan perbelanjaan token berulang kepada caj sekali sahaja. Hasilnya ialah pengurangan kos yang drastik bagi mana-mana chatbot yang merujuk secara berulang kali kepada prompt sistem atau set dokumen yang sama—asalkan anda mematuhi had minimum token, mengelakkan penanda yang boleh berubah di dalam blok cache, dan memastikan kandungan yang layak untuk cache berada dalam lingkungan 20-blok.