Amazon Bedrock kini memungkinkan pengembang untuk melakukan caching pada bagian-bagian prompt, sehingga dapat mengurangi tagihan penggunaan token hingga 90% dan memangkas latensi respons hingga 85% untuk aplikasi yang menggunakan kembali awalan (prefix) prompt statis.

Mengapa perubahan ini penting

Menjalankan large language model secara on-demand membutuhkan biaya setiap kali token dikirim ke model. Chatbot, asisten kode, dan alat pencarian dokumen sering kali mengirim ulang instruksi sistem atau materi referensi yang sama, sehingga membengkakkan pengeluaran dan memperlambat respons.

Cara kerja prompt caching

Bedrock menambahkan flag “cacheable” yang dapat dipasangkan pengembang ke segmen prompt apa pun—biasanya berupa instruksi tingkat sistem, dokumen latar belakang yang panjang, atau definisi alat yang tidak pernah berubah selama sesi berlangsung. Saat permintaan tiba, Bedrock memeriksa apakah segmen yang ditandai tersebut cocok dengan entri yang tersimpan. Jika cocok, layanan tersebut akan melewati proses re-encoding dan menjalankan ulang bagian tersebut melalui model, melainkan langsung mengambil representasi yang telah dihitung sebelumnya dari cache.

Angka-angkanya

  • Biaya token input: pengurangan hingga 90% karena awalan yang di-cache tidak lagi mengonsumsi token pada setiap panggilan.
  • Latensi: hingga 85% lebih cepat karena beban kerja berat model dihindari untuk bagian yang statis.

Skenario yang paling sesuai

Fitur ini sangat berguna ketika prompt berisi blok besar yang tidak berubah, diikuti oleh kueri pengguna yang pendek dan bervariasi. Pola umum meliputi:

  • Pipeline Retrieval-augmented generation (RAG) yang menyisipkan dokumen yang diambil ke setiap kueri.
  • Bot dukungan pelanggan yang selalu dimulai dengan pernyataan kebijakan atau teks pengatur nada yang sama.
  • Asisten pengkodean yang memuat definisi bahasa-alat yang tetap sebelum cuplikan kode pengembang.

Apa yang perlu diubah oleh pengembang

Pengembang harus menyusun ulang prompt agar konten statis berada di bagian paling awal dan tetap identik byte-demi-byte di setiap panggilan. Input pengguna yang bervariasi mengikuti awalan yang di-cache tersebut. Tidak diperlukan penggantian model; endpoint Bedrock yang sama akan menangani permintaan tersebut.

Siapa yang diuntungkan, siapa yang perlu waspada

Keuntungan ini hanya berlaku untuk beban kerja di mana awalan benar-benar tetap statis. Aplikasi yang mempersonalisasi instruksi sistem per pengguna atau sering mengubah konteks akan melihat sedikit manfaat dan harus mempertimbangkan kompleksitas prompting tambahan dibandingkan dengan keuntungan yang kecil.

Intinya: Prompt caching memberikan pengguna Bedrock cara yang praktis untuk memangkas biaya operasional AI dan meningkatkan waktu respons, asalkan aplikasi mereka dapat mengisolasi awalan prompt yang dapat digunakan kembali.