Amazon Bedrock kini membolehkan pembangun menyimpan cache bahagian tertentu dalam prom, mengurangkan bil penggunaan token sehingga 90% dan memendekkan kependaman respons sehingga 85% bagi aplikasi yang menggunakan semula awalan prom statik.
Mengapa perubahan ini penting
Menjalankan model bahasa besar mengikut permintaan memerlukan kos setiap kali token dihantar ke model tersebut. Chatbot, pembantu kod, dan alat carian dokumen sering menghantar semula arahan sistem atau bahan rujukan yang sama, sekali gus meningkatkan perbelanjaan dan melambatkan respons.
Cara kerja caching prom
Bedrock menambah flag “cacheable” yang boleh dipasang oleh pembangun pada mana-mana segmen prom—biasanya arahan peringkat sistem, dokumen latar belakang yang panjang, atau definisi alatan yang tidak berubah semasa sesi berlangsung. Apabila permintaan tiba, Bedrock menyemak sama ada segmen yang ditandakan itu sepadan dengan entri yang disimpan. Jika sepadan, perkhidmatan tersebut akan melangkau proses pengekodan semula dan menjalankan semula bahagian tersebut melalui model, sebaliknya ia akan mengambil representasi yang telah dikira lebih awal daripada cache.
Angka-angka utama
- Kos token input: pengurangan sehingga 90% kerana awalan yang disimpan dalam cache tidak lagi menggunakan token pada setiap panggilan.
- Kependaman (Latency): sehingga 85% lebih pantas memandangkan beban kerja berat model dapat dielakkan untuk bahagian statik tersebut.
Senario yang paling sesuai
Ciri ini sangat berkesan apabila prom mengandungi blok besar yang tidak berubah, diikuti oleh pertanyaan pengguna yang pendek dan berubah-ubah. Corak biasa termasuk:
- Saluran (pipeline) penjanaan dipertingkat pengambilan (RAG) yang menyertakan dokumen yang diambil pada setiap pertanyaan.
- Bot sokongan pelanggan yang sentiasa bermula dengan kenyataan polisi atau teks penetapan nada yang sama.
- Pembantu pengekodan yang memuatkan definisi alatan bahasa tetap sebelum petikan kod pembangun.
Apa yang perlu diubah oleh pembangun
Pembangun mesti menyusun semula prom supaya kandungan statik berada di bahagian paling awal dan kekal identik secara byte-demi-byte merentasi setiap panggilan. Input pengguna yang berubah-ubah akan menyusul selepas awalan yang disimpan dalam cache tersebut. Tiada pertukaran model diperlukan; endpoint Bedrock yang sama akan mengendalikan permintaan tersebut.
Siapa yang mendapat manfaat, siapa yang perlu berwaspada
Kelebihan ini hanya terpakai kepada beban kerja di mana awalan tersebut benar-benar kekal statik. Aplikasi yang memperibadikan arahan sistem bagi setiap pengguna atau kerap mengubah konteks akan melihat sedikit manfaat dan perlu mempertimbangkan kerumitan prom tambahan berbanding keuntungan yang kecil.
Kesimpulannya: Caching prom memberikan pengguna Bedrock satu cara yang mudah untuk mengurangkan kos operasi AI dan menambah baik masa respons, asalkan aplikasi mereka dapat mengasingkan awalan prom yang boleh digunakan semula.
