AWS telah menambah mampatan sedar-kueri (query-aware compression) kepada perkhidmatan Bedrock miliknya, membolehkan pembangun memotong cebisan dokumen yang tidak relevan sebelum ia sampai ke model bahasa. Dengan mengurangkan token yang dihantar ke model, ciri ini dapat mengurangkan bil pengiraan untuk saluran paip Retrieval-Augmented Generation (RAG).
Mengapa saluran paip RAG membazirkan wang
Sistem RAG terlebih dahulu menarik petikan teks daripada pangkalan pengetahuan, kemudian menyalurkan petikan tersebut kepada model generatif untuk menjawab soalan pengguna. Kebanyakan pelaksanaan menghantar setiap cebisan yang diperoleh terus ke model, walaupun sebahagian besar teks tersebut tidak mempunyai kaitan dengan kueri. Setiap perkataan tambahan menjadi satu token, dan setiap token yang diproses oleh model akan menambah caj pada API yang digunakan. Bagi syarikat kecil dan sederhana yang menjalankan bot sokongan atau alat carian dalaman, perbelanjaan token boleh dengan cepat mengatasi kos panggilan model itu sendiri.
Apa yang dilakukan oleh mampatan sedar-kueri
Keupayaan Bedrock yang baharu ini menyelitkan langkah penapisan antara pengambilan (retrieval) dan penjanaan (generation):
- Sistem masih menarik set dokumen yang sama untuk sesuatu kueri.
- Sebelum model melihat sebarang teks, pemproses ringan akan menilai setiap petikan berdasarkan soalan khusus tersebut.
- Hanya bahagian yang dianggap relevan akan disimpan; selebihnya akan dibuang sebagai hingar.
Anda tidak memerlukan indeks baharu, model embedding, atau model bahasa yang telah ditala halus (fine-tuned). Perubahan ini hanyalah penyambungan semula saluran paip untuk memanggil lapisan mampatan tersebut.
Impak perniagaan
Oleh kerana yuran token meningkat mengikut jumlah teks yang dihantar ke model, membuang petikan yang tidak relevan dapat mengurangkan bil baris demi baris. Syarikat yang melihat kos RAG mereka melambung tinggi apabila penggunaan meningkat akan mendapat manfaat terbesar.
Apa yang perlu diperhatikan seterusnya
- Uji rintis ciri ini pada data anda sendiri: Jalankan ujian sebelah-menyebelah antara aliran RAG standard berbanding aliran yang menyertakan mampatan sedar-kueri. Ukur jumlah token, kependaman (latency), dan kaitan jawapan.
- Ketelusan vendor: Semasa menilai platform RAG pihak ketiga, tanya sama ada mereka menggunakan mampatan atau penapisan dalam saluran paip pengambilan mereka. Vendor yang menghantar cebisan mentah berkemungkinan besar akan menghasilkan invois bulanan yang lebih tinggi.
Kesimpulan
Penambahbaikan kecil pada saluran paip—menapis teks yang tidak relevan sebelum ia sampai ke model—boleh mengubah perbelanjaan tersembunyi menjadi item baris yang boleh dikawal. Bagi organisasi yang sudah membayar untuk RAG berasaskan Bedrock, mengaktifkan mampatan sedar-kueri adalah eksperimen dengan usaha yang rendah, tetapi sebarang penjimatan akan bergantung pada data khusus anda.
