AWS menambahkan kompresi sadar-kueri (query-aware compression) ke layanan Bedrock-nya, yang memungkinkan pengembang memangkas potongan dokumen yang tidak relevan sebelum mencapai model bahasa. Dengan mengurangi jumlah token yang dikirim ke model, fitur ini dapat menurunkan biaya komputasi untuk alur kerja (pipeline) Retrieval-Augmented Generation (RAG).
Mengapa alur kerja RAG memakan banyak biaya
Sistem RAG pertama-tama mengambil kutipan teks dari basis pengetahuan, lalu memberikan kutipan tersebut ke model generatif untuk menjawab pertanyaan pengguna. Sebagian besar implementasi mengirimkan setiap potongan yang diambil langsung ke model, bahkan ketika sebagian besar teks tidak ada hubungannya dengan kueri tersebut. Setiap kata tambahan menjadi sebuah token, dan setiap token yang diproses model menambah biaya pada API yang digunakan. Bagi perusahaan kecil dan menengah yang menjalankan bot dukungan atau alat pencarian internal, pengeluaran token dapat dengan cepat melampaui biaya panggilan model itu sendiri.
Apa yang dilakukan oleh kompresi sadar-kueri
Kemampuan Bedrock yang baru ini menyisipkan langkah penyaringan di antara proses pengambilan (retrieval) dan pembuatan (generation):
- Sistem tetap mengambil kumpulan dokumen yang sama untuk sebuah kueri.
- Sebelum model melihat teks apa pun, sebuah prosesor ringan mengevaluasi setiap kutipan terhadap pertanyaan spesifik tersebut.
- Hanya bagian yang dianggap relevan yang dipertahankan; sisanya dibuang sebagai gangguan (noise).
Anda tidak memerlukan indeks baru, model embedding, atau model bahasa yang telah disetel halus (fine-tuned). Perubahannya hanyalah menyusun ulang alur kerja untuk memanggil lapisan kompresi tersebut.
Dampak bisnis
Karena biaya token meningkat seiring dengan jumlah teks yang dikirim ke model, menghapus cuplikan yang tidak relevan dapat mengurangi tagihan secara bertahap. Perusahaan yang melihat biaya RAG mereka membengkak seiring dengan meningkatnya penggunaan akan merasakan keuntungan terbesar.
Apa yang perlu diperhatikan selanjutnya
- Uji coba fitur pada data Anda sendiri: Jalankan pengujian berdampingan antara alur RAG standar dengan alur yang menyertakan kompresi sadar-kueri. Ukur jumlah token, latensi, dan relevansi jawaban.
- Transparansi vendor: Saat mengevaluasi platform RAG pihak ketiga, tanyakan apakah mereka menggunakan kompresi atau penyaringan dalam alur pengambilan mereka. Vendor yang mengirimkan potongan mentah kemungkinan besar akan menghasilkan tagihan bulanan yang lebih tinggi.
Kesimpulan
Penyesuaian alur kerja yang sederhana—menyaring teks yang tidak relevan sebelum mencapai model—dapat mengubah pengeluaran tersembunyi menjadi pos biaya yang dapat dikendalikan. Bagi organisasi yang sudah membayar untuk RAG berbasis Bedrock, mengaktifkan kompresi sadar-kueri adalah eksperimen dengan upaya rendah, namun penghematan apa pun akan bergantung pada data spesifik Anda.
