AWS ได้เพิ่มฟีเจอร์ query-aware compression ให้กับบริการ Bedrock ซึ่งช่วยให้นักพัฒนาสามารถตัดส่วนของเอกสารที่ไม่เกี่ยวข้องออกก่อนที่จะส่งไปยังโมเดลภาษา (language model) การลดจำนวนโทเคน (tokens) ที่ส่งไปยังโมเดลจะช่วยลดค่าใช้จ่ายในการประมวลผลสำหรับ pipeline ของ Retrieval-Augmented Generation (RAG) ได้

ทำไม pipeline ของ RAG ถึงสิ้นเปลืองงบประมาณ

ระบบ RAG จะดึงข้อความจากฐานความรู้ (knowledge base) มาก่อน จากนั้นจึงส่งข้อความเหล่านั้นไปยังโมเดลแบบ generative เพื่อตอบคำถามของผู้ใช้ การใช้งานส่วนใหญ่มักจะส่งทุก chunk ที่ดึงมาได้ไปยังโมเดลโดยตรง แม้ว่าข้อความส่วนใหญ่จะไม่เกี่ยวข้องกับคำถามเลยก็ตาม ทุกคำที่เพิ่มเข้ามาจะกลายเป็นโทเคน และทุกโทเคนที่โมเดลประมวลผลจะเพิ่มค่าใช้จ่ายในการเรียกใช้ API สำหรับบริษัทขนาดเล็กและขนาดกลางที่รัน support bots หรือเครื่องมือค้นหาภายในองค์กร ค่าใช้จ่ายด้านโทเคนอาจพุ่งสูงจนแซงหน้าค่าใช้จ่ายในการเรียกใช้โมเดลเองได้อย่างรวดเร็ว

query-aware compression ทำงานอย่างไร

ความสามารถใหม่ของ Bedrock นี้จะเพิ่มขั้นตอนการกรอง (filtering step) ระหว่างขั้นตอนการดึงข้อมูล (retrieval) และการสร้างคำตอบ (generation):

  • ระบบยังคงดึงชุดเอกสารชุดเดิมสำหรับคำถามนั้นๆ
  • ก่อนที่โมเดลจะเห็นข้อความใดๆ ตัวประมวลผลขนาดเล็ก (lightweight processor) จะประเมินข้อความแต่ละส่วนเทียบกับคำถามที่เฉพาะเจาะจง
  • จะเก็บไว้เฉพาะส่วนที่พิจารณาแล้วว่าเกี่ยวข้องเท่านั้น ส่วนที่เหลือจะถูกตัดทิ้งในฐานะข้อมูลรบกวน (noise)

คุณไม่จำเป็นต้องสร้าง index ใหม่, embedding model ใหม่ หรือ fine-tuned language model ใหม่ การเปลี่ยนแปลงนี้เป็นเพียงการปรับเปลี่ยน pipeline เพื่อเรียกใช้งานเลเยอร์การบีบอัด (compression layer) เท่านั้น

ผลกระทบทางธุรกิจ

เนื่องจากค่าธรรมเนียมโทเคนจะเพิ่มขึ้นตามปริมาณข้อความที่ส่งไปยังโมเดล การลบส่วนที่ไม่เกี่ยวข้องออกจึงสามารถช่วยลดค่าใช้จ่ายลงได้ในทุกๆ บรรทัด บริษัทที่พบว่าค่าใช้จ่าย RAG พุ่งสูงขึ้นตามการใช้งานที่เพิ่มขึ้นจะได้รับประโยชน์สูงสุดจากฟีเจอร์นี้

สิ่งที่ควรดำเนินการต่อไป

  • ทดลองใช้ฟีเจอร์กับข้อมูลของคุณเอง: ทำการทดสอบเปรียบเทียบระหว่าง RAG flow แบบมาตรฐาน กับแบบที่ใช้ query-aware compression โดยวัดจากจำนวนโทเคน, ความหน่วง (latency) และความเกี่ยวข้องของคำตอบ
  • ความโปร่งใสของผู้ให้บริการ: เมื่อประเมินแพลตฟอร์ม RAG จากผู้ให้บริการภายนอก ให้สอบถามว่ามีการใช้การบีบอัดหรือการกรองใน retrieval pipeline หรือไม่ ผู้ให้บริการที่ส่งข้อมูลแบบ raw chunks มักจะทำให้คุณต้องจ่ายค่าบริการรายเดือนที่สูงกว่า

บทสรุป

การปรับเปลี่ยน pipeline เพียงเล็กน้อย—นั่นคือการกรองข้อความที่ไม่เกี่ยวข้องออกก่อนจะถึงโมเดล—สามารถเปลี่ยนค่าใช้จ่ายที่ซ่อนอยู่ให้กลายเป็นรายการที่ควบคุมได้ สำหรับองค์กรที่ใช้งาน Bedrock-based RAG อยู่แล้ว การเปิดใช้งาน query-aware compression เป็นการทดลองที่ใช้ความพยายามน้อย แต่การประหยัดค่าใช้จ่ายจะขึ้นอยู่กับลักษณะข้อมูลเฉพาะของคุณ