Agentic retrieval กำลังถูกกล่าวขวัญว่าเป็นก้าวต่อไปหลังจากกระบวนการ Retrieval-Augmented Generation (RAG) แบบดั้งเดิม โดยสัญญาว่าจะสร้างระบบ AI ในระดับโปรดักชันที่หยุดการหลอน (hallucinating) และเริ่ม "คิด" เกี่ยวกับวิธีการดึงข้อมูล ผู้สนับสนุนกล่าวว่าแนวทางนี้สามารถลดต้นทุนในการตอบคำถามจากคลังเอกสารขนาดใหญ่ได้มากถึง 82 เท่า เมื่อเทียบกับการป้อนข้อมูลทั้งคลังเข้าไปในหน้าต่างบริบท (context window) ของโมเดล ซึ่งเป็นการประหยัดที่สำคัญสำหรับธุรกิจใดก็ตามที่กำลังขยายขนาดการใช้ Generative AI
ทำไมกระบวนการ RAG แบบเดิมถึงยังมีข้อบกพร่อง
เวิร์กโฟลว์ของ RAG แบบคลาสสิกคือลำดับขั้นตอนที่ตายตัว: แบ่งเอกสารออกเป็นส่วนๆ (chunks), ทำการฝังตัว (embed) แต่ละส่วนในพื้นที่เวกเตอร์ความหนาแน่นสูง (dense vector space), จากนั้นจึงดึงเวกเตอร์ที่มีคะแนนสูงสุดสำหรับคำถามของผู้ใช้ ในการสาธิต วิธีนี้ดูเหมือนจะเรียบร้อยดี—โมเดลได้รับข้อความที่ "เกี่ยวข้อง" จำนวนหนึ่งและตอบคำถามได้อย่างมั่นใจ อย่างไรก็ตาม ในการใช้งานจริง ความมั่นใจนั้นมักจะผิดพลาด
ข้อบกพร่องเชิงระบบสามประการที่เป็นตัวขับเคลื่อนปัญหานี้ ได้แก่:
- ความคล้ายคลึงของเวกเตอร์ (Vector similarity) ≠ ความเกี่ยวข้อง: ข้อความสองส่วนอาจมีความใกล้เคียงกันในทางคณิตศาสตร์ แต่กลับแสดงข้อเท็จจริงที่ตรงกันข้ามกัน ซึ่งนำไปสู่การที่โมเดลอ้างอิงข้อมูลที่ผิด
- การแบ่งส่วนข้อมูลทำให้ข้อเท็จจริงขาดตอน: การแบ่งส่วนข้อมูลแบบคงที่ (fixed chunking) มักจะตัดแบ่งประโยคหรือข้อความเพียงประโยคเดียว หากโมเดลได้รับเพียงครึ่งเดียว ก็จะไม่สามารถสร้างข้อมูลส่วนที่ขาดหายไปขึ้นมาใหม่ได้
- คำถามที่ซับซ้อนและไม่ชัดเจน: คำถามในโลกความเป็นจริงมักจะแตกต่างจากข้อมูลที่ใช้ฝึกโมเดลเอ็มเบดดิง (embedding models) ส่วนใหญ่ ดังนั้นการค้นหาความคล้ายคลึงจึงอาจคืนค่าส่วนของข้อมูลที่ไม่เกี่ยวข้องกลับมา
เมื่อกระบวนการดึงข้อมูลคืนค่าบริบทที่ผิดพลาด โมเดลภาษาในขั้นตอนถัดไปก็ยังคงสร้างคำตอบออกมา ซึ่งมักจะมาพร้อมกับความมั่นใจสูง และระบบก็ไม่ได้แจ้งข้อผิดพลาดใดๆ ผลลัพธ์ที่ได้คือ "การหลอนแบบเงียบ" (silent hallucination)—ความล้มเหลวที่เกิดขึ้นโดยไม่มีสัญญาณเตือน ซึ่งตรวจจับได้ยากในบริการที่ใช้งานจริง
การดึงข้อมูลแบบไฮบริด: การแก้ไขแบบค่อยเป็นค่อยไป
การตอบสนองที่พบบ่อยคือการเพิ่มการค้นหาด้วยคำสำคัญ (keyword search) เข้าไปบนเวกเตอร์ความหนาแน่นสูง เพื่อสร้างตัวดึงข้อมูลแบบไฮบริด (hybrid retriever) ที่สามารถจับคู่คำที่ตรงกันเป๊ะๆ ซึ่งโมเดลเอ็มเบดดิงอาจมองข้ามไป การเพิ่มตัวจัดลำดับใหม่ (reranker)—ซึ่งเป็นโมเดลที่สองที่ทำหน้าที่จัดลำดับรายการที่ดึงมาใหม่ตามคะแนนความเกี่ยวข้องที่เรียนรู้มา—จะช่วยเพิ่มความแม่นยำได้มากขึ้นไปอีก
อย่างไรก็ตาม การดึงข้อมูลแบบไฮบริดยังคงทำตามสคริปต์ที่ตายตัว: ทุกคำถามจะกระตุ้นให้เกิดชุดขั้นตอนเดิมเสมอ โดยไม่คำนึงถึงความยากหรือความไม่แน่นอน กระบวนการนี้ไม่สามารถตัดสินใจได้ว่าจำเป็นต้องใช้ข้อมูลเพิ่มหรือไม่ จะย่อยคำถามที่ซับซ้อนออกเป็นคำถามย่อยได้อย่างไร หรือเมื่อใดที่ข้อมูลที่ดึงมานั้นไม่เพียงพอ
Agentic retrieval มองว่าการค้นหาคือกระบวนการตัดสินใจ
Agentic retrieval ปรับเปลี่ยนมุมมองของปัญหาให้เป็นการตัดสินใจหลายขั้นตอนโดย "เอเจนต์" (agent) อัตโนมัติที่เลียนแบบนักวิจัยที่เป็นมนุษย์ โดยเอเจนต์สามารถ:
- เขียนคำถามใหม่ (Rewrite the query): ปรับปรุงการใช้ภาษาที่เป็นภาษาพูดหรือกำกวมให้เป็นมาตรฐานก่อนทำการค้นหา เพื่อเพิ่มโอกาสที่โมเดลการดึงข้อมูลจะเข้าใจเจตนาที่แท้จริง
- ตรวจสอบว่าจำเป็นต้องดึงข้อมูลหรือไม่: สำหรับคำถามที่ตรงไปตรงมา เอเจนต์จะตอบโดยตรง ซึ่งช่วยประหยัดโทเคน (tokens) และหลีกเลี่ยงข้อมูลรบกวนที่ไม่จำเป็น
- วางแผนการค้นหาแบบหลายขั้นตอน: คำถามที่ซับซ้อนจะถูกย่อยออกเป็นคำถามย่อยที่เล็กลง ซึ่งแต่ละคำถามจะถูกค้นหาอย่างเป็นอิสระ แล้วจึงนำมารวมกัน
- แก้ไขด้วยตนเอง (Self-correct): หากผลลัพธ์แรกดูไม่น่าเชื่อถือ เช่น มีคะแนนความมั่นใจต่ำหรือมีหลักฐานที่ขัดแย้งกัน เอเจนต์จะส่งคำถามใหม่อีกครั้งด้วยการใช้รูปแบบคำถามที่ต่างออกไป หรือขยายขอบเขตการค้นหาให้กว้างขึ้น
ข้อโต้แย้งด้านต้นทุน: บริบทที่ยาว (long context) เทียบกับการดึงข้อมูล
นักวิจารณ์บางคนแย้งว่าหน้าต่างบริบท (context windows) ที่ใหญ่ขึ้นเรื่อยๆ จะทำให้การดึงข้อมูลกลายเป็นเรื่องล้าสมัย แต่ข้อโต้แย้งในทางปฏิบัติคือ การป้อนคลังข้อมูลมหาศาลเข้าไปในบริบทของโมเดลนั้นมีต้นทุนสูงกว่าการดึงข้อมูลเฉพาะจุดหลายเท่าตัว จากการประมาณการพบว่าการดึงข้อมูลมีต้นทุน ถูกกว่าถึง 8 ถึง 82 เท่า สำหรับชุดข้อมูลขนาดใหญ่ ในขณะที่ยังคงให้ข้อมูลบริบทที่จำเป็นสำหรับการตอบคำถามที่แม่นยำ หน้าต่างบริบทที่ยาวอาจยังมีประโยชน์สำหรับการใช้เหตุผลที่ละเอียดอ่อนบนชุดเอกสารขนาดเล็กที่ผ่านการคัดสรรมาแล้ว แต่ไม่สามารถแทนที่การค้นหาที่ขยายขนาดได้ (scalable search)
ความโปร่งใสและการตรวจสอบ
ผู้ช่วย AI ระดับโปรดักชันต้องสามารถแสดงแหล่งที่มาได้ Agentic retrieval สามารถแนบการอ้างอิง (citation) ไปกับแต่ละข้อกล่าวอ้าง ช่วยให้ผู้ตรวจสอบที่เป็นมนุษย์สามารถตรวจสอบเส้นทางการตรวจสอบข้อเท็จจริงได้ แนวทาง "แสดงวิธีทำ" (show-your-work) นี้ช่วยสร้างความเชื่อมั่นและทำให้เห็นเส้นทางการดึงข้อมูลที่อ่อนแอ ซึ่งเอเจนต์สามารถเรียนรู้เพื่อหลีกเลี่ยงในการโต้ตอบครั้งต่อไป
สิ่งที่ควรจับตามองต่อไป
- เครื่องมือ (Tooling)
- มาตรฐานการประเมินผล (Evaluation standards)
- โครงการนำร่องในระดับองค์กร (Enterprise pilots)
บทสรุป
Agentic retrieval ก้าวข้ามกระบวนการ RAG แบบเดิมที่ตายตัวและเกิดข้อผิดพลาดได้ง่ายซึ่งครอบคลุมอยู่ในหลายการสาธิต ด้วยการปล่อยให้ระบบ AI ตัดสินใจเองว่าควรค้นหาเมื่อใดและอย่างไร มันจึงช่วยลดการใช้โทเคน ลดต้นทุนได้อย่างมหาศาล และที่สำคัญที่สุดคือ มอบแหล่งข้อมูลที่สามารถตรวจสอบได้สำหรับทุกคำตอบ
