Truy vấn mang tính tác nhân (Agentic retrieval) đang được ca ngợi là bước tiến tiếp theo sau các quy trình tạo phản hồi tăng cường truy vấn (RAG) truyền thống, hứa hẹn các hệ thống AI trong môi trường sản xuất có khả năng ngừng ảo giác và bắt đầu "suy nghĩ" về cách lấy thông tin. Những người ủng hộ cho rằng phương pháp này có thể cắt giảm chi phí trả lời một truy vấn trên các tập hợp tài liệu lớn lên tới 82 lần so với việc đưa toàn bộ kho ngữ liệu vào cửa sổ ngữ cảnh của mô hình, một khoản tiết kiệm quan trọng đối với bất kỳ doanh nghiệp nào đang mở rộng quy mô AI tạo sinh.

Tại sao quy trình RAG cũ lại bộc lộ hạn chế

Quy trình RAG cổ điển là một chuỗi cố định: chia nhỏ tài liệu thành các đoạn (chunks), nhúng mỗi đoạn vào một không gian vector dày đặc, sau đó lấy ra các vector có điểm số cao nhất cho một truy vấn của người dùng. Trong các bản demo, phương pháp này trông có vẻ gọn gàng—mô hình nhận được một vài đoạn văn "liên quan" và trả lời một cách tự tin. Tuy nhiên, trong môi trường sản xuất, sự tự tin đó thường không đúng chỗ.

Ba lỗi hệ thống dẫn đến vấn đề này:

  • Độ tương đồng vector ≠ sự liên quan. Hai đoạn văn có thể gần nhau về mặt toán học trong khi diễn đạt các sự thật trái ngược nhau, khiến mô hình trích dẫn sai khẳng định.
  • Sự phân mảnh làm đứt gãy dữ kiện. Việc chia nhỏ cố định thường xuyên cắt đôi một câu khẳng định duy nhất. Nếu mô hình chỉ nhận được một nửa, nó không thể tái cấu trúc phần còn thiếu.
  • Các truy vấn không rõ ràng. Các câu hỏi trong thế giới thực khác biệt so với dữ liệu huấn luyện của hầu hết các mô hình nhúng, vì vậy tìm kiếm theo độ tương đồng sẽ trả về các đoạn văn không liên quan.

Khi quy trình trả về ngữ cảnh sai, mô hình ngôn ngữ hạ nguồn vẫn đưa ra câu trả lời, thường với sự chắc chắn cao, và hệ thống không báo lỗi. Kết quả là sự ảo giác thầm lặng—một lỗi không tiếng động rất khó phát hiện trong một dịch vụ đang hoạt động.

Truy vấn hỗn hợp: một giải pháp khắc phục từng bước

Một phản ứng phổ biến là xếp chồng tìm kiếm theo từ khóa lên trên các vector dày đặc, tạo ra một bộ truy vấn hỗn hợp có thể bắt được các khớp từ chính xác mà các mô hình nhúng bỏ lỡ. Việc thêm một bộ xếp hạng lại (reranker)—một mô hình thứ hai sắp xếp lại danh sách đã truy vấn dựa trên điểm số liên quan đã học được—sẽ cải thiện độ chính xác hơn nữa.

Truy vấn hỗn hợp vẫn tuân theo một kịch bản tĩnh: mọi truy vấn đều kích hoạt cùng một chuỗi các bước, bất kể độ khó hay tính không chắc chắn. Quy trình này không thể quyết định liệu nó có cần thêm dữ liệu hay không, cách chia một câu hỏi phức tạp thành các câu hỏi phụ, hoặc khi nào một đoạn trích được truy vấn là không đủ.

Truy vấn mang tính tác nhân coi tìm kiếm là một quá trình ra quyết định

Truy vấn mang tính tác nhân định nghĩa lại vấn đề như một chuỗi các quyết định được đưa ra bởi một "tác nhân" (agent) tự trị, mô phỏng một nhà nghiên cứu con người. Tác nhân này có thể:

  • Viết lại truy vấn. Nó chuẩn hóa cách dùng từ thông tục hoặc mơ hồ trước khi tìm kiếm, giúp tăng khả năng các mô hình truy vấn hiểu được ý định.
  • Xác định xem có cần truy vấn hay không. Đối với các truy vấn đơn giản, tác nhân sẽ trả lời trực tiếp, giúp tiết kiệm token và tránh những nhiễu không cần thiết.
  • Lập kế hoạch tìm kiếm đa bước. Các câu hỏi phức tạp được chia nhỏ thành các câu hỏi phụ nhỏ hơn, mỗi câu hỏi được tìm kiếm độc lập, sau đó được kết hợp lại.
  • Tự sửa lỗi. Nếu kết quả ban đầu có vẻ yếu—ví dụ: điểm tự tin thấp hoặc bằng chứng mâu thuẫn—tác nhân sẽ thực hiện lại truy vấn với một cách diễn đạt khác hoặc mở rộng phạm vi tìm kiếm.

Lập luận về chi phí: ngữ cảnh dài so với truy vấn

Một số nhà bình luận cho rằng các cửa sổ ngữ cảnh ngày càng lớn sẽ khiến việc truy vấn trở nên lỗi thời. Quan điểm phản bác mang tính thực tế: việc đưa một kho ngữ liệu khổng lồ vào ngữ cảnh của mô hình tốn kém hơn gấp nhiều lần so với việc truy vấn tập trung. Các ước tính cho thấy việc truy vấn rẻ hơn từ 8 đến 82 lần đối với các tập dữ liệu lớn, trong khi vẫn cung cấp nền tảng ngữ cảnh cần thiết để có câu trả lời chính xác. Cửa sổ ngữ cảnh dài vẫn hữu ích cho việc suy luận sắc thái trên một tập tài liệu nhỏ, được chọn lọc, nhưng chúng không thể thay thế việc tìm kiếm có khả năng mở rộng.

Tính minh bạch và xác minh

Một trợ lý AI cấp độ sản xuất phải công khai các nguồn của nó. Truy vấn mang tính tác nhân có thể đính kèm trích dẫn cho mỗi khẳng định, cho phép người kiểm duyệt là con người xác minh lộ trình kiểm chứng sự thật. Cách tiếp cận "trình bày quá trình thực hiện" này giúp xây dựng niềm tin và làm lộ ra các đường dẫn truy vấn yếu mà tác nhân có thể học cách tránh trong các tương tác tương lai.

Những điều cần theo dõi tiếp theo

  • Công cụ.
  • Các tiêu chuẩn đánh giá.
  • Các dự án thí điểm tại doanh nghiệp.

Điểm mấu chốt

Truy vấn mang tính tác nhân vượt xa các quy trình RAG tĩnh và dễ mắc lỗi đang thống trị nhiều bản demo. Bằng cách để hệ thống AI quyết định khi nào và làm thế nào để tìm kiếm, nó giúp tinh giản việc sử dụng token, cắt giảm chi phí đáng kể và—quan trọng nhất—cung cấp các nguồn có thể xác minh cho mọi câu trả lời.