GraphRAG và bộ nhớ ngữ cảnh bền vững đang được tích hợp vào các chatbot AI để cuộc hội thoại vẫn tiếp tục ngay cả khi tải lại trang hoặc mở tab trình duyệt mới. Các nhà phát triển cho biết sự kết hợp này loại bỏ tình trạng "quên do đóng tab" vốn gây khó chịu cho người dùng hầu hết các trợ lý hội thoại hiện nay.
Tại sao cách tiếp cận cũ không còn hiệu quả
Hầu hết các hệ thống AI dựa trên chat đều dựa vào Retrieval-Augmented Generation (RAG) tiêu chuẩn. Quy trình này sẽ truy xuất các đoạn văn bản có vẻ giống với câu hỏi hiện tại, đưa chúng vào mô hình ngôn ngữ và trả về câu trả lời. Đối với việc tra cứu một sự kiện đơn lẻ — "Thủ đô của Pháp là gì?" — phương pháp này hoạt động rất tốt.
Nhưng RAG coi mỗi đầu vào của người dùng là một yêu cầu riêng biệt. Khi một câu hỏi tiếp theo phụ thuộc vào điều gì đó đã nói vài phút trước, mô hình sẽ không có ký ức về ngữ cảnh đó. Kết quả là một chatbot yêu cầu bạn phải lặp lại ý mình hoặc đưa ra câu trả lời phớt lờ các chi tiết trước đó. Vấn đề không nằm ở sự thiếu thông minh; mà là sự thiếu hụt về trạng thái (state).
GraphRAG: biến văn bản phẳng thành một mạng lưới
GraphRAG tái định hình giai đoạn truy xuất. Thay vì một danh sách các đoạn văn bản không liên quan, nó xây dựng một đồ thị:
- Nút (Nodes) đại diện cho các thực thể như con người, sản phẩm hoặc sự kiện.
- Cạnh (Edges) ghi lại mối quan hệ giữa chúng — ai cung cấp cái gì, dự án nào phụ thuộc vào thành phần nào, v.v.
Vì đồ thị mã hóa các kết nối, hệ thống có thể thực hiện suy luận đa bước (multi-hop reasoning): nó có thể theo dõi một chuỗi các sự kiện qua nhiều tài liệu khác nhau để trả lời một truy vấn mà việc tìm kiếm văn bản phẳng sẽ bó tay. Nó cũng có thể tạo ra các bản tóm tắt của toàn bộ đồ thị con, cung cấp cho người dùng cái nhìn tổng quan súc tích về một chủ đề thay vì một tập hợp các đoạn trích rời rạc.
Bộ nhớ ngữ cảnh: ghi nhớ cuộc hội thoại
Bộ nhớ ngữ cảnh bền vững thêm một lớp thời gian lên trên đồ thị. Nó được chia thành ba phần:
- Bộ nhớ ngắn hạn (Short-term memory) lưu giữ cuộc đối thoại theo từng lượt hiện tại, để người dùng không cần phải nhắc lại một ý đã nói vài câu trước đó.
- Bộ nhớ dài hạn (Long-term memory) ghi lại các sự kiện chọn lọc về người dùng qua các phiên làm việc — ngôn ngữ ưu tiên, các vấn đề thường gặp hoặc các giao dịch mua trước đó.
- Bộ nhớ chọn lọc (Selective memory) quyết định những gì cần giữ lại, loại bỏ các từ đệm và những cuộc tán gẫu không liên quan để tránh làm phình to kho lưu trữ.
Khi người dùng quay lại sau khi đã đóng tab, kho lưu trữ dài hạn có thể hiển thị các thông tin nền liên quan, cho phép chatbot tiếp tục từ nơi phiên làm việc trước đó dừng lại.
Khi nào nên sử dụng công cụ nào
- Dùng RAG tiêu chuẩn cho các kiểm tra sự kiện đơn giản, nơi mà việc bỏ lỡ một kết nối không gây hậu quả lớn.
- Triển khai GraphRAG khi cái giá của một câu trả lời sai là cao, hoặc khi câu trả lời yêu cầu liên kết thông tin nằm rải rác trong nhiều tài liệu.
- Thêm bộ nhớ ngữ cảnh nếu ứng dụng cần nhận diện người dùng quay lại hoặc duy trì một luồng cá nhân hóa qua nhiều ngày hoặc nhiều tuần.
Việc xây dựng các lớp này không phải là một bài toán "cắm là chạy". Một chỉ mục GraphRAG phải được làm mới khi dữ liệu nguồn thay đổi, và kho lưu trữ bộ nhớ cần có các chính sách cân bằng giữa tính liên quan và chi phí lưu trữ. Việc lưu trữ quá mức — lưu lại mọi từ đã nói — sẽ nhanh chóng làm chậm quá trình truy xuất và khiến mô hình bị ngập trong nhiễu thông tin.
Sự đánh đổi
Bộ nhớ ngữ cảnh giải quyết vấn đề quên lãng. Mặt trái nằm ở khía cạnh vận hành: việc duy trì một đồ thị trực tiếp và một bộ nhớ đệm chọn lọc đòi hỏi nỗ lực kỹ thuật liên tục.
Những gì cần theo dõi tiếp theo
Điểm mấu chốt: GraphRAG cung cấp khung xương liên kết, trong khi bộ nhớ ngữ cảnh bền vững cung cấp chất keo thời gian. Cùng với nhau, chúng cho phép chatbot duy trì mạch hội thoại xuyên suốt các tab và phiên làm việc, biến một sự khởi động lại gây khó chịu thành một cuộc trò chuyện liền mạch.
