Tại sao Nén Ngữ cảnh AI đang âm thầm phớt lờ các chỉ dẫn của bạn
Khi các cuộc hội thoại với các Mô hình Ngôn ngữ Lớn (LLM) ngày càng dài hơn, các nhà phát triển ngày càng dựa vào "nén ngữ cảnh" (context compression) hoặc thu gọn (compaction) để quản lý giới hạn token và ngăn chặn các nút thắt hiệu suất. Tuy nhiên, nghiên cứu mới đã tiết lộ một lỗ hổng nghiêm trọng trong quá trình tối ưu hóa này: khi các hệ thống AI tóm tắt lịch sử hội thoại để tiết kiệm không gian, chúng thường xuyên loại bỏ chính những quy tắc được dùng để điều phối hành vi của chúng.
Sự mong manh của các Ràng buộc Phiên làm việc
Khi một hệ thống AI trải qua quá trình thu gọn, mục tiêu chính của nó là duy trì tính liên tục của nhiệm vụ—giữ vững mục tiêu, trạng thái hiện tại và các bước tiếp theo cần thiết. Mặc dù điều này giúp bảo toàn phần "cái gì" (what) của một cuộc hội thoại, nhưng nó thường hy sinh phần "như thế nào" (how).
Các nhà nghiên cứu tại Penn State đã xác định rằng "các ràng buộc phiên" (session constraints) là những nạn nhân đầu tiên của quá trình này. Đây là những quy tắc không mang tính lâu dài do người dùng đặt ra, chẳng hạn như "Không bao giờ sử dụng tên tôi trong câu trả lời" hoặc "Xác nhận với tôi trước khi thực hiện bất kỳ thay đổi nào." Vì những chỉ dẫn này không phải là một phần của nhiệm vụ cốt lõi hay câu lệnh hệ thống (system prompt) cố định, các thuật toán nén coi chúng là các chi tiết phụ và loại bỏ chúng để nhường chỗ cho các dữ liệu liên quan hơn.
Phát hiện từ COMPINT: Tỷ lệ sống sót chỉ 17%
Để định lượng sự suy giảm này, các nhà nghiên cứu đã phát triển bộ đánh giá COMPINT. Kết quả thật đáng kinh ngạc: trung bình, chỉ có 17% các ràng buộc phiên được đưa vào có thể sống sót qua quá trình nén.
Nghiên cứu đã làm nổi bật sự sụt giảm đáng kể trong việc tuân thủ quy tắc. Khi một tác nhân (agent) có quyền truy cập vào ngữ cảnh đầy đủ, chưa nén, tỷ lệ tuân thủ thường nằm trong khoảng từ 59% đến 71%. Một khi quá trình thu gọn diễn ra, tỷ lệ tuân thủ lao dốc, thường rơi xuống mức khó có thể phân biệt được với kịch bản mà không có bất kỳ ràng buộc nào được cung cấp trước đó.
Đây không chỉ là vấn đề về sắc thái hội thoại; nó còn là một rủi ro lớn về bảo mật và độ tin cậy. Trong các quy trình làm việc của tác nhân (agentic workflows), việc mất đi một ràng buộc như "Không thực thi mã mà không có sự chấp thuận" có thể dẫn đến các lệnh gọi công cụ trái phép, rò rỉ dữ liệu hoặc các thay đổi chưa được xác minh đối với các hệ thống bên ngoài như lịch hoặc email.
Giải pháp nhẹ nhàng thông qua Qwen3.5-9B
Thay vì đại tu logic nén phức tạp được sử dụng bởi các phòng thí nghiệm AI lớn, các nhà nghiên cứu đề xuất một bản sửa lỗi kiến trúc theo kiểu "cắm và chạy" (plug-and-play). Họ đã phát triển một mô-đun bổ sung nhỏ dựa trên mô hình Qwen3.5-9B, được thiết kế để đóng vai trò như một bộ trích xuất chuyên dụng.
Mô-đun này hoạt động bằng cách:
- Quét mọi đầu vào của người dùng trong thời gian thực để phát hiện và cô lập các ràng buộc phiên.
- Duy trì một danh sách độc lập, chuyên dụng cho các quy tắc này.
- Chèn danh sách đã được chắt lọc này vào bản tóm tắt bất cứ khi nào hệ thống chính thực hiện nén.
Kết quả của phương pháp này cực kỳ hiệu quả. Bộ trích xuất đã đạt được tỷ lệ duy trì hơn 90% trong các kịch bản thử nghiệm khác nhau, bao gồm tỷ lệ thành công 95,6% đối với các quỹ đạo của tác nhân (agent trajectories) và 90,3% đối với các cuộc trò chuyện đa lượt (multi-turn chats). Vì phương pháp này không yêu cầu đào tạo lại mô hình chính và không cần thay đổi cơ sở hạ tầng nén hiện có, nó cung cấp một lộ trình có khả năng mở rộng hướng tới các tương tác AI ngữ cảnh dài đáng tin cậy hơn.
Các điểm chính cần lưu ý
- Xóa bỏ ràng buộc: Nén ngữ cảnh ưu tiên các mục tiêu nhiệm vụ hơn là các quy tắc hành vi, khiến hầu hết các "ràng buộc phiên" do người dùng đặt ra bị mất trong quá trình tóm tắt.
- Rủi ro bảo mật: Việc mất các chỉ dẫn—chẳng hạn như các yêu cầu xác minh có sự tham gia của con người (human-in-the-loop)—có thể dẫn đến các hành động trái phép của tác nhân và làm tổn hại đến bảo mật.
- Sửa lỗi theo mô-đun: Sử dụng một mô hình nhỏ, chuyên dụng như Qwen3.5-9B để theo dõi các ràng buộc một cách riêng biệt có thể khôi phục tỷ lệ duy trì chỉ dẫn lên hơn 90%.
