Meta AI đã công bố một hệ thống bộ nhớ tác nhân kép giúp nâng tỷ lệ thành công của các trợ lý AI tự hành từ 38% lên 46% trong bài kiểm tra chuẩn dòng lệnh và từ 55% lên 62% trong bài kiểm tra chuẩn hội thoại đa lĩnh vực. Sự gia tăng này đến từ việc kết hợp một mô hình "hành động" không thay đổi với một "huấn luyện viên bộ nhớ" chuyên dụng, người sẽ theo dõi các bước gần đây của tác vụ và chỉ can thiệp khi ngữ cảnh có nguy cơ bị trôi mất.
Khiếm khuyết tiềm ẩn trong các tác vụ AI kéo dài
Khi một mô hình ngôn ngữ giải quyết một vấn đề gồm nhiều bước, mỗi lượt tương tác sẽ thêm nhiều văn bản hơn vào lịch sử hội thoại. Bước tiếp theo của mô hình nên được dẫn dắt bởi toàn bộ bản ghi, nhưng trong thực tế, các sự thật liên quan thường bị vùi lấp. Các nhà nghiên cứu của Meta gọi đây là "sự suy giảm trạng thái hành vi" (behavioral state decay) – sự mất dần mục đích của tác nhân khi cửa sổ ngữ cảnh mở rộng. Việc chỉ đơn giản là mở rộng cửa sổ ngữ cảnh không giải quyết được vấn đề; thông tin có thể vẫn hiện diện nhưng không còn ảnh hưởng đến các dự đoán của mô hình.
Các tiện ích bổ sung bộ nhớ truyền thống thường truy xuất một tài liệu hoặc cá nhân hóa các câu trả lời. Chúng không bao giờ quyết định được khi nào một thông tin trong quá khứ là đủ quan trọng để ảnh hưởng đến hành động hiện tại. Kết quả là, các tác nhân tự hành chạy trong thời gian dài thường bị chệch hướng, lặp lại lỗi hoặc bỏ lỡ một ràng buộc quan trọng đã được đề cập từ đầu cuộc tương tác.
Tách biệt việc thực thi và giám sát
Giải pháp của Meta là một kiến trúc plug-and-play giúp tách biệt công cụ thực thi khỏi lớp bộ nhớ giám sát.
- Action Agent (Tác nhân Hành động) – một mô hình ngôn ngữ không thay đổi, có nhiệm vụ đưa ra lệnh, gọi các công cụ và tạo ra kết quả đầu ra hiển thị. Trong các thử nghiệm, đây là Claude Sonnet 4.5.
- Memory Agent (Tác nhân Bộ nhớ) – một mô hình thứ hai định kỳ xem xét một cửa sổ trượt của các bước gần đây nhất. Trong các thử nghiệm, đây là Claude Opus 4.6.
Tác nhân bộ nhớ duy trì một kho lưu trữ bộ nhớ gồm ba phần:
- Private Status Field (Trường Trạng thái Riêng tư) – các cờ nội bộ về tiến độ và rủi ro mà tác nhân hành động không thể nhìn thấy.
- Knowledge Memory (Bộ nhớ Kiến thức) – các sự thật ổn định như đường dẫn tệp, giá trị cấu hình hoặc các điểm cuối API.
- Procedural Memory (Bộ nhớ Quy trình) – nhật ký về những gì đã hiệu quả và những gì đã thất bại, bao gồm cả các lệnh lỗi và các cách khắc phục đã giải quyết chúng.
Thay vì tóm tắt toàn bộ bản ghi, tác nhân bộ nhớ sẽ quyết định xem có nên can thiệp hay không. Nếu phát hiện một chi tiết quan trọng đã bị quên, nó sẽ đưa vào một lời nhắc ngắn gọn; nếu không, nó sẽ giữ im lặng, giúp tránh lãng phí token và giảm độ trễ.
Các bài kiểm tra chuẩn chứng minh khái niệm
Meta đã thử nghiệm hệ thống trên hai bộ công cụ công khai:
| Bài kiểm tra chuẩn | Tỷ lệ thành công cơ sở | Tỷ lệ thành công của tác nhân kép |
|---|---|---|
| Terminal-Bench 2.0 (dòng lệnh) | 38% | 46% |
| tau2-Bench (bán lẻ, hàng không, viễn thông) | 55% | 62% |
Mức tăng trưởng này rất đáng chú ý vì cùng một mô hình hành động xuất hiện trong cả hai hàng; chỉ có lớp bộ nhớ là thay đổi. So với Mem0, một lớp bộ nhớ sản xuất được sử dụng rộng rãi dựa trên tìm kiếm từ khóa, phương pháp của Meta hoạt động tốt hơn. Trong một kịch bản mô phỏng đặt vé máy bay, người dùng đã tuyên bố sai rằng mình có "Trạng thái Gold" (Gold status). Tác nhân bộ nhớ đã phát hiện ra sự không khớp này, nhắc nhở mô hình hành động hãy tin tưởng vào kết quả kiểm tra trạng thái khách hàng thân thiết đã được xác minh từ API của hãng hàng không, và giao dịch đã được thực hiện chính xác.
Tại sao ngành công nghiệp nên chú ý
Kết quả này gợi mở một hướng đi không phụ thuộc vào việc sử dụng các mô hình ngày càng lớn hơn. Bằng cách chuyển việc quản lý ngữ cảnh sang một bên giám sát nhẹ nhàng, các nhà phát triển có thể cải thiện độ tin cậy cho các tác vụ kéo dài qua hàng chục bước—như gỡ lỗi phần mềm, các luồng dịch vụ khách hàng phức tạp, hoặc các đường ống dữ liệu tự hành—mà không cần làm tăng số lượng tham số của mô hình chính.
Đối với các công ty đang xây dựng các tác nhân tự hành, kiến trúc này mang lại:
- Giảm thiểu sự chệch hướng lỗi – hệ thống chủ động bảo vệ chống lại việc quên các ràng buộc.
- Hiệu quả token – các lần can thiệp mang tính chọn lọc, vì vậy mô hình hành động xử lý ít token không liên quan hơn.
- Nâng cấp theo mô-đun – huấn luyện viên bộ nhớ có thể được thay thế bằng một mô hình mới hơn mà không cần đào tạo lại lõi hành động.
Các đánh đổi và câu hỏi mở
Những điều cần theo dõi tiếp theo
Điểm mấu chốt: Một huấn luyện viên bộ nhớ chuyên dụng có thể ngăn chặn sự suy giảm trạng thái hành vi, mang lại mức tăng trưởng hai chữ số về tỷ lệ thành công mà không cần thiết kế lại mô hình lập luận chính. Sự đánh đổi là độ phức tạp của hệ thống tăng lên, nhưng thành quả—các tác nhân tự hành đáng tin cậy hơn—có thể xứng đáng với nỗ lực kỹ thuật bổ sung.
