Quy trình “mơ” (dreaming) của một nhà phát triển chạy hai lần mỗi ngày, giúp nén nhật ký sự kiện thô của LLM-agent thành một kho lưu trữ bộ nhớ gọn gàng, đã được kiểm chứng và cắt giảm đáng kể chi phí token. Bí quyết nằm ở chỗ hầu hết các hệ thống agent đều làm đầy bộ nhớ làm việc của chúng bằng mọi chi tiết mà chúng thấy, điều này nhanh chóng dẫn đến các mâu thuẫn, mất ngữ cảnh và chi phí API tăng vọt.

Tại sao bộ nhớ lại quan trọng đối với các LLM agent

Các LLM agent coi mỗi yêu cầu của người dùng, mỗi lần gọi công cụ hoặc mỗi quan sát nội bộ là một “sự kiện” mới. Cách tiếp cận ngây thơ là chèn mọi sự kiện vào prompt để điều khiển quyết định tiếp theo. Trong thực tế, điều đó làm đầy prompt bằng các nhiễu thông tin, buộc mô hình phải đánh giá lại các dữ kiện đã lỗi thời và đẩy mức sử dụng token lên phân khúc giá cao nhất. Kết quả là: nhiều lỗi hơn và một hóa đơn ẩn tăng dần theo mỗi lần tương tác.

Cách thức hoạt động của quá trình “mơ” hàng đêm

Hệ thống tách biệt luồng ghi (write path - nhật ký trực tiếp của agent) khỏi luồng làm việc (work path - quá trình ra quyết định của mô hình). Hai lần mỗi ngày, một tác vụ chạy ngầm—được gọi là “giấc mơ”—sẽ xử lý các sự kiện tích lũy thông qua ba giai đoạn:

  • Reflect (Phản chiếu) – một LLM quét các cụm sự kiện liên quan, đề xuất các sự thật (facts) súc tích và ghi lại những sự kiện nào làm cơ sở cho đề xuất đó.
  • Score (Chấm điểm) – quy trình kiểm tra xem một sự thật có đủ các sự kiện hỗ trợ hay không và liệu các sự kiện đó có được phân bổ đủ xa nhau về mặt thời gian để đảm bảo độ tin cậy hay không.
  • Judge (Phán quyết) – hai bước kiểm tra tính hợp lý để xác nhận rằng sự thật mới không mâu thuẫn với bất kỳ bộ nhớ hiện có nào và không phải là bản trùng lặp.

Những sự thật vượt qua tất cả các bước kiểm tra sẽ được đưa vào bộ nhớ vĩnh viễn. Những sự thật không đạt yêu cầu sẽ rơi vào hàng đợi kiểm duyệt, nơi một người vận hành chỉ cần nhấn một phím duy nhất để phê duyệt hoặc từ chối chúng. Mỗi lần phê duyệt sẽ tạo ra một commit theo kiểu git, cung cấp một dấu vết kiểm tra (audit trail) đầy đủ về việc bộ nhớ đã thay đổi gì và khi nào.

Các bài học kỹ thuật then chốt

  • Tách biệt luồng ghi và luồng làm việc. Hãy để các agent đổ mọi quan sát vào một nhật ký; hãy để một quy trình chuyên dụng quyết định điều gì sẽ được giữ lại.
  • Tập trung vào việc ngăn chặn, không phải tạo mới. Tạo ra các ý tưởng thì rẻ; ngăn chặn sự "ô nhiễm bộ nhớ" mới là phần khó khăn.
  • Sử dụng con người làm chốt chặn tại điểm kiểm soát rẻ nhất. Việc tự động soạn thảo sau đó được phê duyệt nhanh chóng bởi con người sẽ hiệu quả hơn so với sự tự chủ hoàn toàn về cả chi phí lẫn độ an toàn.
  • Giới hạn chi tiêu token theo mỗi chu kỳ. Một giới hạn cứng về số lượng token trong mỗi lần chạy "mơ" sẽ ngăn chặn các chi phí mất kiểm soát.
  • Kiểm tra các lỗi âm thầm. Nếu một giai đoạn áp dụng các quy tắc khác với giai đoạn tiếp theo, dữ liệu có thể biến mất mà không ai hay biết; các bước kiểm tra rõ ràng sẽ giúp phát hiện sự sai lệch này.

Những nhược điểm tiềm ẩn

Việc chạy quá trình hợp nhất ngoại tuyến sẽ tạo ra một độ trễ: agent sẽ không thấy các sự thật mới được kiểm chứng cho đến chu kỳ "mơ" tiếp theo. Trong các ứng dụng đòi hỏi sự học hỏi tức thì, sự chậm trễ này có thể là một điểm yếu. Hệ thống cũng phụ thuộc vào một người kiểm duyệt duy nhất; việc mở rộng hàng đợi kiểm duyệt mà không làm tăng chi phí nhân công vẫn là một câu hỏi còn bỏ ngỏ.

Những điều cần lưu ý tiếp theo

Các nhà phát triển đang thử nghiệm với LLM agent nên theo dõi hóa đơn token và nhật ký lỗi để tìm các dấu hiệu của “ô nhiễm bộ nhớ” – những tuyên bố lặp lại hoặc mâu thuẫn bắt nguồn từ việc tích tụ các sự kiện thô. Việc thêm một quy trình “mơ” cung cấp một nút điều chỉnh cụ thể để giảm các chi phí đó, đồng thời có được một lịch sử bộ nhớ có thể kiểm chứng. Khi nhiều nhóm áp dụng mô hình tách biệt nhật ký hơn, các công cụ tự động hóa các bước reflect-score-judge và tích hợp với quy trình kiểm duyệt kiểu quản lý phiên bản (version-control) có khả năng sẽ xuất hiện, giúp phương pháp này bớt tính tùy biến và trở nên dễ dàng áp dụng hơn (plug-and-play). Sự đánh đổi giữa tính tức thời và sự sạch sẽ sẽ định hình mức độ phổ biến của “giấc mơ hàng đêm” như một phần tiêu chuẩn trong kiến trúc LLM agent.