Cách bộ nhớ có cấu trúc giúp các AI Agent chinh phục Slay the Spire 2

Các nhà nghiên cứu đã phát triển một kiến trúc agent mới mang tên AgenticSTS, vượt trội hơn các LLM agent truyền thống bằng cách thay thế các nhật ký chat cồng kềnh bằng một hệ thống bộ nhớ có cấu trúc năm lớp tinh vi. Bằng cách loại bỏ mô hình "bản ghi tăng dần" (growing transcript), phương pháp này giúp giảm đáng kể chi phí token, đồng thời cho phép các agent học hỏi các chiến thuật phức tạp qua nhiều lượt chơi khác nhau.

Vấn đề với các nhật ký chat tăng dần

Hầu hết các LLM agent hiện nay, chẳng hạn như những agent sử dụng framework ReAct hoặc Reflexion, đều dựa vào việc chèn thêm mọi quan sát, lệnh gọi công cụ (tool call) và sự tự phản hồi (self-reflection) trong quá khứ vào một nhật ký văn bản liên tục. Khi phiên làm việc tiến triển, cửa sổ ngữ cảnh này sẽ mở rộng cho đến khi bị tràn hoặc sự chú ý của mô hình bị loãng bởi các dữ liệu lịch sử không liên quan.

Trong các thử nghiệm với tựa game roguelike xây dựng bộ bài phức tạp Slay the Spire 2, sự kém hiệu quả này lộ rõ một cách đáng kể. Các đối thủ như STS2MCP và CharTyr, vốn sử dụng mô hình bản ghi tăng dần kinh điển, đã chứng kiến số lượng token trong một lần gọi mô hình tăng vọt lên khoảng 527.000 token. Lỗi kiến trúc này dẫn đến độ trễ cực lớn và chi phí token cao ngất ngưởng, khi các đối thủ phải sử dụng nhiều hơn từ 66 đến 90 lần lượng token so với AgenticSTS để đạt được điểm số tương đương.

Giải pháp bộ nhớ năm lớp

AgenticSTS giải quyết vấn đề lạm phát ngữ cảnh bằng cách xây dựng lại mỗi prompt quyết định từ năm ngăn bộ nhớ riêng biệt và có tổ chức. Điều này đảm bảo prompt luôn gọn nhẹ—trung bình khoảng 5.000 token—bất kể trò chơi kéo dài bao lâu. Các lớp được cấu trúc như sau:

  • L1 (Fixed Protocol): Các chỉ dẫn cốt lõi cho agent.
  • L2 (State Schemas): Định nghĩa các hành động hợp lệ hiện tại.
  • L3 (Retrievable Rules): Các quy tắc trò chơi cụ thể được truy xuất khi cần.
  • L4 (Episodic Memory): Tóm tắt các lượt chơi trước đó để cung cấp ngữ cảnh dài hạn.
  • L5 (Skill Library): Các quy tắc chiến thuật được kích hoạt bởi các mô hình tình huống cụ thể.

Tính mô-đun này cho phép các nhà nghiên cứu xác định chính xác thành phần nào thúc đẩy sự cải thiện hiệu suất. Ví dụ, chỉ riêng việc kích hoạt thư viện kỹ năng L5 đã giúp tăng gấp đôi tỷ lệ thắng của agent từ 3 trên 10 trận lên 6 trên 10 trận ở mức độ khó A0.

Nâng cao độ khó thông qua việc học hỏi

Sức mạnh thực sự của phương pháp có cấu trúc nằm ở khả năng học hỏi giữa các lượt chơi (inter-run learning). Trong khi các agent tiêu chuẩn gặp khó khăn trong việc tiến xa hơn các mức độ khó thấp nhất, AgenticSTS tận dụng các lớp L4 và L5 để leo lên các nấc thang độ khó của trò chơi. Nếu không có bộ nhớ chủ động được cập nhật giữa các lượt chơi, agent sẽ bị chững lại ở các mức từ A2 đến A4; tuy nhiên, với bộ nhớ tồn tại qua các phiên làm việc, nó đã chinh phục thành công các mức khó hơn nhiều từ A6 đến A8.

Điều thú vị là các nhà nghiên cứu nhận thấy rằng bộ nhớ này phụ thuộc rất nhiều vào từng mô hình cụ thể. Khi một ngăn xếp bộ nhớ (memory stack) được tạo bởi Gemini 3.1 Pro được chuyển sang Qwen 3.6-27B, điểm số của mô hình sau đã tăng 84,5%, nhưng điểm số của Deepseek V4-Pro thực tế lại giảm 18,1%. Điều này cho thấy rằng mặc dù bộ nhớ có cấu trúc rất mạnh mẽ, nhưng "kiến thức" chứa đựng trong đó gắn liền sâu sắc với các mô hình lập luận của chính mô hình đã tạo ra nó.

Tại sao điều này lại quan trọng đối với ngành công nghiệp AI

Thành công của AgenticSTS báo hiệu một sự chuyển dịch trong thiết kế agent: tương lai của AI tự hành không nằm ở các cửa sổ ngữ cảnh lớn hơn, mà ở việc quản lý bộ nhớ thông minh và có cấu trúc hơn. Đối với các nhà phát triển đang xây dựng các agent chạy trong thời gian dài, kiến trúc này cung cấp một bản thiết kế để giảm chi phí vận hành và độ trễ, đồng thời cải thiện đáng kể khả năng thực hiện các lập luận đa bước phức tạp của mô hình.

Các điểm chính cần lưu ý

  • Cải thiện hiệu suất: AgenticSTS duy trì một prompt ổn định ở mức 5.000 token, sử dụng ít hơn tới 90 lần lượng token so với các agent dựa vào nhật ký chat tăng dần.
  • Nâng cao hiệu suất: Việc sử dụng "Thư viện kỹ năng" (L5) có thể tăng gấp đôi tỷ lệ thắng của agent và cho phép tiến lên các cấp độ khó cao hơn nhiều thông qua việc học hỏi giữa các lượt chơi.
  • Chuyển dịch kiến trúc: Việc chuyển từ các bản ghi không cấu trúc sang bộ nhớ đa lớp giúp giải quyết các vấn đề về loãng sự chú ý và độ trễ mô hình tăng vọt.