Một kết quả đánh giá hiệu năng (benchmark) gần đây cho thấy thiết kế bộ nhớ hai lớp—bao gồm scratchpad dựa trên RAM cộng với một kho lưu trữ SQLite-vec cục bộ—mang lại thời gian truy vấn trung vị dưới 100 ms, đồng thời loại bỏ hóa đơn 135 USD mỗi tháng liên quan đến một kho lưu trữ vector đám mây phổ biến. Các nhà phát triển đang xây dựng các tác nhân AI tự hành (autonomous AI agents) có thể chạy một thiết lập hoàn toàn tại chỗ (on-premise), vốn trong bài đánh giá này đã nhanh hơn và không tốn chi phí hàng tháng.

Tại sao các phương pháp tiếp cận bộ nhớ hiện tại chưa đáp ứng được yêu cầu

Các tác nhân AI thường cần nhớ lại hàng nghìn tương tác trong quá khứ, các sự kiện hoặc kết quả gọi công cụ (tool-call) trong một khung thời gian phản hồi hạn hẹp. Hầu hết các đội ngũ đều đẩy mọi embedding vào một cơ sở dữ liệu vector được quản lý và dựa vào tìm kiếm vector từ xa cho mọi lần tra cứu. Mô hình đó có khả năng mở rộng, nhưng nó buộc mọi truy vấn phải đi qua mạng, làm tăng thời gian phản hồi (round-trip time) và chi phí hàng tháng. Trong bài đánh giá, độ trễ trung vị của dịch vụ đám mây là 127 ms và hóa đơn vượt quá 135 USD mỗi tháng; giai đoạn thử nghiệm cũng ghi nhận một sự cố gián đoạn dịch vụ.

Chia bộ nhớ thành hai tầng

Kiến trúc hai tầng này tách biệt "bộ nhớ làm việc" (working memory) khỏi "lưu trữ dài hạn" (long-term storage):

L1 Scratchpad (RAM)

  • Nằm hoàn toàn trong bộ nhớ tiến trình (process memory).
  • Lưu giữ ngữ cảnh tác vụ hiện tại và các lần gọi công cụ gần đây nhất.
  • Lưu trữ các chuỗi thô (raw strings); không tạo ra các embedding.
  • Trả về kết quả trong dưới 3 ms, tương đương với bộ nhớ đệm CPU (CPU cache).

L2 Vault (SQLite-vec)

  • Lưu trữ vĩnh viễn tất cả các embedding khác trong một cơ sở dữ liệu SQLite cục bộ được mở rộng với khả năng tìm kiếm vector.
  • Xử lý toàn bộ tập hợp 14.726 ký ức được sử dụng trong bài đánh giá.
  • Trả về các kết quả khớp trong khoảng 94 ms, thấp hơn mức mục tiêu 100 ms của nhiều tác nhân thời gian thực.
  • Không tốn chi phí nào ngoài dung lượng lưu trữ của máy chủ.

SQLite-vec là một tiện ích mở rộng mã nguồn mở giúp bổ sung tính năng tìm kiếm lân cận gần đúng (approximate nearest-neighbor search) vào một tệp quan hệ tiêu chuẩn. Vì cơ sở dữ liệu nằm trên cùng một máy với tác nhân AI, nên không có bước nhảy mạng (network hop), và công cụ này tái sử dụng các kỹ thuật lập chỉ mục SQLite hiện có để giữ cho việc tra cứu luôn nhanh chóng.

Những con số quan trọng

Hệ thống Độ trễ trung vị Chi phí hàng tháng Độ tin cậy ghi nhận
Cloud vector store (Pinecone) 127 ms ~$135 Ghi nhận sự cố gián đoạn
Local SQLite-vec vault 94 ms $0 Thời gian hoạt động (uptime) 100%

Sự khác biệt về chi phí là 0 USD so với khoảng 135 USD mỗi tháng.

Giữ cho kho lưu trữ luôn gọn gàng

Việc đổ toàn bộ embedding thô vào có thể làm loãng tính liên quan. Tác giả của bài đánh giá đã giới thiệu một hệ thống suy giảm (decay system) để chấm điểm các ký ức dựa trên độ mới và tần suất:

  • Các mục mới hoặc được truy cập thường xuyên sẽ nhận được trọng số cao hơn.
  • Các mục đã lâu không được chạm tới sẽ mất dần trọng số.
  • Sự suy giảm có trọng số này giúp cắt giảm "nhiễu truy xuất" (retrieval noise)—các kết quả khớp không liên quan—khoảng 34%.

Bằng cách loại bỏ các mục có điểm thấp hoặc hạ cấp chúng trong chỉ mục, tác nhân AI tránh được dữ liệu lỗi thời trong khi vẫn giữ cho kho lưu trữ đủ gọn nhẹ để duy trì hiệu suất ổn định.

Kết luận

Đối với các tác nhân AI phải xử lý hàng nghìn ký ức trong một thời hạn khắt khe, một scratchpad ưu tiên RAM kết hợp với kho lưu trữ SQLite-vec cục bộ mang lại một giải pháp thay thế thực tế cho các kho lưu trữ vector hoàn toàn dựa trên đám mây. Cách tiếp cận này giúp rút ngắn thời gian phản hồi, loại bỏ các khoản phí đám mây định kỳ và cung cấp dịch vụ không bị gián đoạn, đồng thời vẫn duy trì khả năng loại bỏ dữ liệu không liên quan. Do đó, việc áp dụng mô hình hai tầng có thể giúp các tác nhân AI nhanh hơn, rẻ hơn và đáng tin cậy hơn.