Nhật ký bộ nhớ của một agent LLM đang chạy thực tế đã tăng từ tệp 2 KB lên 29.446 byte, đẩy số lượng token mà agent đọc từ khoảng 500 lên 7.360 mỗi lần chạy — một chi phí ẩn xuất hiện mà không có bất kỳ cảnh báo nào trên bảng điều khiển giám sát. Nhà phát triển đứng sau agent này cho biết sự gia tăng âm thầm của chi phí đọc là một ví dụ cụ thể về “agent cost drift” (sự trôi dạt chi phí agent), một vấn đề có thể bào mòn ngân sách ngay cả khi hệ thống có vẻ vẫn hoạt động bình thường.
Agent cost drift là gì?
Agent cost drift mô tả sự gia tăng dần dần về chi phí tính toán trong các hoạt động định kỳ của một AI agent, nguyên nhân là do trạng thái (state) ngày càng lớn dần của chính agent đó. Trong ví dụ này, agent duy trì một tệp nhật ký công việc (work-log) để ghi lại lý do tại sao nó từ chối các chủ đề bài viết trước đó. Mỗi mục mới thêm vào sẽ bao gồm một đoạn lập luận, và toàn bộ tệp sẽ được đọc trước khi agent tạo nội dung mới. Vì nhật ký mở rộng theo hàm bậc hai — mỗi mục không chỉ thêm độ dài của chính nó mà còn tham chiếu đến các mục trước đó — lượng văn bản mà agent phải nạp vào sẽ tăng tốc theo thời gian.
Sự trôi dạt này không phải là một sự tăng vọt hay một lỗi hệ thống; nó là một loại "thuế" tuyến tính có tính chất tích lũy. Agent vẫn tạo ra hai bài viết mỗi ngày và bảng điều khiển không hiển thị lỗi nào, nhưng mỗi lần chạy hiện tiêu tốn 7.360 token, tăng so với mức khoảng 500 token của một tháng trước. Vì hầu hết các nhà cung cấp LLM tính phí theo token, việc tăng số lượng token mỗi lần chạy sẽ trực tiếp dẫn đến chi phí vận hành cao hơn.
Tại sao nó lại quan trọng
- Tác động đến ngân sách – Định giá dựa trên token có nghĩa là mỗi token đọc thêm đều là tiền bị tiêu tốn. Số lượng token đã tăng từ 500 lên 7.360.
Cơ chế ẩn giấu
Mô hình tăng trưởng của tệp là chìa khóa. Một nhật ký ghi theo từng dòng chỉ đơn thuần là thêm các mục mới sẽ tăng trưởng tuyến tính, nhưng vì mỗi mục đều giải thích lập luận đằng sau các lần từ chối trước đó, độ dài văn bản sẽ tích lũy. Kết quả là một đường cong tăng trưởng bậc hai: gấp đôi số lượng mục sẽ làm kích thước tệp tăng hơn gấp đôi, và số lượng token cần thiết để xử lý nó còn tăng nhanh hơn nữa.
Các nhà phát triển hiếm khi phát hiện ra chi phí đang tăng vì mỗi mục "vẫn có lý khi đứng riêng lẻ". Đầu ra của agent vẫn chính xác và nhật ký vẫn tiếp tục phục vụ mục đích của nó, che giấu đi sự kém hiệu quả.
Chiến lược giảm thiểu
Nhà phát triển đề xuất cấu trúc lại nhật ký theo ba phần:
- Tệp các mục gần đây (Recent-entry file) – Duy trì một tệp nhỏ, được đọc thường xuyên, chỉ chứa một vài mục mới nhất cần thiết để tránh lặp lại ngay lập tức.
- Chỉ mục rút gọn (Compact index) – Lưu trữ một bản tóm tắt một dòng cho các mục cũ hơn. Chỉ mục này có thể được quét nhanh để kiểm tra sự trùng lặp chủ đề mà không cần nạp toàn bộ các đoạn văn dài.
- Lưu trữ văn bản đầy đủ (Archived full text) – Chuyển toàn bộ lập luận lịch sử sang một tệp lưu trữ riêng biệt mà agent không đọc trong quá trình vận hành bình thường.
Cách tiếp cận này giúp duy trì khả năng tránh lặp lại chủ đề của agent trong khi cắt giảm đáng kể tải lượng token mỗi lần chạy.
Cách phát hiện cost drift trong các agent của bạn
- Thiết lập đo lường việc đọc token – Ghi lại số lượng token mà agent tiêu thụ khi tải tệp bộ nhớ mỗi khi nó chạy.
- Theo dõi theo thời gian – So sánh số lượng token hôm nay với số lượng của một tuần hoặc một tháng trước. Một xu hướng tăng đều đặn là dấu hiệu của sự trôi dạt.
Chỉ việc xác nhận rằng tệp vẫn tải được mà không có lỗi là chưa đủ; bạn phải đo lường chi phí của việc tải đó.
Điều cần lưu ý tiếp theo
Agent cost drift là một loại thuế vô hình có thể âm thầm bào mòn ngân sách AI của bạn. Bằng cách coi tệp bộ nhớ của agent là một trung tâm chi phí — đo lường việc đọc token, theo dõi các đường cong tăng trưởng và cấu trúc lại nhật ký — bạn có thể giữ mức thuế này ở mức thấp và duy trì chất lượng đầu ra sắc bén.
Tham gia thảo luận: https://t.me/GyaanSetuAi
