Claude Code 2.1.212 hiện cho phép các nhà phát triển thiết lập các giới hạn cứng về số lượng sub-agent và các lượt tìm kiếm web mà một phiên AI có thể tạo ra, mang lại một đòn bẩy cụ thể để ngăn chặn tình trạng chi phí tăng vọt không kiểm soát.
Bản cập nhật này bổ sung hai mức trần có thể cấu hình – một cho việc tạo sub-agent và một cho các lượt gọi tìm kiếm web – cả hai đều mặc định là 200 mỗi phiên. Các nhà phát triển có thể hạ thấp các con số đó bằng các biến môi trường, và bất kỳ cuộc gọi MCP (Model-Control-Plane) nào chạy lâu hơn hai phút sẽ tự động được đẩy vào chạy nền, ngăn chặn một công cụ chậm chạp duy nhất làm đóng băng toàn bộ quy trình làm việc.
Tại sao các giới hạn này lại quan trọng vào lúc này
Các AI agent có khả năng gọi các agent khác hoặc quét web không giới hạn rất hữu ích, nhưng chúng cũng trở thành một rủi ro tài chính. Một prompt mơ hồ có thể kích hoạt một chuỗi các sub-agent, mỗi sub-agent lại tiêu thụ token và gọi các công cụ bên ngoài. Kết quả là một hóa đơn có thể tăng vọt trước khi bất kỳ ai kịp nhận ra. Trong thực tế, các nhóm đã báo cáo:
- Chi tiêu token ngoài dự kiến, vượt xa ngân sách tác vụ ban đầu.
- Các sub-agent trùng lặp ghi đè lên các chỉnh sửa của nhau, tạo ra các kết quả xung đột.
- Một loạt các kết quả đầu ra không hoàn chỉnh, gây khó khăn trong việc kết nối chúng lại với nhau.
- Các công cụ bên ngoài chậm chạp làm trì trệ toàn bộ phiên làm việc, biến một truy vấn nhanh chóng thành một sự chờ đợi kéo dài hàng phút.
Bằng cách áp đặt một mức trần cứng, Claude Code buộc hệ thống phải dừng lại trước khi chi phí vượt tầm kiểm soát, trong khi vẫn đưa ra được một câu trả lời một phần để con người có thể kiểm tra.
Cách thiết lập các mức trần
Ba tham số điều chỉnh này được hiển thị dưới dạng các biến môi trường:
export CLAUDE_CODE_MAX_SUBAGENTS_PER_SESSION=12 # default 200
export CLAUDE_CODE_MAX_WEB_SEARCHES_PER_SESSION=30 # default 200
export CLAUDE_CODE_MCP_AUTO_BACKGROUND_MS=120000 # 2 minutes
Các giá trị mặc định là đủ hào phóng cho hầu hết các công việc mang tính khám phá, nhưng các nhóm có thể thắt chặt chúng để phù hợp với hồ sơ rủi ro của một công việc cụ thể. Bài viết công bố bản phát hành đã đưa ra một vài điểm khởi đầu:
- Sửa lỗi cục bộ (Local bug fix): 0-2 sub-agents, 0-5 searches.
- Review PR: 3-5 sub-agents, 0-10 searches.
- Điều tra sự cố (Incident investigation): 2-4 sub-agents, 10-25 searches.
- Nghiên cứu kiến trúc rộng (Broad architecture research): 1 synthesizer, 2-4 researchers, 20-40 searches.
Đây không phải là những quy định bắt buộc; chúng được dùng làm mức cơ sở để các nhà phát triển điều chỉnh dần dần.
Sự đánh đổi
Việc đặt một mức trần cứng cho hoạt động của agent không thay thế cho việc thiết kế tác vụ tốt. Nếu một vấn đề quá lớn đối với một phiên duy nhất, phương pháp được khuyến nghị là chia nó thành các giai đoạn, phân bổ ngân sách cho mỗi giai đoạn và chèn một điểm kiểm soát bởi con người trước khi tiếp tục. Một hệ thống có giới hạn nên trả về một kết quả một phần hữu ích kèm theo các câu hỏi mở, thay vì tiếp tục tiêu tốn tiền bạc vào các vòng lặp lặp đi lặp lại.
Rủi ro của một mức trần quá khắt khe là agent có thể dừng lại trước khi đạt được một giải pháp khả thi, buộc các nhà phát triển phải chạy lại tác vụ với giới hạn cao hơn. Việc lặp lại thêm đó có thể làm tăng chi phí phát sinh, nhưng cái giá của một phiên làm việc không được kiểm soát có thể cao hơn nhiều.
Đưa vào môi trường production
- Nâng cấp lên Claude Code 2.1.212 trong môi trường staging.
- Chọn một quy trình làm việc – ví dụ: review PR – và thiết lập một ngân sách thận trọng.
- Thiết lập ghi nhật ký (Instrument logs) để ghi lại số lượng sub-agent đã khởi chạy, số lượt tìm kiếm web đã thực hiện và bất kỳ cuộc gọi MCP nào chạm ngưỡng hai phút.
- Xem xét mọi lần chạy chạm mức trần. Xác định xem mức trần đó đã giúp tiết kiệm tiền hay đã cắt đứt tiến độ thực tế, và điều chỉnh các giới hạn cho phù hợp.
Vì các mức trần được thực thi tại thời điểm chạy (runtime), chúng sẽ hiển thị ngay lập tức trong nhật ký. Các nhóm theo dõi các chỉ số này có thể xây dựng một vòng lặp phản hồi: hạ thấp ngân sách cho đến khi agent bắt đầu không thể hoàn thành tác vụ, sau đó tăng nó lên vừa đủ để hoàn thành tác vụ cốt lõi.
Những điều cần theo dõi tiếp theo
Việc triển khai vẫn đang ở giai đoạn đầu, vì vậy dữ liệu thực tế về việc tiết kiệm chi phí còn hạn chế. Các tổ chức áp dụng các mức trần nên theo dõi:
- Chi phí mỗi phiên trước và sau khi thay đổi.
- Tỷ lệ hoàn thành các tác vụ ở các mức ngân sách khác nhau.
- Sự hài lòng của người dùng khi agent dừng sớm so với khi nó chạy cho đến khi cạn kiệt tài nguyên.
Nếu các mức trần chứng minh được hiệu quả, chúng ta có thể thấy một xu hướng rộng lớn hơn về các AI agent có ý thức về ngân sách trong toàn ngành. Nếu các nhà phát triển thấy các giới hạn quá khắt khe, phiên bản tiếp theo có thể giới thiệu các kiểm soát chi tiết hơn, chẳng hạn như ngân sách cho từng công cụ hoặc mở rộng động dựa trên mức chi tiêu quan sát được.
Điểm mấu chốt là: Claude Code 2.1.212 cung cấp cho các nhóm một cách đơn giản và có thể thực thi để ngăn chặn việc tự động hóa dựa trên AI biến thành một sự bất ngờ về tài chính. Hãy sử dụng các mức trần, theo dõi kết quả và để dữ liệu dẫn dắt mức độ tự chủ mà bạn cấp cho các agent của mình.
