Các công cụ MCP làm tăng chứ không phải cắt giảm hóa đơn token đầu vào của Claude Code; mỗi prompt bạn gửi qua một công cụ làm sạch đều kết thúc bằng việc tiêu tốn nhiều token hơn, và do đó tốn nhiều tiền hơn. Các nhà phát triển đang tìm cách giảm chi phí API thường tìm đến các công cụ làm sạch dựa trên MCP, với giả định rằng chúng sẽ thu nhỏ prompt trước khi mô hình nhìn thấy nó.
Tại sao bộ đếm token lại quan trọng
Claude Code tính toán token ngay khi văn bản của bạn chạm tới cửa sổ ngữ cảnh (context window) của mô hình. Mô hình bắt đầu đọc prompt thô, sau đó mới quyết định xem có gọi một công cụ MCP hay không. Công cụ làm sạch chỉ chạy sau khi văn bản gốc đã là một phần của cuộc hội thoại, vì vậy bộ đếm đã ghi nhận các token đó rồi.
Một quy trình điển hình sẽ trông như thế này:
- Prompt thô của bạn được gửi đi – bộ đếm token bắt đầu nhảy số.
- Mô hình đọc prompt và quyết định gọi công cụ làm sạch.
- Công cụ trả về một phiên bản đã được rút gọn.
- Ngữ cảnh hiện chứa ba thành phần: prompt gốc, metadata của lệnh gọi công cụ (tool-call metadata), và prompt đã được làm sạch.
Bạn bị tính phí cho cả ba mục này. Phiên bản "sạch" không thay thế bản gốc; nó chỉ nằm song song với bản gốc mà thôi.
Khi nào việc làm sạch bằng MCP thực sự có ích
Một công cụ MCP chỉ tiết kiệm được token khi văn bản thô không bao giờ đi vào ngữ cảnh chính của Claude Code. Điều đó xảy ra đối với các lệnh gọi hạ nguồn (downstream calls) như:
- Các truy vấn tạo phản hồi tăng cường tra cứu (RAG) mà mô hình chuyển tiếp đến một công cụ tìm kiếm hoặc cơ sở dữ liệu.
- Các hướng dẫn được gửi đến các tác nhân phụ (sub-agents) hoạt động độc lập với cuộc hội thoại chính.
Trong những trường hợp đó, mô hình chuyển trực tiếp payload đã được làm sạch đến hệ thống bên ngoài, giúp giữ văn bản gốc của người dùng nằm ngoài tổng số token chính.
Cách thực sự để giảm token đầu vào
Nếu bạn muốn giảm số lượng token nạp vào Claude Code, hãy làm sạch văn bản trước khi nó chạm tới mô hình. Dưới đây là ba phương pháp thực tế có thể áp dụng ngay:
- Phím tắt cấp hệ thống – Trên Windows dùng script AutoHotkey; trên macOS dùng Automator. Script sẽ chọn phần văn bản bạn sắp gửi, đẩy nó qua một API bên ngoài để nhận về phiên bản đã được làm sạch, sau đó thay thế văn bản trong trình soạn thảo. Vì phiên bản thô không bao giờ rời khỏi máy của bạn, nên chỉ có phiên bản đã làm sạch được gửi đi.
- CLI piping – Khởi chạy Claude Code từ terminal và tiền xử lý prompt của bạn bằng một bộ lọc bash (ví dụ: script
sedhoặc Python) để loại bỏ các khoảng trắng không cần thiết, các chú thích hoặc các cụm từ bị lặp lại. Đầu ra đã qua bộ lọc mới là thứ được nạp vào mô hình. - Chỉ dùng MCP cho các lệnh gọi hạ nguồn – Hãy dành riêng các công cụ MCP cho các bước RAG hoặc sub-agent đã mô tả ở trên. Hãy để mô hình xử lý trực tiếp prompt ban đầu của người dùng, và chỉ để công cụ làm sạch tác động lên payload khi nó rời khỏi cuộc hội thoại chính.
Các sai lầm phổ biến cần tránh
- Giả định rằng các công cụ MCP sẽ cắt tỉa prompt gốc – Chúng thêm một khối token lệnh gọi công cụ và vẫn giữ nguyên văn bản thô, làm tăng tổng số lượng token.
- Dựa dẫm vào các hook của Claude Code – Các hook có thể chèn thêm ngữ cảnh bổ sung hoặc chặn các prompt, nhưng chúng không thể ghi đè lên văn bản đã có trong cuộc hội thoại.
- Sử dụng các lệnh gạch chéo (slash commands) với tính năng làm sạch trực tiếp – Ngay cả khi một lệnh chạy một script làm sạch, các đối số thô vẫn là một phần của dòng lệnh mà mô hình ghi lại, vì vậy bạn vẫn phải trả tiền cho chúng.
Bộ đếm token bắt đầu ngay khi các ký tự của bạn chạm đến endpoint API của mô hình. Bất cứ thứ gì thực hiện việc làm sạch sau thời điểm đó đều chỉ làm tăng thêm chi phí overhead.
Điều này có ý nghĩa gì đối với các nhà phát triển
Giá token xuất hiện như một mục chi phí trên hầu hết các hóa đơn dịch vụ AI. Việc trả quá nhiều tiền vì một "công cụ làm sạch" làm phát sinh thêm các token ẩn có thể nhanh chóng làm xói mòn bất kỳ khoản tiết kiệm nào mà bạn hy vọng đạt được. Hãy chuyển bước làm sạch sang phía client để giữ cho số lượng token được minh bạch và ngân sách của bạn có thể dự đoán được.
Kết luận: Các công cụ MCP hữu ích cho các payload hạ nguồn, nhưng chúng không thể cắt giảm số lượng token của prompt mà bạn nhập vào. Hãy làm sạch trước khi gửi, hoặc giới hạn việc làm sạch cho các lệnh gọi không bao giờ xuất hiện trong ngữ cảnh chính, nếu bạn muốn cắt giảm thực sự chi phí token của Claude Code.
