API prompt-caching mới của Claude Opus 5 giúp cắt giảm mạnh hóa đơn token cho các ứng dụng dạng chat bằng cách cho phép mô hình bỏ qua việc đọc lại các văn bản không thay đổi. Yêu cầu đầu tiên sẽ phải trả một mức phí phụ thu khiêm tốn; mọi yêu cầu tiếp theo sau đó chỉ tốn khoảng 1/10 mức giá cơ bản, biến một khoản chi phí định kỳ thành một khoản phí trả một lần.

Tại sao các nhà phát triển phải trả tiền hai lần cho cùng một nội dung

Hầu hết các giao diện hội thoại đều xây dựng lại toàn bộ prompt trong mỗi lượt: một prompt hệ thống 8.000 token, các tệp PDF đính kèm và toàn bộ lịch sử đối thoại đều được gửi đến mô hình mỗi khi người dùng đặt câu hỏi tiếp theo. Mô hình phải xử lý lại mọi token mặc dù phần lớn văn bản đó không hề thay đổi. Với mức giá hiện tại, sự dư thừa này có thể chiếm phần lớn chi phí của một bot hoạt động liên tục.

Cách bộ nhớ đệm (cache) thay đổi bài toán chi phí

API tạo ra một mục nhập cache cho mỗi "khối" (block) token cho đến một điểm ngắt (breakpoint) đã xác định. Khi yêu cầu tiếp theo chứa cùng một khối ở ngay đầu, dịch vụ sẽ đọc nó từ cache thay vì phải mã hóa token lại. Sự phân chia giá cả phản ánh lượng công việc được tiết kiệm:

  • Ghi cache – TTL 5 phút: 1.25 × giá cơ bản
  • Ghi cache – TTL 1 giờ: 2 × giá cơ bản
  • Đọc cache (hit): 0.1 × giá cơ bản

Trong thực tế, lần gọi đầu tiên cho một khối mới sẽ tốn nhiều hơn một chút so với một yêu cầu thông thường. Mọi lần gọi sau đó nếu trúng cache (hit) sẽ rẻ hơn 90%, vì vậy tổng chi tiêu sẽ giảm mạnh khi cuộc hội thoại kéo dài hơn.

“Quy tắc vàng” để cấu trúc prompt

Hiệu quả của cache phụ thuộc vào việc bạn đặt nội dung tĩnh và nội dung động ở đâu. Hãy đưa tất cả những gì không thay đổi lên đầu, và đẩy các phần luôn thay đổi xuống cuối. Một thứ tự đáng tin cậy sẽ như sau:

  1. Tools – định nghĩa của bất kỳ hàm bên ngoài nào mà mô hình có thể gọi.
  2. System instructions – các chỉ dẫn cấp cao mà bạn muốn mô hình tuân theo.
  3. Documents – ngữ cảnh dài như PDF, cơ sở kiến thức hoặc các đoạn trích chính sách.
  4. User questions – câu hỏi trực tiếp của người dùng, vốn thay đổi theo từng lượt.

Nếu bạn sửa đổi bất kỳ token nào trước một điểm ngắt, mục nhập cache sẽ bị vô hiệu hóa và mô hình phải xử lý lại mọi thứ theo sau đó.

Các giới hạn ẩn mà bạn cần lưu ý

  • Kích thước khối tối thiểu – Opus 5 chỉ cache các khối chứa ít nhất 512 token. Bất kỳ thứ gì nhỏ hơn sẽ hoàn toàn không được cache.
  • Lỗi dấu thời gian (Timestamp bug) – việc chèn một dấu thời gian thay đổi liên tục vào bên trong một khối đã được cache sẽ đảm bảo việc cache bị thất bại, vì văn bản của khối đó sẽ không bao giờ khớp chính xác.
  • Khả năng truy hồi 20 khối – dịch vụ chỉ quét 20 khối gần nhất để tìm sự trùng khớp. Các phiên làm việc kéo dài và nhảy bước quá nhanh có thể vượt quá phạm vi của cache.
  • Các yêu cầu song song – việc gửi nhiều yêu cầu giống hệt nhau tại cùng một thời điểm sẽ đều không trúng cache, vì cache chỉ được lấp đầy sau khi yêu cầu đầu tiên hoàn tất. Hãy "làm nóng" cache bằng một lần gọi duy nhất, sau đó mới thực hiện các yêu cầu còn lại.

Xem mức tiết kiệm trong phản hồi API của bạn

Mỗi phản hồi sẽ báo cáo ba bộ đếm token:

  • cache_read_input_tokens – các token được lấy từ một lần trúng cache (cache hit).
  • cache_creation_input_tokens – các token được ghi vào cache trong yêu cầu này.
  • input_tokens – các token mới không được cache.

Cộng cả ba con số này lại để có tổng số token mà mô hình đã xem xét cho lượt đó. Nếu cả hai trường cache đều bằng không, yêu cầu đó đã không trúng cache; hãy kiểm tra lại kích thước khối và vị trí đặt điểm ngắt của bạn.

Tóm tắt: Bằng cách đưa các ngữ cảnh không đổi lên đầu và để API prompt-caching của Claude Opus 5 thực hiện các công việc nặng nhọc, bạn sẽ biến một khoản chi phí token định kỳ thành một khoản phí trả một lần. Kết quả là sự giảm thiểu chi phí đáng kể cho bất kỳ chatbot nào thường xuyên tham chiếu đến cùng một prompt hệ thống hoặc bộ tài liệu—với điều kiện bạn tuân thủ ngưỡng tối thiểu token, tránh các dấu hiệu có thể thay đổi bên trong các khối đã cache, và giữ nội dung đủ điều kiện cache trong phạm vi 20 khối.