API của Kimi K3 trông có vẻ rẻ trên lý thuyết, nhưng các khoản phí ẩn và sự thiếu hụt thông tin kỹ thuật có thể khiến nó trở nên đắt đỏ hơn nhiều so với những con số quảng cáo.

Những gì sự cường điệu bỏ qua

Tài liệu ra mắt của Moonshot AI quảng bá một mô hình 2,8 nghìn tỷ tham số "rẻ" và "mở". Thông cáo báo chí cũng hứa hẹn sẽ sớm cho phép tải xuống các trọng số (weights). Tuy nhiên, cả hai tuyên bố này đều chưa được chứng minh.

  • Trọng số chưa khả dụng – Moonshot đã đặt thời hạn đến ngày 27 tháng 7 năm 2026 để phát hành một checkpoint công khai. Cho đến lúc đó, người dùng phải gọi API được lưu trữ (hosted API), vì vậy lời hứa "mã nguồn mở" chẳng mang lại giá trị sử dụng thực tế nào.
  • 2,8 nghìn tỷ tham số không phải tất cả đều hoạt động – Con số này mô tả tổng công suất của kiến trúc. Thiết kế Mixture-of-Experts của K3 điều hướng mỗi token qua 16 trong số 896 mạng con chuyên gia (expert sub-networks). Moonshot vẫn chưa cho biết có bao nhiêu tham số được chạy cho mỗi yêu cầu, khiến việc ước tính bộ nhớ và tính toán trở nên bất khả thi.

Mức giá trông có vẻ tốt – cho đến khi bạn đếm số từ

Mức giá đã công bố:

  • Đầu vào có cache (cache-hit input): 0,30 USD cho mỗi 1 triệu token
  • Đầu vào không có cache (uncached input): 3,00 USD cho mỗi 1 triệu token
  • Đầu ra (Output): 15,00 USD cho mỗi 1 triệu token

Những mức giá đó trông có vẻ khiêm tốn, nhưng chúng bỏ qua khối lượng token.

Một thử nghiệm gần đây đã đo lường đầu ra của K3 ở mức 130 triệu token, cao hơn gấp đôi so với mức 63 triệu token mà các mô hình hàng đầu khác tạo ra trong cùng các tác vụ. Sự dài dòng của mô hình làm tăng trực tiếp hóa đơn đầu ra—số lượng từ gấp đôi đồng nghĩa với chi phí gấp đôi. Đối với việc tạo mã (code generation), viết tiểu luận hoặc các tác nhân trò chuyện (chat agents), mức giá 15 USD cho mỗi triệu token có thể chiếm phần lớn chi phí chi tiêu.

Điều này có ý nghĩa gì đối với các nhóm người dùng khác nhau

Các nhà phát triển và nghiên cứu viên

Nếu bạn thử nghiệm K3 để hỗ trợ lập trình hoặc nghiên cứu dựa trên dữ liệu, hãy áp đặt các giới hạn cứng (hard caps) cho đầu ra token. Một thử nghiệm A/B so sánh K3 với một mô hình cơ sở (baseline model) có giới hạn đầu ra tương đương sẽ cho thấy liệu việc sử dụng token cao hơn là do mô hình hay do thiết kế câu lệnh (prompt design).

Các nhóm chú trọng ngân sách

Mức giảm giá khi có cache (cache-hit) chỉ áp dụng khi cùng một đầu vào được lặp lại. Hãy soạn thảo các tiền tố câu lệnh (prompt prefixes) ổn định để tạo ra các chuỗi đầu vào giống hệt nhau nhằm đẩy nhiều yêu cầu hơn vào mức giá 0,30 USD; điều này chỉ hiệu quả với các khối lượng công việc có tính lặp lại cao (ví dụ: các truy vấn theo mẫu). Hầu hết các đầu vào đa dạng sẽ phải quay về mức giá không có cache là 3,00 USD.

Các công ty đang cân nhắc tự lưu trữ (self-hosting)

Chờ đợi việc phát hành checkpoint là một quyết định khôn ngoan. Việc tự lưu trữ mô hình sẽ loại bỏ phí trên mỗi token nhưng lại làm phát sinh các chi phí hạ tầng và bản quyền chưa được tiết lộ. Cho đến khi các trọng số được công khai, API được lưu trữ vẫn là lựa chọn thực tế duy nhất.

Môi trường sản xuất (Production environments)

Đừng chuyển đổi chỉ vì mức giá quảng cáo có vẻ thấp hơn các đối thủ. Hãy chạy thử nghiệm (pilot) để đo lường chi phí trên mỗi tác vụ hoàn thành, bao gồm cả các chi phí phụ ẩn do các phản hồi dài hơn, thay vì chỉ tính chi phí trên mỗi token. Chỉ khi đó, bạn mới có thể quyết định liệu K3 có giúp tiết kiệm tiền hay không.

Những điều cần theo dõi tiếp theo

  • Phát hành checkpoint ngày 27 tháng 7 năm 2026 – các trọng số dự kiến sẽ được phát hành vào ngày đó.
  • Công bố số lượng tham số hoạt động – việc biết được bao nhiêu trong số 2,8 nghìn tỷ tham số được chạy cho mỗi token sẽ cho phép người dùng xác định quy mô phần cứng một cách chính xác.

Kết luận

Mức giá đầu ra 15 USD cho mỗi triệu token được quảng cáo của K3 chỉ mới phản ánh một nửa sự thật. Xu hướng tạo ra lượng token nhiều gấp đôi so với các đối thủ có thể xóa sạch mọi khoản tiết kiệm được quảng cáo, đặc biệt là đối với các tác vụ trả lời dài. Cho đến khi các trọng số được tung ra và số lượng tham số hoạt động được làm rõ, hãy coi K3 là một dịch vụ cao cấp, có khả năng dài dòng, thay vì là một lựa chọn thay thế giá rẻ. Hãy thực hiện các bài kiểm tra ngân sách token, áp đặt giới hạn đầu ra và chỉ chuyển đổi sau khi bạn đã đo lường được chi phí thực tế cho mỗi công việc hoàn thành.