Hóa đơn dịch vụ AI của chúng tôi đã tăng vọt lên 31.000 USD trong tháng này—gấp hơn ba lần so với ngân sách dự kiến—chỉ vì một dòng mã duy nhất đã gửi khoảng 80% lưu lượng truy cập của chúng tôi đến mô hình đắt nhất, GPT-4o.

Tại sao hóa đơn lại tăng vọt

Chúng tôi xây dựng hệ thống để đảm bảo độ tin cậy: phản hồi nhanh, không có thời gian chết (zero downtime), khả năng mở rộng mượt mà. Lựa chọn đó đã tạo ra một lỗi "rò rỉ bộ nhớ" (memory leak) điển hình trong việc sử dụng token—token liên tục bị tiêu tốn cho một mô hình quá mức cần thiết đối với hầu hết các tương tác.

Sự thay đổi về kỹ thuật: coi chi phí là một vấn đề về kiến trúc

Việc coi chi phí AI là một vấn đề tài chính đã che lấp đòn bẩy thực sự: chính là đoạn mã quyết định mô hình nào sẽ xử lý mỗi yêu cầu. Việc đưa việc lựa chọn mô hình vào lớp định tuyến (routing layer) đã biến một khoản chi phí ẩn thành một biến số có thể kiểm soát được.

1. Khớp mô hình với tác vụ

Quy tắc rất đơn giản: sử dụng mô hình nhỏ nhất có thể đáp ứng yêu cầu về chất lượng. Chúng tôi đã ánh xạ bốn loại yêu cầu phổ biến sang các lựa chọn thay thế rẻ hơn:

  • Chat đơn giản → DeepSeek V4 Flash (tiết kiệm 97,5%)
  • Phân loại → Qwen3-8B (tiết kiệm 98,3%)
  • Tạo mã → DeepSeek Coder (tiết kiệm 97,5%)
  • Tóm tắt → Qwen3-32B (tiết kiệm 97,2%)

Những tỷ lệ phần trăm này phản ánh khoảng cách giá token trực tiếp giữa mô hình được chọn và GPT-4o. Sự đánh đổi là một sự sụt giảm nhẹ về khả năng đối với các tác vụ không cần khả năng suy luận cấp cao nhất.

2. Định tuyến phân tầng, giống như một CDN

Chúng tôi đã xây dựng một bộ định tuyến hai tầng, trước tiên sẽ gửi mọi yêu cầu đến mô hình rẻ tiền. Nếu phản hồi không vượt qua được bước kiểm tra chất lượng nhanh—như độ tin cậy (confidence) dưới ngưỡng hoặc thiếu các thực thể (entities) bắt buộc—chúng tôi sẽ tự động định tuyến lại yêu cầu đó đến một mô hình ở tầng cao hơn. Cơ chế dự phòng (fallback) này giúp duy trì trải nghiệm người dùng trong khi chỉ tính phí mô hình cao cấp khi thực sự cần thiết.

3. Lưu bộ nhớ đệm (cache) cho các prompt lặp lại

Nhiều tương tác sử dụng lại cùng một system prompt hoặc văn bản FAQ. Bằng cách lưu bộ nhớ đệm cho các đầu ra đó, chúng tôi tránh được việc phải tính toán lại các phản hồi giống hệt nhau. Việc sử dụng in-memory cache đã giúp cắt giảm chi phí cho các prompt lặp lại khoảng 30% trong các thử nghiệm của chúng tôi.

4. Nén prompt trước khi gửi

Các system prompt dài tiêu tốn token với tốc độ tương đương với nội dung của người dùng. Chúng tôi đã thêm một bộ tiền xử lý (pre-processor) chạy một trình tóm tắt rẻ tiền trên prompt, cắt tỉa nó về các ngữ cảnh thiết yếu trước khi chuyển tiếp đến mô hình đắt tiền. Chỉ riêng bước đó đã giúp tiết kiệm hàng ngàn đô la mỗi năm chi phí token.

Tác động thực tế

Một chatbot trước đây tiêu tốn 420 USD/tháng. Sau khi định tuyến 85% các truy vấn của nó sang một mô hình rẻ hơn và áp dụng cơ chế lưu bộ nhớ đệm, hóa đơn đã giảm xuống còn 28 USD. Độ trễ (latency) được cải thiện vì mô hình nhẹ hơn phản hồi nhanh hơn, và đường dẫn dự phòng hiếm khi được kích hoạt.

Bài học rút ra

Hãy coi chi phí AI là một quyết định kiến trúc quan trọng. Định tuyến các yêu cầu đến mô hình phù hợp, thêm cơ chế dự phòng dựa trên chất lượng, lưu bộ nhớ đệm cho các prompt lặp lại và nén đầu vào—bạn có thể cắt giảm mạnh chi phí trong khi vẫn giữ nguyên độ tin cậy.