Tại sao hóa đơn lại tăng vọt

Khi nhóm lần đầu tiên tích hợp AI tạo sinh, họ đã gửi mọi yêu cầu của người dùng đến mô hình mới nhất và mạnh mẽ nhất. Khi lưu lượng truy cập tăng lên, chi phí trên mỗi yêu cầu cũng tăng theo tỉ lệ thuận, và bảng tính của Giám đốc Tài chính (CFO) cho thấy mức chi tiêu đang vượt xa tốc độ tăng trưởng người dùng. Giải pháp nhanh chóng thông thường — "chỉ cần dùng mô hình rẻ hơn" — thường thất bại trong môi trường thực tế vì các truy vấn khác nhau đòi hỏi các mức độ suy luận khác nhau. Đòn bẩy thực sự nằm ở cách yêu cầu được gửi đi, chứ không phải ở việc luôn luôn sử dụng một mô hình nhất định.

Xây dựng một lớp định tuyến giúp tiết kiệm chi phí

Kỹ sư đã xử lý dịch vụ suy luận (inference service) như bất kỳ thành phần sản xuất nào khác: xác định các phân tầng (tiers), thiết lập các cam kết mức dịch vụ (SLA) và áp đặt ngân sách độ trễ (latency budgets). Kiến trúc kết quả bao gồm bốn thành phần vận hành cùng nhau để mang lại mức giảm chi phí lên tới 95%.

Định tuyến theo phân tầng

Một lớp front-end mỏng sẽ phân loại từng yêu cầu đến dựa trên độ khó. Khoảng 95% các truy vấn sẽ rơi vào phân tầng "rẻ" chạy một mô hình khiêm tốn; chỉ có 5% khó nhất là được chuyển lên mô hình cao cấp (premium). Việc phân loại có thể dựa trên quy tắc (ví dụ: độ dài, sự hiện diện của các từ khóa chuyên ngành) hoặc được học từ dữ liệu chuyển tầng trong quá khứ. Bằng cách mặc định sử dụng phân tầng chi phí thấp, chi phí hàng tháng của chatbot đã giảm từ 420 USD xuống còn 28 USD.

Lựa chọn mô hình phù hợp (Model right-sizing)

Việc khớp năng lực của mô hình với độ phức tạp của tác vụ mang lại khoản tiết kiệm lớn nhất:

  • Chat đơn giản – sử dụng mô hình nhẹ thay vì mô hình chủ lực (tiết kiệm 97,5%).
  • Phân loại – thay thế mô hình tầm trung bằng một lựa chọn thay thế rẻ hơn (tiết kiệm 98,3%).
  • Tóm tắt – thay thế mô hình hàng đầu bằng một mô hình tầm trung (tiết kiệm 97,2%).

Tên chính xác của các mô hình không quá quan trọng; nguyên tắc cốt lõi là giữ lại mô hình mạnh mẽ nhất để dự phòng cho số ít các truy vấn thực sự cần đến nó.

Bộ nhớ đệm thông minh (Smart caching)

Mỗi lần truy xuất bộ nhớ đệm thành công (cache hit) sẽ loại bỏ một lượt gọi mạng và một khoản phí API. Một bộ nhớ đệm Redis phân tán sẽ lưu trữ các phản hồi thành công cũng như các câu trả lời "phủ định" ("Tôi không biết"). Khi cùng một câu hỏi không thể trả lời xuất hiện lại, hệ thống sẽ trả về câu "Tôi không biết" đã được lưu trong bộ nhớ đệm thay vì gọi mô hình lần thứ hai. Qua hàng ngàn yêu cầu, chỉ riêng việc này đã cắt giảm được một phần đáng kể hóa đơn.

Nén câu lệnh (Prompt compression)

Các câu lệnh (prompt) dài làm tăng mức sử dụng token, điều này chuyển hóa trực tiếp thành chi phí. Nhóm đã chạy một bộ tóm tắt rẻ tiền ở phía client hoặc trong bước tiền xử lý, thu nhỏ ngữ cảnh từ 2.000 token xuống còn khoảng 400 token trước khi gửi đến mô hình đắt tiền. Việc giảm lượng token này nhân lên trên tất cả các yêu cầu, mang lại khoản tiết kiệm khổng lồ mà không làm thay đổi trải nghiệm của người dùng cuối.

Gom nhóm chiến lược (Strategic batching)

Gom nhóm (Batching) nhóm nhiều yêu cầu độc lập vào một lần gọi API duy nhất. Quy tắc ngón tay cái rất đơn giản: nếu người dùng đang chờ câu trả lời, đừng gom nhóm; nếu yêu cầu chạy ngầm (báo cáo hàng đêm, các tác vụ theo lịch trình), hãy gom nhóm tất cả. Chỉ riêng các tác vụ gom nhóm vào ban đêm đã giúp cắt giảm thêm 10-20% chi tiêu.

Giám sát vòng lặp tối ưu hóa

Bạn không thể cải thiện những gì bạn không đo lường được. Kỹ sư đã thiết lập bốn chỉ số hàng tuần:

  1. Chi phí trên mỗi yêu cầu, được chia nhỏ theo phân tầng.
  2. Tỷ lệ truy xuất bộ nhớ đệm (cache-hit rate) cho mỗi đường dẫn định tuyến.
  3. Tỷ lệ chuyển tầng từ phân tầng rẻ sang phân tầng cao cấp.
  4. Chi tiêu trên mỗi phân khúc khách hàng.

Những con số này giúp phát hiện sự sai lệch (drift) — ví dụ: tỷ lệ chuyển tầng tăng lên có thể là dấu hiệu cho thấy logic phân loại quá gắt gao hoặc chất lượng của mô hình rẻ tiền đã bị giảm sút. Nhóm sẽ lặp lại việc điều chỉnh các ngưỡng (thresholds), việc chỉ định mô hình và các chính sách bộ nhớ đệm mỗi tuần, biến việc kiểm soát chi phí thành một thói quen thay vì một phản ứng mang tính khủng hoảng.

Bài học rút ra

Một lớp định tuyến có kỷ luật — giúp phân loại yêu cầu, lựa chọn mô hình phù hợp, lưu bộ nhớ đệm mạnh mẽ, nén câu lệnh và gom nhóm các tác vụ chạy ngầm — có thể cắt giảm tới 95% chi phí AI-API trong khi vẫn giữ được độ tin cậy cao. Hãy coi ngăn xếp suy luận (inference stack) như một dịch vụ sản xuất: xác định các phân tầng, đo lường kết quả và lặp lại quy trình hàng tuần.