Một nhà nghiên cứu độc lập đã ghi lại mọi token mà tác nhân nghiên cứu dựa trên LLM của mình tiêu thụ trong một tháng và đã cắt giảm được 31% hóa đơn. Chi phí giảm từ 945 USD xuống còn 651 USD trong khi tỷ lệ thành công tăng nhẹ từ 91% lên 93%, một kết quả mà bất kỳ ai đang vận hành các quy trình AI nhạy cảm về chi phí đều sẽ chú ý.
Tại sao dữ liệu ở cấp độ token lại quan trọng
Hầu hết người dùng LLM chỉ thấy hóa đơn cuối cùng – một con số tổng quát che giấu chi phí của từng tác vụ phụ. Tác nhân của nhà nghiên cứu thực hiện ba hành động cốt lõi: tìm kiếm các hồ sơ SEC, soạn thảo báo cáo và tổng hợp các kết quả nghiên cứu. Nếu không có dữ liệu chi tiết, ông không thể biết liệu 312 USD trả vào tháng 6 có được chi tiêu hợp lý hay không.
Để làm lộ ra sự thất thoát tiềm ẩn, ông đã thêm một lớp ghi nhật ký PostgreSQL để ghi lại tên mô hình, số lượng token, loại tác vụ và chi phí cho mỗi lần gọi. Sau 30 ngày, dữ liệu đã vẽ nên một bức tranh rõ ràng:
- Tìm kiếm hồ sơ SEC – 41% tổng chi tiêu
- Soạn thảo báo cáo – 28%
- Tổng hợp nghiên cứu – 17%
- Kiểm tra chất lượng – 9%
- Khác – 5%
Các con số cho thấy bước tốn kém nhất không phải là bản thân mô hình mà là cách tác nhân đưa các kết quả tìm kiếm thô vào các prompt.
Ba điều chỉnh giúp tiết kiệm chi phí
1. Tóm tắt trước khi đưa vào prompt
Ban đầu, tác nhân nhồi 20 kết quả tìm kiếm thô vào mỗi prompt, làm tăng lượng token đầu vào lên rất nhiều. Ông đã chèn một bộ tóm tắt (summarizer) giá rẻ vào trước đó, giúp cắt giảm đầu vào. Chi phí cho mỗi tác vụ tìm kiếm giảm từ 0,84 USD xuống còn 0,19 USD – giảm 77%.
2. Chuyển các bước kiểm tra đơn giản sang mô hình rẻ hơn
Các bước kiểm tra chất lượng được chạy trên một mô hình cao cấp với chi phí 0,09 USD mỗi lần kiểm tra. Ông đã thay thế bằng một mô hình có giá thấp hơn cho hầu hết các bước kiểm tra đạt/không đạt (pass/fail), giúp giảm giá mỗi lần kiểm tra xuống còn 0,01 USD. Mô hình rẻ hơn trả lời chính xác 89% thời gian; bất kỳ lỗi nào cũng sẽ được chuyển lên mô hình gốc để xử lý, giúp duy trì độ chính xác trong khi cắt giảm 87% chi phí.
3. Bỏ qua kiểm tra khi độ tin cậy cao
Ông đã thêm một quy tắc để bỏ qua bước kiểm tra chất lượng bất cứ khi nào tỷ lệ thành công trong lịch sử của tác vụ đó ở mức cao và độ dài đầu ra nằm trong phạm vi dự kiến. Điều này đã loại bỏ khoảng 60% các lượt kiểm tra lẽ ra vẫn sẽ được thực hiện.
Kết quả đạt được
Với ba thay đổi đã được áp dụng, sổ cái hàng tháng trông như sau:
- Tổng chi tiêu: 945 USD → 651 USD (giảm 31%)
- Chi phí tìm kiếm SEC mỗi tác vụ: 0,84 USD → 0,19 USD (giảm 77%)
- Chi phí kiểm tra chất lượng mỗi tác vụ: 0,09 USD → 0,01 USD (giảm 87%)
- Tỷ lệ thành công tổng thể: 91% → 93%
Tỷ lệ thành công cao hơn cho thấy các prompt ngắn hơn đã giảm bớt nhiễu và giúp mô hình tập trung vào câu hỏi cốt lõi.
Những lưu ý và quan điểm phản biện
Cách tiếp cận này dựa trên hai giả định. Thứ nhất, bộ tóm tắt rẻ hơn phải giữ lại đủ thông tin cho quá trình suy luận tiếp theo; nếu nó loại bỏ các chi tiết quan trọng, chất lượng đầu ra có thể bị ảnh hưởng. Thứ hai, mô hình chi phí thấp được sử dụng để kiểm tra chất lượng không phải là hoàn hảo; độ chính xác 89% của nó có nghĩa là một phần nhỏ lỗi vẫn có thể lọt đến sản phẩm cuối cùng, mặc dù quy trình chuyển tiếp (escalation path) đã bắt được hầu hết chúng. Những người dùng có nhu cầu tuân thủ nghiêm ngặt hơn có thể cần các ngưỡng chặt chẽ hơn hoặc các bước xác thực bổ sung.
Ý nghĩa đối với những người thực hành LLM
- Bảng điều khiển chi tiết sẽ giành chiến thắng. Các báo cáo chi tiêu cấp cao thường che giấu sự lãng phí token. Việc ghi lại mức sử dụng theo từng tác vụ sẽ giúp phát hiện những điểm kém hiệu quả mà nếu không sẽ vẫn bị ẩn đi.
- Không phải lúc nào cũng cần đến các mô hình tiên tiến (frontier models). Một mô hình giá rẻ có thể nén dữ liệu hoặc đưa ra các quyết định nhị phân đơn giản mà không làm ảnh hưởng đến chất lượng tổng thể.
Chi phí ẩn của một tác nhân LLM thường là những công việc không được đo lường. Bằng cách đo lường luồng token và áp dụng các tối ưu hóa có mục tiêu, nhà nghiên cứu đã biến hóa đơn hàng tháng 945 USD thành một hoạt động tinh gọn hơn với mức 651 USD trong khi vẫn thúc đẩy hiệu suất đi lên. Đối với bất kỳ ai đang lập ngân sách cho các khối lượng công việc AI, bài học rất rõ ràng: hãy đo lường mọi token, sau đó để dữ liệu quyết định nơi cần cắt giảm.
