Vercel đã bổ sung tính năng “AI Gateway Budgets,” một hạn mức chi tiêu theo từng dự án và từng API key giúp tự động chặn các cuộc gọi mô hình ngôn ngữ lớn (LLM) tiếp theo khi đạt đến giới hạn đã thiết lập trước. Tính năng này nhằm ngăn chặn tình trạng chi phí AI tăng vọt không kiểm soát do một vòng lặp lỗi hoặc lỗi thử lại (retry bug).

Tại sao một nút ngắt (kill switch) dành riêng cho AI lại quan trọng

Các nhà phát triển sử dụng Vercel AI Gateway sẽ chuyển các yêu cầu LLM thông qua hạ tầng của Vercel và thanh toán cho số lượng token mà các mô hình đó tiêu thụ. Chỉ một vòng lặp prompt-injection hoặc một chính sách thử lại (retry policy) được cấu hình sai cũng có thể tạo ra hàng nghìn yêu cầu token chỉ trong vài phút, biến một ngân sách khiêm tốn thành một hóa đơn lên tới năm chữ số. Các công cụ quản lý chi tiêu hiện có trên Vercel hoạt động ở cấp độ tài khoản và giới hạn (throttle) tất cả lưu lượng truy cập ra ngoài, chứ không chỉ riêng các cuộc gọi AI. Cách tiếp cận thô sơ đó có thể làm tê liệt front-end hoặc API của trang web ngay cả khi vấn đề duy nhất nằm ở việc sử dụng AI.

AI Gateway Budgets khác với các kiểm soát chi tiêu tiêu chuẩn như thế nào

  • Phạm vi (Scope) – Ngân sách chỉ áp dụng cho chi tiêu token AI, giữ nguyên các phần khác của tài khoản.
  • Độ chi tiết (Granularity) – Hạn mức có thể được thiết lập ở cấp độ nhóm (team), dự án (project) hoặc từng API key riêng lẻ.
  • Hành vi (Behavior) – Khi chạm hạn mức, gateway sẽ trả về phản hồi HTTP 402 “Payment Required”, báo hiệu rằng yêu cầu đã bị chặn vì ngân sách đã hết.
  • Sự cô lập (Isolation) – Một dự án duy nhất chạm hạn mức sẽ không thể làm cạn kiệt số tiền còn lại của nhóm, giúp bảo vệ các dự án khác khỏi những thiệt hại không đáng có.

Thiết lập ngân sách trong vài phút

Vercel cho phép bạn cấu hình ngân sách thông qua bảng điều khiển web (web dashboard) hoặc giao diện dòng lệnh (CLI). CLI rất hữu ích để lập kịch bản (scripting) trên nhiều môi trường khác nhau.

Hạn mức toàn nhóm (hàng tháng)

vercel ai-gateway budgets set team --limit 500 --refresh-period monthly

Hạn mức riêng cho dự án (hàng tháng)

vercel ai-gateway budgets set project my-project --limit 200 --refresh-period monthly

Các ngân sách được tính cộng dồn, vì vậy hạn mức nào thấp hơn sẽ được áp dụng. Nếu dự án đạt đến mức trần 200 USD, các yêu cầu sẽ dừng lại ngay cả khi nhóm vẫn còn 300 USD.

API key dành cho nhà thầu

vercel ai-gateway api-keys create --name contractor \
  --limit 50 --refresh-period none --expiration 30d

Key này sẽ hết hạn sau 30 ngày và dừng hoạt động sau khi chi tiêu AI đạt 50 USD, tạo ra một cửa sổ truy cập có giới hạn thời gian và chi phí rõ ràng cho những người đóng góp bên ngoài.

Các hạn mức thực sự hoạt động như thế nào

  • Hạn mức mềm (Soft cap) – Yêu cầu đẩy mức chi tiêu vượt ngưỡng vẫn sẽ được hoàn tất, vì vậy có thể xảy ra tình trạng vượt mức một chút.
  • Độ trễ thực thi (Enforcement lag) – Ngân sách được đánh giá khoảng một hoặc hai phút một lần; một loạt các cuộc gọi ngay sau khi đạt hạn mức có thể lọt qua trước khi lệnh chặn được kích hoạt.
  • Không áp dụng cho BYOK – Nếu bạn sử dụng key của nhà cung cấp đám mây riêng (BYOK) để thanh toán trực tiếp với nhà cung cấp LLM bên ngoài, hệ thống ngân sách của Vercel sẽ không thể thấy lưu lượng đó, do đó hạn mức sẽ không được áp dụng.

Khi nào tính năng này phát huy tác dụng và khi nào nó còn hạn chế

Nút ngắt này là một câu trả lời thực tế cho vấn đề “sốc hóa đơn AI” vốn đã gây ám ảnh cho nhiều đội ngũ SaaS. Đối với hầu hết các dự án được lưu trữ trên Vercel dựa vào AI Gateway tích hợp sẵn, ngân sách có thể được thiết lập trong chưa đầy mười phút và cung cấp một lưới an toàn chống lại việc chi tiêu quá mức ngoài ý muốn.

Tuy nhiên, bản chất của hạn mức mềm có nghĩa là một sự tăng vọt ngắn hạn vẫn có thể khiến bạn tốn thêm vài đô la vượt quá giới hạn. Các đội ngũ cần sự dừng lại tuyệt đối (hard stop) có thể thấy độ trễ ở mức phút là không đủ. Hơn nữa, các doanh nghiệp điều hướng lưu lượng LLM thông qua thông tin xác thực đám mây riêng của họ phải dựa vào các cơ chế kiểm soát chi phí bên ngoài, vì ngân sách của Vercel sẽ không thấy được mức sử dụng đó.

Những điều cần theo dõi tiếp theo

  • Chỉ số áp dụng (Adoption metrics) – Phản hồi sớm từ các nhà phát triển sẽ cho biết liệu độ chi tiết của ngân sách có giải quyết được các kịch bản vượt chi phí phổ biến nhất hay không.
  • Mở rộng tính năng – Các yêu cầu về cảnh báo thời gian thực, khoảng thời gian thực thi chặt chẽ hơn hoặc các hạn mức nhận biết BYOK có thể định hình các bản cập nhật trong tương lai.
  • Phản ứng cạnh tranh – Các nền tảng serverless khác có thể giới thiệu các kiểm soát chi tiêu dành riêng cho AI tương tự, biến bước đi của Vercel thành một tiêu chuẩn rộng lớn hơn trong ngành.

Tóm lại

AI Gateway Budgets của Vercel cung cấp cho các nhà phát triển một cách nhanh chóng, theo từng dự án để dừng chi tiêu token AI trước khi nó phình to thành một hóa đơn bất ngờ. Công cụ này dễ dàng kích hoạt, hoạt động ở cấp độ mà hầu hết các sự cố chi phí mất kiểm soát xảy ra, và trả về lỗi rõ ràng khi vượt quá hạn mức. Những nhược điểm chính của nó—vượt mức một chút, độ trễ thực thi ở mức phút và không có khả năng hiển thị lưu lượng BYOK—đều rất minh bạch, để các đội ngũ tự quyết định xem sự đánh đổi này có phù hợp với mức độ chấp nhận rủi ro của họ hay không. Đối với bất kỳ ai đang chạy các cuộc gọi LLM trên Vercel, nút ngắt mới này là một biện pháp bảo vệ thực tế đáng để cấu hình ngay hôm nay.