Microsoft đã bổ sung một gói AI Gateway chuyên dụng vào Azure API Management (APIM). Bước đi này cho thấy các lệnh gọi LLM hiện được coi là một khối lượng công việc (workload) riêng biệt, chứ không chỉ là một điểm cuối (endpoint) API thông thường.
Tại sao lưu lượng LLM làm phá vỡ các gateway truyền thống
Một câu lệnh (prompt) duy nhất có thể tốn kém gấp trăm lần so với câu lệnh khác, nhưng một API gateway tiêu chuẩn lại coi cả hai đều là một yêu cầu (request) duy nhất. Gateway này đếm số lần gọi, chứ không phải số lượng token mà mô hình xử lý. Một yêu cầu gửi đi vài trăm token và một yêu cầu gửi đi hàng nghìn token sẽ tạo ra các chỉ số đếm yêu cầu giống hệt nhau, mặc dù yêu cầu sau có thể tốn kém hơn gấp nhiều lần.
Bốn sự thật khiến việc giới hạn dựa trên số lượng yêu cầu trở nên vô dụng đối với AI:
- Chi phí ≠ số lượng yêu cầu. Việc tính phí gắn liền với token, chứ không phải số lượng cuộc gọi HTTP bạn thực hiện.
- Khối lượng token thay đổi rất lớn. Một truy vấn có thể là một câu hỏi ngắn; một truy vấn khác có thể bao gồm một tài liệu dài.
- Lựa chọn mô hình làm thay đổi giá cả. Các LLM khác nhau có mức phí khác nhau trên mỗi token.
- Streaming che giấu hóa đơn cuối cùng. Khi các phản hồi được truyền phát (stream), tổng số lượng token sẽ không được biết cho đến khi luồng dữ liệu kết thúc.
Nếu bạn chỉ tiếp tục đo lường các yêu cầu, bạn sẽ nhận được dữ liệu giám sát không cho bạn biết gì về mức chi tiêu thực tế.
Gói AI Gateway thay đổi điều gì
Hầu hết các chính sách cần thiết để kiểm soát việc sử dụng token đã tồn tại trong các gói APIM tiêu chuẩn—được viết dưới dạng các quy tắc XML và hiển thị trên các bảng điều khiển (dashboard) tùy chỉnh. Gói AI đóng gói các khả năng đó vào một trải nghiệm được xây dựng chuyên dụng:
- Cô lập khả năng mở rộng (scaling) cho lưu lượng AI.
- Cấu hình đơn giản hóa giúp loại bỏ nhu cầu viết các chính sách XML thủ công.
Sự thay đổi cốt lõi nằm ở khía cạnh vận hành: bạn không còn phải viết mã phức tạp hoặc duy trì các bảng điều khiển riêng biệt để thực thi ngân sách token. Gói này cung cấp một giao diện có sẵn cho các kiểm soát đó.
Khi nào nên chuyển đổi – hướng dẫn dựa trên lưu lượng
- AI chỉ chiếm một phần nhỏ trong lưu lượng của bạn. Hãy tiếp tục sử dụng gói APIM hiện tại và thêm các chính sách token nếu bạn cần kiểm soát chi tiết.
- AI chiếm ưu thế trong các cuộc gọi của bạn. Hãy chuyển sang gói AI để cô lập khả năng mở rộng và giữ cho việc quản trị chi phí được rõ ràng.
- Bạn muốn tránh gánh nặng kỹ thuật (engineering overhead). Các công cụ tích hợp sẵn của gói này giúp loại bỏ thời gian dành cho việc xây dựng và duy trì các chính sách tùy chỉnh.
Chi phí lớn nhất không phải là giá đăng ký; mà là số giờ kỹ thuật dành để vá các lỗ hổng trong một gateway thông thường nhằm giúp nó hiểu được kinh tế học về token (token economics).
Kế hoạch triển khai trong giai đoạn Preview
Microsoft vẫn đang cung cấp gói AI ở chế độ xem trước (preview). Hãy coi nó như một môi trường thử nghiệm, không phải là một đợt triển khai chính thức (production).
- Chọn một khối lượng công việc AI nội bộ có lưu lượng lớn. Chọn dịch vụ tạo ra nhiều lưu lượng token nhất.
- Định tuyến khối lượng công việc đó qua gói AI. Sử dụng cấu hình mới để ghi lại mức sử dụng token cho mỗi người dùng.
- Thu thập dữ liệu chi tiêu token trong vài tuần. So sánh số lượng token và các chi phí liên quan với hệ thống giám sát hiện tại của bạn.
- Sử dụng dữ liệu cơ sở (baseline) để lập ngân sách. Quyết định xem lợi ích kiểm soát chi phí của gói này có vượt trội hơn những hạn chế trong giai đoạn preview hay không.
Đừng chuyển các khối lượng công việc quan trọng (mission-critical) sang dịch vụ preview cho đến khi nó được phát hành rộng rãi (general availability).
Quan điểm ngược lại: không phải ai cũng cần một gói riêng biệt
Nếu tổ chức của bạn chỉ thực hiện các cuộc gọi không thường xuyên tới LLM, chi phí bổ sung của gói AI có thể không xứng đáng. Bạn có thể đạt được việc quản trị ở cấp độ token bằng khung chính sách hiện có, mặc dù sẽ tốn nhiều công sức thủ công hơn. Gói này sẽ phát huy thế mạnh khi lưu lượng AI là một phần đáng kể và đang tăng trưởng trong bề mặt API (API surface) của bạn.
Kết luận
Gói AI Gateway thừa nhận rằng lưu lượng LLM hoạt động khác biệt về mặt bản chất so với các cuộc gọi API truyền thống. Bằng cách chuyển từ đếm yêu cầu sang quản trị dựa trên token, nó cung cấp cho các nhà phát triển một cách thực tế để kiểm soát chi tiêu AI mà không bị ngập trong các đoạn mã tùy chỉnh. Đối với các nhóm có mức sử dụng AI đã lớn—hoặc dự kiến sẽ tăng trưởng—việc thử nghiệm bản preview ngay bây giờ có thể giúp xây dựng một mức cơ sở cho chi tiêu token.
