Microsoft dodał dedykowany poziom AI Gateway do Azure API Management (APIM). Ten ruch sygnalizuje, że wywołania LLM są teraz traktowane jako oddzielne obciążenie (workload), a nie tylko kolejny punkt końcowy API.

Dlaczego ruch LLM rozbija klasyczne bramy (gateways)

Pojedynczy prompt może kosztować sto razy więcej niż inny, a mimo to standardowa brama API traktuje oba jako pojedyncze żądanie. Brama zlicza wywołania, a nie liczbę tokenów przetwarzanych przez model. Żądanie przesyłające kilkaset tokenów oraz takie, które przesyła wiele tysięcy, generują identyczne metryki liczby żądań, mimo że to drugie może kosztować o rzędy wielkości więcej.

Cztery fakty sprawiają, że limity oparte na liczbie żądań są bezużyteczne dla AI:

  • Koszt ≠ liczba żądań. Rozliczenia są powiązane z tokenami, a nie z liczbą wykonywanych wywołań HTTP.
  • Wolumen tokenów znacznie się różni. Jedno zapytanie może być krótkim pytaniem; inne może zawierać długi dokument.
  • Wybór modelu zmienia cenę. Różne modele LLM stosują różne stawki za token.
  • Streaming ukrywa ostateczny rachunek. W przypadku strumieniowania odpowiedzi, całkowita liczba tokenów nie jest znana aż do zakończenia strumienia.

Jeśli będziesz mierzyć tylko żądania, otrzymasz dane z monitoringu, które nie powiedzą Ci nic o rzeczywistych wydatkach.

Co zmienia poziom AI Gateway

Większość polityk niezbędnych do kontrolowania zużycia tokenów już istnieje w standardowych poziomach APIM – są one zapisane jako reguły XML i wyświetlane na niestandardowych pulpitach nawigacyjnych (dashboards). Poziom AI łączy te same możliwości w dedykowanym rozwiązaniu:

  • Izolacja skalowania dla ruchu AI.
  • Uproszczona konfiguracja, która eliminuje potrzebę ręcznego tworzenia polityk XML.

Kluczowa zmiana ma charakter operacyjny: nie musisz już pisać złożonego kodu ani utrzymywać osobnych pulpitów nawigacyjnych, aby egzekwować budżety tokenów. Poziom ten zapewnia gotowy interfejs do tych kontroli.

Kiedy dokonać zmiany – przewodnik oparty na ruchu

  • AI stanowi niewielką część Twojego ruchu. Kontynuuj korzystanie z obecnego poziomu APIM i dodaj polityki tokenów, jeśli potrzebujesz precyzyjnej kontroli.
  • AI dominuje w Twoich wywołaniach. Przejdź na poziom AI, aby odizolować skalowanie i zachować przejrzystość zarządzania kosztami.
  • Chcesz uniknąć narzutu inżynieryjnego. Wbudowane narzędzia tego poziomu eliminują czas poświęcany na budowanie i utrzymywanie niestandardowych polityk.

Największym wydatkiem nie jest cena subskrypcji, lecz godziny pracy inżynierów poświęcone na łatanie luk w ogólnej bramie, aby nauczyć ją rozumieć ekonomię tokenów.

Plan działania w fazie Preview

Microsoft oferuje poziom AI w wersji preview. Traktuj go jako środowisko testowe, a nie gotowe rozwiązanie produkcyjne.

  1. Wybierz wewnętrzne obciążenie AI o dużym wolumenie. Wybierz usługę, która generuje największy ruch tokenów.
  2. Skieruj to obciążenie przez poziom AI. Wykorzystaj nową konfigurację, aby rejestrować zużycie tokenów na każdego konsumenta.
  3. Zbieraj dane o wydatkach na tokeny przez kilka tygodni. Porównaj liczbę tokenów i powiązane z nimi koszty z obecnym monitoringiem.
  4. Wykorzystaj bazę do planowania budżetu. Zdecyduj, czy korzyści z kontroli kosztów oferowane przez ten poziom przeważają nad jego ograniczeniami w fazie preview.

Nie przenoś krytycznych obciążeń produkcyjnych do usługi w wersji preview, dopóki nie zostanie ona udostępniona w wersji ogólnej (general availability).

Kontrargument: nie każdy potrzebuje osobnego poziomu

Jeśli Twoja organizacja wykonuje jedynie sporadyczne wywołania LLM, dodatkowy koszt poziomu AI może nie być uzasadniony. Możesz osiągnąć kontrolę na poziomie tokenów za pomocą istniejącego frameworka polityk, choć wymaga to większego nakładu pracy ręcznej. Poziom ten sprawdza się najlepiej, gdy ruch AI stanowi istotną i rosnącą część Twojej powierzchni API.

Podsumowanie

Poziom AI Gateway uznaje, że ruch LLM zachowuje się fundamentalnie inaczej niż tradycyjne wywołania API. Przechodząc od zliczania żądań do zarządzania opartego na tokenach, daje programistom praktyczny sposób na kontrolowanie wydatków na AI bez tonięcia w niestandardowym kodzie. Dla zespołów, których wykorzystanie AI jest już znaczne — lub ma wzrosnąć — przetestowanie wersji preview już teraz może pomóc w zbudowaniu bazy odniesienia dla wydatków na tokeny.