Microsoft heeft een specifieke AI Gateway-tier toegevoegd aan Azure API Management (APIM). Deze stap geeft aan dat LLM-aanroepen nu worden behandeld als een aparte workload, en niet simpelweg als een ander API-endpoint.

Waarom LLM-verkeer klassieke gateways verstoort

Eén enkele prompt kan honderd keer meer kosten dan een andere, maar een standaard API-gateway ziet beide als een enkele aanvraag. De gateway telt het aantal aanroepen, niet het aantal tokens dat het model verwerkt. Een verzoek dat een paar honderd tokens verstuurt en een verzoek dat er vele duizenden verstuurt, genereren identieke metrieken voor het aantal aanvragen, ook al kunnen de kosten van de laatste vele malen hoger liggen.

Vier feiten maken aanvraaggebaseerde limieten nutteloos voor AI:

  • Kosten ≠ aantal aanvragen. Facturering is gekoppeld aan tokens, niet aan het aantal HTTP-aanroepen dat je maakt.
  • Tokenvolume varieert enorm. De ene query kan een korte vraag zijn; een andere kan een lang document bevatten.
  • Keuze van het model beïnvloedt de prijs. Verschillende LLM's hanteren verschillende tarieven per token.
  • Streaming verbergt de uiteindelijke rekening. Bij streaming antwoorden is het totale aantal tokens pas bekend wanneer de stream eindigt.

Als je alleen aanvragen blijft meten, houd je monitoringgegevens over die je niets vertellen over de werkelijke uitgaven.

Wat de AI Gateway-tier verandert

De meeste beleidsregels (policies) die nodig zijn om het tokenverbruik te controleren, bestaan al in de standaard APIM-tiers — geschreven als XML-regels en weergegeven op aangepaste dashboards. De AI-tier bundelt diezelfde mogelijkheden in een speciaal hiervoor ontwikkelde ervaring:

  • Isolatie van schaalbaarheid voor AI-verkeer.
  • Vereenvoudigde configuratie die de noodzaak voor handmatig gemaakte XML-policies wegneemt.

De kernverschuiving is operationeel: je hoeft niet langer complexe code te schrijven of aparte dashboards te onderhouden om tokenbudgetten af te dwingen. De tier biedt een kant-en-klare interface voor deze controles.

Wanneer overstappen – een gids op basis van verkeer

  • AI is een klein deel van je verkeer. Blijf je huidige APIM-tier gebruiken en voeg token-policies toe als je fijnmazige controle nodig hebt.
  • AI domineert je aanroepen. Stap over naar de AI-tier om schaalbaarheid te isoleren en de kostenbeheersing overzichtelijk te houden.
  • Je wilt engineering-overhead vermijden. De ingebouwde tools van de tier besparen de tijd die normaal gaat zitten in het bouwen en onderhouden van aangepaste policies.

De grootste kostenpost is niet de abonnementsprijs; het zijn de engineering-uren die worden besteed aan het dichten van gaten in een generieke gateway om deze token-economie te laten begrijpen.

Playbook voor de preview-fase

Microsoft biedt de AI-tier momenteel nog aan in preview. Beschouw dit als een testomgeving, niet als een productie-lancering.

  1. Selecteer een interne AI-workload met een hoog volume. Kies de service die het meeste tokenverkeer genereert.
  2. Routeer die workload via de AI-tier. Gebruik de nieuwe configuratie om het tokenverbruik per gebruiker vast te leggen.
  3. Verzamel enkele weken lang gegevens over token-uitgaven. Vergelijk het aantal tokens en de bijbehorende kosten met je huidige monitoring.
  4. Gebruik de baseline voor budgettering. Beslis of de voordelen van de kostenbeheersing van de tier opwegen tegen de beperkingen van de preview-fase.

Verplaats geen bedrijfskritische productieworkloads naar de preview-service totdat deze beschikbaar is in de general availability.

Tegenargument: niet iedereen heeft een aparte tier nodig

Als je organisatie slechts incidenteel aanroepen doet naar een LLM, is de extra kost van de AI-tier mogelijk niet gerechtvaardigd. Je kunt governance op tokenniveau bereiken met het bestaande policy-framework, zij het met meer handmatige inspanning. De tier is vooral effectief wanneer AI-verkeer een substantieel en groeiend deel van je API-oppervlak vormt.

Conclusie

De AI Gateway-tier erkent dat LLM-verkeer fundamenteel anders werkt dan traditionele API-aanroepen. Door de focus te verleggen van het tellen van aanvragen naar token-gebaseerde governance, biedt het ontwikkelaars een praktische manier om AI-uitgaven onder controle te houden zonder te verdrinken in aangepaste code. Voor teams waarvan het AI-gebruik al aanzienlijk is — of naar verwachting zal groeien — kan het nu testen van de preview helpen bij het opbouwen van een baseline voor token-uitgaven.