Microsoft ha aggiunto un AI Gateway tier dedicato ad Azure API Management (APIM). Questa mossa segnala che le chiamate LLM sono ora trattate come un carico di lavoro separato, e non solo come un altro endpoint API.

Perché il traffico LLM mette in crisi i gateway classici

Un singolo prompt può costare cento volte più di un altro, eppure un gateway API standard vede entrambi come una singola richiesta. Il gateway conta le chiamate, non il numero di token elaborati dal modello. Una richiesta che invia poche centinaia di token e una che ne invia molte migliaia generano metriche di conteggio delle richieste identiche, anche se la seconda può costare ordini di grandezza in più.

Quattro fatti rendono inutili i limiti basati sulle richieste per l'IA:

  • Il costo ≠ il numero di richieste. La fatturazione è legata ai token, non al numero di chiamate HTTP effettuate.
  • Il volume di token varia enormemente. Una query può essere una domanda breve; un'altra può includere un documento lungo.
  • La scelta del modello cambia il prezzo. Diversi LLM applicano tariffe diverse per token.
  • Lo streaming nasconde il costo finale. Quando le risposte vengono trasmesse in streaming, il conteggio totale dei token non è noto finché lo streaming non termina.

Se continui a misurare solo le richieste, otterrai dati di monitoraggio che non dicono nulla sulla spesa effettiva.

Cosa cambia con l'AI Gateway tier

La maggior parte delle policy necessarie per controllare l'utilizzo dei token esiste già nei tier standard di APIM, scritte come regole XML e visualizzate su dashboard personalizzate. L'AI tier raggruppa queste stesse funzionalità in un'esperienza progettata appositamente:

  • Isolamento dello scaling per il traffico AI.
  • Configurazione semplificata che elimina la necessità di creare manualmente policy XML.

Il cambiamento fondamentale è operativo: non è più necessario scrivere codice complesso o mantenere dashboard separate per applicare i budget dei token. Il tier fornisce un'interfaccia pronta all'uso per tali controlli.

Quando passare – una guida basata sul traffico

  • L'IA è una parte minoritaria del tuo traffico. Continua a utilizzare il tuo attuale tier APIM e aggiungi policy per i token se hai bisogno di un controllo granulare.
  • L'IA domina le tue chiamate. Passa all'AI tier per isolare lo scaling e mantenere una governance dei costi pulita.
  • Vuoi evitare sovraccarichi ingegneristici. Gli strumenti integrati del tier eliminano il tempo speso a costruire e mantenere policy personalizzate.

La spesa maggiore non è il prezzo dell'abbonamento; sono le ore di ingegneria spese a colmare le lacune di un gateway generico per renderlo capace di gestire l'economia dei token.

Playbook per la fase di preview

Microsoft offre ancora l'AI tier in versione preview. Trattalo come un ambiente di test, non come un rilascio in produzione.

  1. Seleziona un carico di lavoro AI interno ad alto volume. Scegli il servizio che genera il maggior traffico di token.
  2. Instrada quel carico di lavoro attraverso l'AI tier. Usa la nuova configurazione per catturare l'utilizzo dei token per ogni consumatore.
  3. Raccogli i dati sulla spesa dei token per alcune settimane. Confronta il conteggio dei token e i costi associati con il tuo monitoraggio attuale.
  4. Usa la linea di base per pianificare il budget. Decidi se i vantaggi del controllo dei costi del tier superano i suoi limiti della fase di preview.

Non spostare carichi di lavoro di produzione mission-critical sul servizio in preview finché non raggiungerà la disponibilità generale (general availability).

Punto di vista opposto: non tutti hanno bisogno di un tier separato

Se la tua organizzazione effettua solo chiamate occasionali a un LLM, il costo extra dell'AI tier potrebbe non essere giustificato. È possibile ottenere una governance a livello di token con l'attuale framework di policy, sebbene con un maggiore sforzo manuale. Il tier dà il meglio di sé quando il traffico AI è una parte sostanziale e in crescita della tua superficie API.

In sintesi

L'AI Gateway tier riconosce che il traffico LLM si comporta in modo fondamentalmente diverso rispetto alle chiamate API tradizionali. Passando dal conteggio delle richieste alla governance basata sui token, offre agli sviluppatori un modo pratico per tenere sotto controllo la spesa per l'IA senza affogare nel codice personalizzato. Per i team il cui utilizzo dell'IA è già consistente — o destinato a crescere — testare la preview ora può aiutare a stabilire una linea di base della spesa per i token.