A Microsoft adicionou um nível de AI Gateway dedicado ao Azure API Management (APIM). O movimento sinaliza que as chamadas de LLM agora são tratadas como uma carga de trabalho separada, e não apenas mais um endpoint de API.
Por que o tráfego de LLM quebra os gateways clássicos
Um único prompt pode custar cem vezes mais do que outro, mas um gateway de API padrão vê ambos como uma única requisição. O gateway conta chamadas, não o número de tokens que o modelo processa. Uma requisição que envia algumas centenas de tokens e outra que envia muitos milhares de tokens geram métricas de contagem de requisições idênticas, embora esta última possa custar ordens de magnitude a mais.
Quatro fatos tornam os limites baseados em requisições inúteis para IA:
- Custo ≠ contagem de requisições. O faturamento está atrelado aos tokens, não ao número de chamadas HTTP que você faz.
- O volume de tokens varia drasticamente. Uma consulta pode ser uma pergunta curta; outra pode incluir um documento longo.
- A escolha do modelo altera o preço. Diferentes LLMs cobram taxas diferentes por token.
- O streaming esconde a fatura final. Quando as respostas são transmitidas via streaming, a contagem total de tokens não é conhecida até que o stream termine.
Se você continuar medindo apenas as requisições, acabará com dados de monitoramento que não dizem nada sobre o gasto real.
O que o nível de AI Gateway muda
A maioria das políticas necessárias para controlar o uso de tokens já existe nos níveis padrão do APIM — escritas como regras XML e exibidas em dashboards personalizados. O nível de AI agrupa essas mesmas capacidades em uma experiência desenvolvida especificamente para esse fim:
- Isolamento de escalonamento para o tráfego de IA.
- Configuração simplificada que elimina a necessidade de políticas XML criadas manualmente.
A mudança principal é operacional: você não precisa mais escrever códigos complexos ou manter dashboards separados para aplicar orçamentos de tokens. O nível fornece uma interface pronta para esses controles.
Quando mudar – um guia baseado em tráfego
- A IA é uma parte pequena do seu tráfego. Continue usando seu nível de APIM existente e adicione políticas de tokens se precisar de um controle granular.
- A IA domina suas chamadas. Mude para o nível de AI para isolar o escalonamento e manter a governança de custos organizada.
- Você quer evitar sobrecarga de engenharia. As ferramentas integradas do nível eliminam o tempo gasto construindo e mantendo políticas personalizadas.
A maior despesa não é o preço da assinatura; são as horas de engenharia gastas corrigindo lacunas em um gateway genérico para fazê-lo entender a economia de tokens.
Guia para a fase de preview
A Microsoft ainda está oferecendo o nível de AI em preview. Trate-o como um ambiente de testes, não como um lançamento de produção.
- Selecione uma carga de trabalho de IA interna de alto volume. Escolha o serviço que gera o maior tráfego de tokens.
- Roteie essa carga de trabalho através do nível de AI. Use a nova configuração para capturar o uso de tokens por consumidor.
- Colete dados de gastos com tokens por algumas semanas. Compare as contagens de tokens e os custos associados com seu monitoramento existente.
- Use a linha de base para informar o orçamento. Decida se os benefícios de controle de custos do nível superam suas limitações na fase de preview.
Não mova cargas de trabalho de produção de missão crítica para o serviço de preview até que ele passe para a disponibilidade geral (GA).
Contraponto: nem todos precisam de um nível separado
Se a sua organização faz apenas chamadas ocasionais a um LLM, o custo extra do nível de AI pode não ser justificado. Você pode alcançar a governança em nível de token com a estrutura de políticas existente, embora com mais esforço manual. O nível se destaca quando o tráfego de IA é uma parte substancial e crescente da sua superfície de API.
Conclusão
O nível de AI Gateway reconhece que o tráfego de LLM se comporta de forma fundamentalmente diferente das chamadas de API tradicionais. Ao mudar da contagem de requisições para a governança baseada em tokens, ele oferece aos desenvolvedores uma maneira prática de manter os gastos com IA sob controle sem se afogar em código personalizado. Para equipes cujo uso de IA já é considerável — ou que se espera que cresça — testar o preview agora pode ajudar a construir uma linha de base de gastos com tokens.
