Microsoft ha añadido un nivel de AI Gateway dedicado a Azure API Management (APIM). Este movimiento indica que las llamadas a LLM ahora se tratan como una carga de trabajo separada, no solo como un endpoint de API más.
Por qué el tráfico de LLM rompe los gateways clásicos
Un solo prompt puede costar cien veces más que otro; sin embargo, un gateway de API estándar ve ambos como una única solicitud. El gateway cuenta las llamadas, no el número de tokens que procesa el modelo. Una solicitud que envía unos pocos cientos de tokens y otra que envía muchos miles de tokens generan métricas de recuento de solicitudes idénticas, aunque esta última pueda costar órdenes de magnitud más.
Cuatro hechos hacen que los límites basados en solicitudes sean inútiles para la IA:
- El coste ≠ recuento de solicitudes. La facturación está ligada a los tokens, no a cuántas llamadas HTTP realices.
- El volumen de tokens varía enormemente. Una consulta puede ser una pregunta corta; otra puede incluir un documento largo.
- La elección del modelo cambia el precio. Diferentes LLM cobran distintas tarifas por token.
- El streaming oculta la factura final. Cuando las respuestas se transmiten por streaming, el recuento total de tokens no se conoce hasta que termina la transmisión.
Si sigues midiendo solo las solicitudes, terminarás con datos de monitorización que no te dicen nada sobre el gasto real.
Qué cambia el nivel de AI Gateway
La mayoría de las políticas necesarias para controlar el uso de tokens ya existen en los niveles estándar de APIM, escritas como reglas XML y mostradas en paneles de control personalizados. El nivel de IA agrupa esas mismas capacidades en una experiencia diseñada específicamente para ello:
- Aislamiento del escalado para el tráfico de IA.
- Configuración simplificada que elimina la necesidad de crear políticas XML manualmente.
El cambio principal es operativo: ya no tienes que escribir código complejo ni mantener paneles de control separados para aplicar presupuestos de tokens. El nivel proporciona una interfaz ya preparada para esos controles.
Cuándo cambiar: una guía basada en el tráfico
- La IA es una parte mínima de su tráfico. Siga utilizando su nivel de APIM actual y añada políticas de tokens si necesita un control detallado.
- La IA domina sus llamadas. Cambie al nivel de IA para aislar el escalado y mantener una gobernanza de costes limpia.
- Quiere evitar la sobrecarga de ingeniería. Las herramientas integradas del nivel eliminan el tiempo dedicado a crear y mantener políticas personalizadas.
El mayor gasto no es el precio de la suscripción; son las horas de ingeniería dedicadas a parchear las carencias de un gateway genérico para que entienda la economía de los tokens.
Plan de acción para la fase de vista previa (Preview)
Microsoft todavía ofrece el nivel de IA en fase de vista previa (preview). Trátelo como un banco de pruebas, no como un lanzamiento de producción.
- Seleccione una carga de trabajo de IA interna de alto volumen. Elija el servicio que genere el mayor tráfico de tokens.
- Enrute esa carga de trabajo a través del nivel de IA. Utilice la nueva configuración para capturar el uso de tokens por consumidor.
- Recopile datos de gasto de tokens durante unas semanas. Compare el recuento de tokens y los costes asociados con su monitorización actual.
- Utilice la línea base para informar al presupuesto. Decida si los beneficios de control de costes del nivel compensan sus limitaciones en la fase de vista previa.
No traslade cargas de trabajo de producción de misión crítica al servicio en vista previa hasta que pase a estar disponible de forma general (general availability).
Punto de vista contrario: no todo el mundo necesita un nivel separado
Si su organización solo realiza llamadas ocasionales a un LLM, es posible que el coste adicional del nivel de IA no esté justificado. Puede lograr una gobernanza a nivel de tokens con el marco de políticas existente, aunque con un mayor esfuerzo manual. El nivel destaca cuando el tráfico de IA es una parte sustancial y creciente de su superficie de API.
Conclusión
El nivel de AI Gateway reconoce que el tráfico de LLM se comporta de manera fundamentalmente diferente al de las llamadas de API tradicionales. Al pasar del recuento de solicitudes a una gobernanza basada en tokens, ofrece a los desarrolladores una forma práctica de mantener bajo control el gasto en IA sin ahogarse en código personalizado. Para los equipos cuyo uso de IA ya es considerable —o que se espera que crezca—, probar la vista previa ahora puede ayudar a establecer una línea base de gasto de tokens.
