Microsoft добавила выделенный уровень AI Gateway в Azure API Management (APIM). Этот шаг сигнализирует о том, что вызовы LLM теперь рассматриваются как отдельная рабочая нагрузка, а не просто очередной API-эндпоинт.

Почему трафик LLM «ломает» классические шлюзы

Один промпт может стоить в сто раз дороже другого, однако стандартный API-шлюз воспринимает оба как один запрос. Шлюз подсчитывает количество вызовов, а не количество токенов, которые обрабатывает модель. Запрос, отправляющий несколько сотен токенов, и запрос, отправляющий многие тысячи токенов, генерируют идентичные метрики количества запросов, хотя второй может стоить на порядки больше.

Четыре факта делают ограничения на основе количества запросов бесполезными для ИИ:

  • Стоимость ≠ количество запросов. Биллинг привязан к токенам, а не к количеству сделанных вами HTTP-вызовов.
  • Объем токенов сильно варьируется. Один запрос может быть коротким вопросом, а другой — включать в себя длинный документ.
  • Выбор модели меняет цену. Разные LLM взимают разную плату за токен.
  • Стриминг скрывает итоговый счет. При потоковой передаче ответов (streaming) общее количество токенов становится известно только после завершения потока.

Если вы продолжите измерять только запросы, вы получите данные мониторинга, которые ничего не говорят о реальных расходах.

Что меняет уровень AI Gateway

Большинство политик, необходимых для контроля использования токенов, уже существуют в стандартных уровнях APIM — они прописаны в виде XML-правил и отображаются на пользовательских дашбордах. Уровень AI объединяет эти возможности в специализированное решение:

  • Изоляция масштабирования для ИИ-трафика.
  • Упрощенная конфигурация, избавляющая от необходимости вручную создавать XML-политики.

Основной сдвиг носит операционный характер: вам больше не нужно писать сложный код или поддерживать отдельные дашборды для соблюдения лимитов токенов. Этот уровень предоставляет готовый интерфейс для управления этими параметрами.

Когда переходить — руководство на основе трафика

  • ИИ составляет незначительную часть вашего трафика. Продолжайте использовать текущий уровень APIM и добавьте политики токенов, если вам нужен детальный контроль.
  • ИИ доминирует в ваших вызовах. Переходите на уровень AI, чтобы изолировать масштабирование и обеспечить прозрачное управление затратами.
  • Вы хотите избежать избыточных инженерных затрат. Встроенные инструменты уровня избавляют от необходимости тратить время на создание и поддержку пользовательских политик.

Самая большая статья расходов — это не стоимость подписки, а инженерные часы, затраченные на «латание дыр» в универсальном шлюзе, чтобы заставить его учитывать экономику токенов.

План действий на этапе предварительного просмотра (Preview)

Microsoft все еще предлагает уровень AI в режиме Preview. Относитесь к нему как к испытательному стенду, а не как к готовому к эксплуатации решению.

  1. Выберите внутреннюю ИИ-нагрузку с большим объемом данных. Выберите сервис, который генерирует больше всего токенов.
  2. Направьте эту нагрузку через уровень AI. Используйте новую конфигурацию, чтобы отслеживать потребление токенов каждым потребителем.
  3. Собирайте данные о расходах на токены в течение нескольких недель. Сравните количество токенов и связанные с ними затраты с вашим текущим мониторингом.
  4. Используйте полученные базовые показатели для планирования бюджета. Решите, перевешивают ли преимущества контроля затрат на этом уровне ограничения этапа Preview.

Не переносите критически важные рабочие нагрузки в сервис Preview, пока он не перейдет в стадию общей доступности (General Availability).

Контраргумент: не всем нужен отдельный уровень

Если ваша организация делает лишь эпизодические вызовы к LLM, дополнительные затраты на уровень AI могут быть неоправданными. Вы можете добиться управления на уровне токенов с помощью существующей системы политик, хотя это потребует больше ручной работы. Этот уровень раскрывает свой потенциал, когда ИИ-трафик становится существенной и растущей частью вашего API.

Итог

Уровень AI Gateway признает, что трафик LLM принципиально отличается от традиционных вызовов API. Переходя от подсчета запросов к управлению на основе токенов, он дает разработчикам практический способ контролировать расходы на ИИ, не утопая в написании кастомного кода. Для команд, чье использование ИИ уже значительно или планирует расти, тестирование Preview сейчас поможет сформировать базовые показатели расходов на токены.