Microsoft додала спеціальний рівень AI Gateway до Azure API Management (APIM). Цей крок свідчить про те, що виклики LLM тепер розглядаються як окреме робоче навантаження, а не просто чергова кінцева точка API.

Чому трафік LLM порушує роботу класичних шлюзів

Один промпт може коштувати в сто разів більше за інший, проте стандартний API-шлюз сприймає обидва як один запит. Шлюз підраховує кількість викликів, а не кількість токенів, які обробляє модель. Запит, що надсилає кілька сотень токенів, і запит, що надсилає багато тисяч токенів, створюють ідентичні метрики кількості запитів, хоча останній може коштувати на порядки більше.

Чотири факти роблять обмеження на основі кількості запитів марними для ШІ:

  • Вартість ≠ кількість запитів. Тарифікація прив'язана до токенів, а не до кількості HTTP-викликів.
  • Обсяг токенів сильно варіюється. Один запит може бути коротким питанням, інший — містити довгий документ.
  • Вибір моделі змінює ціну. Різні LLM мають різні тарифи за токен.
  • Стрімінг приховує фінальний рахунок. Коли відповіді передаються потоком (streaming), загальна кількість токенів стає відомою лише після завершення потоку.

Якщо ви продовжуватимете вимірювати лише запити, ви отримаєте дані моніторингу, які нічого не говорять про фактичні витрати.

Що змінює рівень AI Gateway

Більшість політик, необхідних для контролю використання токенів, уже існують у стандартних рівнях APIM — вони прописані у вигляді XML-правил і відображаються на спеціальних панелях керування. Рівень AI об'єднує ці ж можливості в спеціально розроблений інтерфейс:

  • Ізоляція масштабування для ШІ-трафіку.
  • Спрощена конфігурація, яка усуває потребу в ручному написанні XML-політик.

Основна зміна є операційною: вам більше не потрібно писати складний код або підтримувати окремі панелі керування для дотримання бюджетів токенів. Цей рівень надає готовий інтерфейс для такого контролю.

Коли переходити — посібник на основі трафіку

  • ШІ становить незначну частину вашого трафіку. Продовжуйте використовувати свій поточний рівень APIM і додавайте політики токенів, якщо вам потрібен детальний контроль.
  • ШІ домінує у ваших викликах. Переходьте на рівень AI, щоб ізолювати масштабування та забезпечити прозоре управління витратами.
  • Ви хочете уникнути зайвих інженерних витрат. Вбудовані інструменти рівня усувають витрати часу на створення та підтримку власних політик.

Найбільші витрати — це не ціна підписки, а інженерні години, витрачені на усунення прогалин у загальному шлюзі, щоб змусити його розуміти економіку токенів.

План дій на етапі попереднього перегляду (Preview)

Microsoft все ще пропонує рівень AI у режимі preview. Ставтеся до нього як до тестового майданчика, а не як до готового до запуску продукту.

  1. Виберіть внутрішнє ШІ-навантаження з великим обсягом. Оберіть сервіс, який генерує найбільший трафік токенів.
  2. Спрямуйте це навантаження через рівень AI. Використовуйте нову конфігурацію, щоб відстежувати використання токенів кожним споживачем.
  3. Збирайте дані про витрати токенів протягом кількох тижнів. Порівняйте кількість токенів і відповідні витрати з вашим поточним моніторингом.
  4. Використовуйте отримані базові показники для планування бюджету. Вирішіть, чи переваги контролю витрат на цьому рівні переважають його обмеження на етапі preview.

Не переносити критично важливі робочі навантаження на сервіс у режимі preview, доки він не перейде у стадію загальної доступності (general availability).

Контраргумент: не всім потрібен окремий рівень

Якщо ваша організація робить лише епізодичні виклики LLM, додаткова вартість рівня AI може бути невиправданою. Ви можете забезпечити контроль на рівні токенів за допомогою існуючої структури політик, хоча це потребуватиме більше ручної роботи. Цей рівень стає незамінним, коли ШІ-трафік становить суттєву частину вашої API-поверхні, що постійно зростає.

Підсумок

Рівень AI Gateway визнає, що трафік LLM поводиться принципово інакше, ніж традиційні виклики API. Переходячи від підрахунку запитів до управління на основі токенів, він надає розробникам практичний спосіб контролювати витрати на ШІ, не загрузаючи в написанні власного коду. Для команд, чиє використання ШІ вже є значним — або має тенденцію до зростання — тестування preview зараз допоможе сформувати базовий рівень витрат на токени.