مایکروسافت یک سطح اختصاصی AI Gateway را به Azure API Management (APIM) اضافه کرده است. این اقدام نشان می‌دهد که فراخوانی‌های LLM اکنون به عنوان یک بار کاری (workload) مجزا در نظر گرفته می‌شوند، نه صرفاً یک نقطه پایانی (endpoint) دیگر برای API.

چرا ترافیک LLM درگاه‌های (gateways) کلاسیک را مختل می‌کند

یک پرامپت (prompt) واحد می‌تواند صد برابر بیشتر از پرامپت دیگر هزینه داشته باشد، با این حال یک API gateway استاندارد، هر دو را به عنوان یک درخواست واحد می‌بیند. درگاه، تعداد فراخوانی‌ها را می‌شمارد، نه تعداد توکن‌هایی را که مدل پردازش می‌کند. درخواستی که چند صد توکن ارسال می‌کند و درخواستی که چندین هزار توکن ارسال می‌کند، معیارهای تعداد درخواست یکسانی تولید می‌کنند، در حالی که دومی می‌تواند چندین برابر بیشتر هزینه داشته باشد.

چهار واقعیت باعث می‌شود محدودیت‌های مبتنی بر درخواست برای هوش مصنوعی بی‌فایده باشند:

  • هزینه ≠ تعداد درخواست. صورت‌حساب به توکن‌ها وابسته است، نه به تعداد فراخوانی‌های HTTP که انجام می‌دهید.
  • حجم توکن‌ها بسیار متغیر است. یک پرس‌وجو ممکن است یک سوال کوتاه باشد؛ دیگری ممکن است شامل یک سند طولانی باشد.
  • انتخاب مدل، قیمت را تغییر می‌دهد. LLMهای مختلف نرخ‌های متفاوتی را برای هر توکن دریافت می‌کنند.
  • استریمینگ (Streaming) صورت‌حساب نهایی را پنهان می‌کند. وقتی پاسخ‌ها به صورت استریم ارسال می‌شوند، تا زمانی که استریم تمام نشود، تعداد کل توکن‌ها مشخص نیست.

اگر فقط به اندازه‌گیری درخواست‌ها ادامه دهید، در نهایت با داده‌های نظارتی (monitoring) مواجه می‌شوید که هیچ اطلاعاتی درباره هزینه‌های واقعی به شما نمی‌دهد.

آنچه سطح AI Gateway تغییر می‌دهد

بیشتر سیاست‌های (policies) مورد نیاز برای کنترل استفاده از توکن، از قبل در سطوح استاندارد APIM وجود دارند—که به صورت قوانین XML نوشته شده و در داشبوردهای سفارشی نمایش داده می‌شوند. سطح AI همان قابلیت‌ها را در یک تجربه اختصاصی و هدفمند تجمیع می‌کند:

  • جداسازی مقیاس‌پذیری (scaling) برای ترافیک هوش مصنوعی.
  • پیکربندی ساده‌شده که نیاز به نوشتن دستی سیاست‌های XML را از بین می‌برد.

تغییر اصلی، عملیاتی است: دیگر نیازی نیست برای اعمال بودجه‌های توکن، کدهای پیچیده بنویسید یا داشبوردهای جداگانه را مدیریت کنید. این سطح، یک رابط کاربری آماده برای آن کنترل‌ها فراهم می‌کند.

چه زمانی تغییر وضعیت دهیم – راهنمایی بر اساس نوع ترافیک

  • هوش مصنوعی بخش کوچکی از ترافیک شماست. به استفاده از سطح APIM فعلی خود ادامه دهید و اگر به کنترل دقیق نیاز دارید، سیاست‌های توکن را اضافه کنید.
  • هوش مصنوعی بخش عمده فراخوانی‌های شما را تشکیل می‌دهد. برای جداسازی مقیاس‌پذیری و حفظ نظم در مدیریت هزینه‌ها، به سطح AI مهاجرت کنید.
  • می‌خواهید از هزینه‌های اضافی مهندسی جلوگیری کنید. ابزارهای داخلی این سطح، زمان صرف‌شده برای ساخت و نگهداری سیاست‌های سفارشی را حذف می‌کند.

بزرگترین هزینه، قیمت اشتراک نیست؛ بلکه ساعت‌های مهندسی است که صرف رفع نواقص در یک درگاه عمومی می‌شود تا بتواند اقتصاد توکن را درک کند.

دستورالعمل مرحله پیش‌نمایش (Preview)

مایکروسافت هنوز سطح AI را در مرحله پیش‌نمایش ارائه می‌دهد. با آن مانند یک محیط آزمایشگاهی برخورد کنید، نه یک عرضه برای محیط عملیاتی (production).

  1. یک بار کاری هوش مصنوعی داخلی با حجم بالا را انتخاب کنید. سرویسی را انتخاب کنید که بیشترین ترافیک توکن را تولید می‌کند.
  2. آن بار کاری را از طریق سطح AI هدایت کنید. از پیکربندی جدید برای ثبت میزان استفاده از توکن به ازای هر مصرف‌کننده استفاده کنید.
  3. داده‌های مربوط به هزینه توکن را برای چند هفته جمع‌آوری کنید. تعداد توکن‌ها و هزینه‌های مرتبط را با نظارت‌های فعلی خود مقایسه کنید.
  4. از داده‌های پایه برای بودجه‌بندی استفاده کنید. تصمیم بگیرید که آیا مزایای کنترل هزینه این سطح بر محدودیت‌های مرحله پیش‌نمایش آن می‌چربد یا خیر.

تا زمانی که این سرویس به مرحله دسترسی عمومی (general availability) نرسیده است، بار کاری‌های حیاتی و عملیاتی خود را به سرویس پیش‌نمایش منتقل نکنید.

نکته متقابل: همه به یک سطح مجزا نیاز ندارند

اگر سازمان شما فقط فراخوانی‌های گاه‌وبیگاه به یک LLM انجام می‌دهد، هزینه اضافی سطح AI ممکن است توجیه‌پذیر نباشد. شما می‌توانید با چارچوب سیاست‌های موجود، کنترل در سطح توکن را (هرچند با تلاش دستی بیشتر) انجام دهید. این سطح زمانی می‌درخشد که ترافیک هوش مصنوعی بخش قابل توجه و رو به رشدی از سطح API شما باشد.

جمع‌بندی

سطح AI Gateway اذعان می‌کند که رفتار ترافیک LLM اساساً با فراخوانی‌های سنتی API متفاوت است. با تغییر رویکرد از شمارش درخواست به مدیریت مبتنی بر توکن، این سطح راهکاری عملی در اختیار توسعه‌دهندگان قرار می‌دهد تا هزینه‌های هوش مصنوعی را بدون غرق شدن در کدهای سفارشی کنترل کنند. برای تیم‌هایی که استفاده آن‌ها از هوش مصنوعی در حال حاضر قابل توجه است یا انتظار می‌رود رشد کند، آزمایش نسخه پیش‌نمایش در حال حاضر می‌تواند به ایجاد یک خط پایه برای هزینه‌های توکن کمک کند.