مایکروسافت یک سطح اختصاصی AI Gateway را به Azure API Management (APIM) اضافه کرده است. این اقدام نشان میدهد که فراخوانیهای LLM اکنون به عنوان یک بار کاری (workload) مجزا در نظر گرفته میشوند، نه صرفاً یک نقطه پایانی (endpoint) دیگر برای API.
چرا ترافیک LLM درگاههای (gateways) کلاسیک را مختل میکند
یک پرامپت (prompt) واحد میتواند صد برابر بیشتر از پرامپت دیگر هزینه داشته باشد، با این حال یک API gateway استاندارد، هر دو را به عنوان یک درخواست واحد میبیند. درگاه، تعداد فراخوانیها را میشمارد، نه تعداد توکنهایی را که مدل پردازش میکند. درخواستی که چند صد توکن ارسال میکند و درخواستی که چندین هزار توکن ارسال میکند، معیارهای تعداد درخواست یکسانی تولید میکنند، در حالی که دومی میتواند چندین برابر بیشتر هزینه داشته باشد.
چهار واقعیت باعث میشود محدودیتهای مبتنی بر درخواست برای هوش مصنوعی بیفایده باشند:
- هزینه ≠ تعداد درخواست. صورتحساب به توکنها وابسته است، نه به تعداد فراخوانیهای HTTP که انجام میدهید.
- حجم توکنها بسیار متغیر است. یک پرسوجو ممکن است یک سوال کوتاه باشد؛ دیگری ممکن است شامل یک سند طولانی باشد.
- انتخاب مدل، قیمت را تغییر میدهد. LLMهای مختلف نرخهای متفاوتی را برای هر توکن دریافت میکنند.
- استریمینگ (Streaming) صورتحساب نهایی را پنهان میکند. وقتی پاسخها به صورت استریم ارسال میشوند، تا زمانی که استریم تمام نشود، تعداد کل توکنها مشخص نیست.
اگر فقط به اندازهگیری درخواستها ادامه دهید، در نهایت با دادههای نظارتی (monitoring) مواجه میشوید که هیچ اطلاعاتی درباره هزینههای واقعی به شما نمیدهد.
آنچه سطح AI Gateway تغییر میدهد
بیشتر سیاستهای (policies) مورد نیاز برای کنترل استفاده از توکن، از قبل در سطوح استاندارد APIM وجود دارند—که به صورت قوانین XML نوشته شده و در داشبوردهای سفارشی نمایش داده میشوند. سطح AI همان قابلیتها را در یک تجربه اختصاصی و هدفمند تجمیع میکند:
- جداسازی مقیاسپذیری (scaling) برای ترافیک هوش مصنوعی.
- پیکربندی سادهشده که نیاز به نوشتن دستی سیاستهای XML را از بین میبرد.
تغییر اصلی، عملیاتی است: دیگر نیازی نیست برای اعمال بودجههای توکن، کدهای پیچیده بنویسید یا داشبوردهای جداگانه را مدیریت کنید. این سطح، یک رابط کاربری آماده برای آن کنترلها فراهم میکند.
چه زمانی تغییر وضعیت دهیم – راهنمایی بر اساس نوع ترافیک
- هوش مصنوعی بخش کوچکی از ترافیک شماست. به استفاده از سطح APIM فعلی خود ادامه دهید و اگر به کنترل دقیق نیاز دارید، سیاستهای توکن را اضافه کنید.
- هوش مصنوعی بخش عمده فراخوانیهای شما را تشکیل میدهد. برای جداسازی مقیاسپذیری و حفظ نظم در مدیریت هزینهها، به سطح AI مهاجرت کنید.
- میخواهید از هزینههای اضافی مهندسی جلوگیری کنید. ابزارهای داخلی این سطح، زمان صرفشده برای ساخت و نگهداری سیاستهای سفارشی را حذف میکند.
بزرگترین هزینه، قیمت اشتراک نیست؛ بلکه ساعتهای مهندسی است که صرف رفع نواقص در یک درگاه عمومی میشود تا بتواند اقتصاد توکن را درک کند.
دستورالعمل مرحله پیشنمایش (Preview)
مایکروسافت هنوز سطح AI را در مرحله پیشنمایش ارائه میدهد. با آن مانند یک محیط آزمایشگاهی برخورد کنید، نه یک عرضه برای محیط عملیاتی (production).
- یک بار کاری هوش مصنوعی داخلی با حجم بالا را انتخاب کنید. سرویسی را انتخاب کنید که بیشترین ترافیک توکن را تولید میکند.
- آن بار کاری را از طریق سطح AI هدایت کنید. از پیکربندی جدید برای ثبت میزان استفاده از توکن به ازای هر مصرفکننده استفاده کنید.
- دادههای مربوط به هزینه توکن را برای چند هفته جمعآوری کنید. تعداد توکنها و هزینههای مرتبط را با نظارتهای فعلی خود مقایسه کنید.
- از دادههای پایه برای بودجهبندی استفاده کنید. تصمیم بگیرید که آیا مزایای کنترل هزینه این سطح بر محدودیتهای مرحله پیشنمایش آن میچربد یا خیر.
تا زمانی که این سرویس به مرحله دسترسی عمومی (general availability) نرسیده است، بار کاریهای حیاتی و عملیاتی خود را به سرویس پیشنمایش منتقل نکنید.
نکته متقابل: همه به یک سطح مجزا نیاز ندارند
اگر سازمان شما فقط فراخوانیهای گاهوبیگاه به یک LLM انجام میدهد، هزینه اضافی سطح AI ممکن است توجیهپذیر نباشد. شما میتوانید با چارچوب سیاستهای موجود، کنترل در سطح توکن را (هرچند با تلاش دستی بیشتر) انجام دهید. این سطح زمانی میدرخشد که ترافیک هوش مصنوعی بخش قابل توجه و رو به رشدی از سطح API شما باشد.
جمعبندی
سطح AI Gateway اذعان میکند که رفتار ترافیک LLM اساساً با فراخوانیهای سنتی API متفاوت است. با تغییر رویکرد از شمارش درخواست به مدیریت مبتنی بر توکن، این سطح راهکاری عملی در اختیار توسعهدهندگان قرار میدهد تا هزینههای هوش مصنوعی را بدون غرق شدن در کدهای سفارشی کنترل کنند. برای تیمهایی که استفاده آنها از هوش مصنوعی در حال حاضر قابل توجه است یا انتظار میرود رشد کند، آزمایش نسخه پیشنمایش در حال حاضر میتواند به ایجاد یک خط پایه برای هزینههای توکن کمک کند.
