قیمتگذاری LLM مدام در حال تغییر است. یک ماه بودجه استنتاج (inference) شما دقیقاً طبق پیشبینی عمل میکند؛ ماه بعد، یکی از ارائهدهندگان نرخ هر توکن را تغییر میدهد و هزینه ماهانه شما بدون اینکه حتی یک درخواست اضافی ارسال شود، جابهجا میشود. این دقیقاً همان اتفاقی است که رخ داده است. GMICloud، Novita و StreamLake همگی قیمت مدلهای خود را بهروزرسانی کردهاند و اگر بارهای کاری عملیاتی (production workloads) یا حتی خطلولههای آزمایشی را اجرا میکنید، این بازنگریها نیاز به بررسی دقیق دارند. نه به این دلیل که بازار در حال فروپاشی است، بلکه به این دلیل که تفاوتهای کوچک در اقتصاد توکنها، زمانی که روزانه میلیونها توکن پردازش میکنید، به شکلی بیرحمانه اثر مرکب ایجاد میکنند.
این ارائهدهندگان چه کسانی هستند
GMICloud، Novita و StreamLake هر کدام نقش متمایزی در پشته زیرساخت هوش مصنوعی ایفا میکنند، اما اکنون در زمینه هزینه اجرای مدلهای زبانی بزرگ (LLM) مستقیماً با هم همپوشانی دارند.
GMICloud یک ابر GPU با کارایی بالا را مدیریت میکند و کاتالوگ رو به رشدی از LLMهای میزبانیشده را برای توسعهدهندگانی که میخواهند بدون مدیریت کلاسترهای خود به API دسترسی داشته باشند، ارائه میدهد. Novita شهرت خود را بر پایه اجاره ارزانقیمت GPU و سرویسدهی مدلها بنا کرده است و مهندسانی را جذب میکند که مدلهای با وزن باز (open-weight) را با قیمتی کمتر از نرخهای بالای هایپرسکیلرهای بزرگتر ترجیح میدهند. StreamLake که از اکوسیستم ابری و رسانهای ByteDance نشأت گرفته است، تخصص زیرساخت ویدئویی را به رقابت استنتاج (inference) میآورد و مدلها را از طریق پلتفرمی ارائه میدهد که بارهای کاری سنگین پردازش رسانه را نیز مدیریت میکند.
هیچکدام از آنها مانند OpenAI یا Anthropic نامهای شناختهشدهای در سطح جهانی نیستند. دقیقاً به همین دلیل است که تغییرات قیمتگذاری آنها اهمیت دارد. آنها در لایه میانی و تهاجمی بازار قرار دارند؛ جایی که حاشیه سود کم است، تخفیفها رایج هستند و رقابت برای جذب توسعهدهندگان همیشگی است. وقتی سه پلتفرم در این سطح، تقریباً در یک زمان لیست قیمتهای خود را تغییر میدهند، در مجموع معیار جدیدی برای هزینه اجرای مدلهای متنباز یا مدلهای Fine-tuned تعیین میکنند.
چه چیزی تغییر کرد
این بهروزرسانیها قیمت استفاده از LLM را در هر سه سرویس تحت تأثیر قرار داده است. Naren که با نام narevbot در Dev.to مینویسد، جزئیات این تغییرات را در پستی مستند کرده است که تنظیمات دقیق مدل به مدل را برای GMICloud، Novita و StreamLake شرح میدهد. میتوانید مقایسه کامل را در اینجا بخوانید.
به جای بازگو کردن ارقام مربوط به قیمت هر توکن که ممکن است قبل از تمام شدن این پاراگراف دوباره تغییر کنند، نکته حیاتی این است که این تغییرات ساختاری هستند. هر ارائهدهنده نحوه محاسبه هزینه توکنها را بازنگری کرده است و در برخی موارد، این اصلاحات تعیین میکنند که کدام مدل برای یک بار کاری مشخص، ارزانتر است. این تغییرات به ندرت یک افزایش یا کاهش ساده و همگانی هستند. یک ارائهدهنده ممکن است قیمت ورودی را کاهش دهد در حالی که قیمت خروجی را افزایش میدهد. دیگری ممکن است مدلهای با پارامتر کم را بدون تغییر رها کند اما نرخ مدلهای با کانتکست طولانی (long-context) را بالا ببرد. از آنجایی که هر سه سرویس ترکیبات مختلفی از Llama، Qwen، Mistral و سایر معماریها را پشتیبانی میکنند، میزان ضرر یا سود کاملاً بستگی به این دارد که کدام مدل را از طریق کدام API هدایت میکنید.
چرا صورتحساب شما حتی با ثابت ماندن ترافیک تغییر میکند
برای درک این تأثیر، به نحوه عملکرد واقعی صورتحساب LLM نگاه کنید. شما تقریباً همیشه برای توکنهای ورودی و توکنهای خروجی بهطور جداگانه هزینه پرداخت میکنید و نسبت بین آنها هزینه نهایی شما را تعیین میکند. یک ربات پشتیبانی مشتری که روزانه ده هزار گفتگو را مدیریت میکند، ممکن است بهطور متوسط در هر چت، دو هزار توکن ورودی و چهارصد توکن خروجی داشته باشد. با یک قیمت ترکیبی سه دلار برای هر میلیون توکن، این مبلغ تقریباً ۸۴ دلار در روز است. اگر یک ارائهدهنده قیمت خروجی خود را تنها ۲۰ درصد افزایش دهد، هزینه روزانه از ۹۰ دلار فراتر میرود. در طول یک فصل، این یعنی تقریباً هزار دلار هزینه اضافی برای ترافیکی کاملاً مشابه.
این موضوع را در مقیاس یک خطلوله تولید محتوا یا یک سیستم تولید تقویتشده با بازیابی (RAG) که میلیونها توکن را در ساعت مدیریت میکند، در نظر بگیرید؛ در این حالت، ارائهدهندهای که انتخاب میکنید به یک بند هزینهای جدی تبدیل میشود. GMICloud، Novita و StreamLake این موضوع را میدانند. تغییرات قیمتگذاری آنها حرکات استراتژیک و حسابشدهای هستند که با هدف قرار دادن موارد استفاده خاص انجام شدهاند: کارهای دستهای با حجم بالا (high-volume batch jobs)، اپلیکیشنهای چت با تأخیر کم (low-latency)، یا وظایف خلاصهسازی با کانتکست طولانی.
پیچیدگی، لایه دیگری را اضافه میکند. برخی پلتفرمها حداقل هزینه در هر درخواست، هزینههای بیکاری برای پهنای باند اختصاصی (provisioned throughput) یا هزینههای اضافی برای جهشهای نرخ محدودیت (rate-limit bursts) را اضافه میکنند. تغییر در حداقل هزینه درخواست، به کاربران با حجم کم بسیار بیشتر از کاربران با حجم بالا آسیب میزند. تغییر در تخفیفهای استنتاج دستهای (batch inference) ممکن است هزینه تولید گزارشهای شبانه شما را کاهش دهد، در حالی که صورتحساب API بلادرنگ شما را بدون تغییر باقی بگذارد. خواندن تیتر «قیمتگذاری بهروزرسانی شد» کافی نیست؛ شما باید ماتریس قیمتها را بخوانید.
چگونه بدون واکنش بیش از حد پاسخ دهید
زمانی که نرخها تغییر میکنند، اکثر تیمهای مهندسی مرتکب یکی از دو اشتباه میشوند. آنها یا تغییر را نادیده میگیرند و بیسرصدا هزینههای مازاد را متحمل میشوند، یا دچار وحشت میشوند.
