قیمت‌گذاری LLM مدام در حال تغییر است. یک ماه بودجه استنتاج (inference) شما دقیقاً طبق پیش‌بینی عمل می‌کند؛ ماه بعد، یکی از ارائه‌دهندگان نرخ هر توکن را تغییر می‌دهد و هزینه ماهانه شما بدون اینکه حتی یک درخواست اضافی ارسال شود، جابه‌جا می‌شود. این دقیقاً همان اتفاقی است که رخ داده است. GMICloud، Novita و StreamLake همگی قیمت مدل‌های خود را به‌روزرسانی کرده‌اند و اگر بارهای کاری عملیاتی (production workloads) یا حتی خط‌لوله‌های آزمایشی را اجرا می‌کنید، این بازنگری‌ها نیاز به بررسی دقیق دارند. نه به این دلیل که بازار در حال فروپاشی است، بلکه به این دلیل که تفاوت‌های کوچک در اقتصاد توکن‌ها، زمانی که روزانه میلیون‌ها توکن پردازش می‌کنید، به شکلی بی‌رحمانه اثر مرکب ایجاد می‌کنند.

این ارائه‌دهندگان چه کسانی هستند

GMICloud، Novita و StreamLake هر کدام نقش متمایزی در پشته زیرساخت هوش مصنوعی ایفا می‌کنند، اما اکنون در زمینه هزینه اجرای مدل‌های زبانی بزرگ (LLM) مستقیماً با هم هم‌پوشانی دارند.

GMICloud یک ابر GPU با کارایی بالا را مدیریت می‌کند و کاتالوگ رو به رشدی از LLMهای میزبانی‌شده را برای توسعه‌دهندگانی که می‌خواهند بدون مدیریت کلاسترهای خود به API دسترسی داشته باشند، ارائه می‌دهد. Novita شهرت خود را بر پایه اجاره ارزان‌قیمت GPU و سرویس‌دهی مدل‌ها بنا کرده است و مهندسانی را جذب می‌کند که مدل‌های با وزن باز (open-weight) را با قیمتی کمتر از نرخ‌های بالای هایپرسکیلرهای بزرگتر ترجیح می‌دهند. StreamLake که از اکوسیستم ابری و رسانه‌ای ByteDance نشأت گرفته است، تخصص زیرساخت ویدئویی را به رقابت استنتاج (inference) می‌آورد و مدل‌ها را از طریق پلتفرمی ارائه می‌دهد که بارهای کاری سنگین پردازش رسانه را نیز مدیریت می‌کند.

هیچ‌کدام از آن‌ها مانند OpenAI یا Anthropic نام‌های شناخته‌شده‌ای در سطح جهانی نیستند. دقیقاً به همین دلیل است که تغییرات قیمت‌گذاری آن‌ها اهمیت دارد. آن‌ها در لایه میانی و تهاجمی بازار قرار دارند؛ جایی که حاشیه سود کم است، تخفیف‌ها رایج هستند و رقابت برای جذب توسعه‌دهندگان همیشگی است. وقتی سه پلتفرم در این سطح، تقریباً در یک زمان لیست قیمت‌های خود را تغییر می‌دهند، در مجموع معیار جدیدی برای هزینه اجرای مدل‌های متن‌باز یا مدل‌های Fine-tuned تعیین می‌کنند.

چه چیزی تغییر کرد

این به‌روزرسانی‌ها قیمت استفاده از LLM را در هر سه سرویس تحت تأثیر قرار داده است. Naren که با نام narevbot در Dev.to می‌نویسد، جزئیات این تغییرات را در پستی مستند کرده است که تنظیمات دقیق مدل به مدل را برای GMICloud، Novita و StreamLake شرح می‌دهد. می‌توانید مقایسه کامل را در اینجا بخوانید.

به جای بازگو کردن ارقام مربوط به قیمت هر توکن که ممکن است قبل از تمام شدن این پاراگراف دوباره تغییر کنند، نکته حیاتی این است که این تغییرات ساختاری هستند. هر ارائه‌دهنده نحوه محاسبه هزینه توکن‌ها را بازنگری کرده است و در برخی موارد، این اصلاحات تعیین می‌کنند که کدام مدل برای یک بار کاری مشخص، ارزان‌تر است. این تغییرات به ندرت یک افزایش یا کاهش ساده و همگانی هستند. یک ارائه‌دهنده ممکن است قیمت ورودی را کاهش دهد در حالی که قیمت خروجی را افزایش می‌دهد. دیگری ممکن است مدل‌های با پارامتر کم را بدون تغییر رها کند اما نرخ مدل‌های با کانتکست طولانی (long-context) را بالا ببرد. از آنجایی که هر سه سرویس ترکیبات مختلفی از Llama، Qwen، Mistral و سایر معماری‌ها را پشتیبانی می‌کنند، میزان ضرر یا سود کاملاً بستگی به این دارد که کدام مدل را از طریق کدام API هدایت می‌کنید.

چرا صورت‌حساب شما حتی با ثابت ماندن ترافیک تغییر می‌کند

برای درک این تأثیر، به نحوه عملکرد واقعی صورت‌حساب LLM نگاه کنید. شما تقریباً همیشه برای توکن‌های ورودی و توکن‌های خروجی به‌طور جداگانه هزینه پرداخت می‌کنید و نسبت بین آن‌ها هزینه نهایی شما را تعیین می‌کند. یک ربات پشتیبانی مشتری که روزانه ده هزار گفتگو را مدیریت می‌کند، ممکن است به‌طور متوسط در هر چت، دو هزار توکن ورودی و چهارصد توکن خروجی داشته باشد. با یک قیمت ترکیبی سه دلار برای هر میلیون توکن، این مبلغ تقریباً ۸۴ دلار در روز است. اگر یک ارائه‌دهنده قیمت خروجی خود را تنها ۲۰ درصد افزایش دهد، هزینه روزانه از ۹۰ دلار فراتر می‌رود. در طول یک فصل، این یعنی تقریباً هزار دلار هزینه اضافی برای ترافیکی کاملاً مشابه.

این موضوع را در مقیاس یک خط‌لوله تولید محتوا یا یک سیستم تولید تقویت‌شده با بازیابی (RAG) که میلیون‌ها توکن را در ساعت مدیریت می‌کند، در نظر بگیرید؛ در این حالت، ارائه‌دهنده‌ای که انتخاب می‌کنید به یک بند هزینه‌ای جدی تبدیل می‌شود. GMICloud، Novita و StreamLake این موضوع را می‌دانند. تغییرات قیمت‌گذاری آن‌ها حرکات استراتژیک و حساب‌شده‌ای هستند که با هدف قرار دادن موارد استفاده خاص انجام شده‌اند: کارهای دسته‌ای با حجم بالا (high-volume batch jobs)، اپلیکیشن‌های چت با تأخیر کم (low-latency)، یا وظایف خلاصه‌سازی با کانتکست طولانی.

پیچیدگی، لایه دیگری را اضافه می‌کند. برخی پلتفرم‌ها حداقل هزینه در هر درخواست، هزینه‌های بیکاری برای پهنای باند اختصاصی (provisioned throughput) یا هزینه‌های اضافی برای جهش‌های نرخ محدودیت (rate-limit bursts) را اضافه می‌کنند. تغییر در حداقل هزینه درخواست، به کاربران با حجم کم بسیار بیشتر از کاربران با حجم بالا آسیب می‌زند. تغییر در تخفیف‌های استنتاج دسته‌ای (batch inference) ممکن است هزینه تولید گزارش‌های شبانه شما را کاهش دهد، در حالی که صورت‌حساب API بلادرنگ شما را بدون تغییر باقی بگذارد. خواندن تیتر «قیمت‌گذاری به‌روزرسانی شد» کافی نیست؛ شما باید ماتریس قیمت‌ها را بخوانید.

چگونه بدون واکنش بیش از حد پاسخ دهید

زمانی که نرخ‌ها تغییر می‌کنند، اکثر تیم‌های مهندسی مرتکب یکی از دو اشتباه می‌شوند. آن‌ها یا تغییر را نادیده می‌گیرند و بی‌سرصدا هزینه‌های مازاد را متحمل می‌شوند، یا دچار وحشت می‌شوند.