OpenAI در ۳۰ ژوئیه ۲۰۲۶ اعلام کرد که هزینه API مدل GPT-5.6 بهطور چشمگیری کمتر از نسخه قبلی خواهد بود. این نسخه شامل سه مدل سطحبندی شده یعنی Sol، Terra و Luna است، بهعلاوه تخفیفهای قابلتوجهی برای خواندن دادههای کششده (cached reads) ارائه میدهد.
چرا قیمتگذاری جدید اهمیت دارد
از زمان عرضه GPT-5، هزینههای API یکی از بندهای اصلی بودجه برای هر کسی که در حال ساخت عاملهای گفتگوگر (conversational agents)، خطلولههای تولید با بازیابی افزوده (RAG) یا ابزارهای استخراج داده در مقیاس بزرگ است، بوده است. OpenAI با کاهش هزینههای ورودی به ترتیب به ۵، ۲ و ۰.۲۰ دلار بهازای هر میلیون توکن برای مدلهای Sol، Terra و Luna، راه ارزانتری را در اختیار توسعهدهندگان قرار میدهد تا بدون نیاز به بازطراحی کل زیرساخت خود، سطح استدلال مورد نیازشان را انتخاب کنند. بیشترین میزان صرفهجویی مربوط به Terra است که اکنون با ۴۰٪ قیمت مدل پرچمدار قبلی کار میکند، و Luna که تنها ۴٪ آن معیار را شامل میشود.
بررسی دقیق سه مدل
| مدل | قیمت ورودی (به ازای هر ۱ میلیون توکن) | قیمت خروجی (به ازای هر ۱ میلیون توکن) | کاربرد معمول |
|---|---|---|---|
| Sol | $5 | $30 | استدلال عمیق، وظایف زنجیره تفکر (chain-of-thought) |
| Terra | $2 | $12 | بارهای کاری عملیاتی، عملکرد متعادل |
| Luna | $0.20 | $1.20 | حجم بالا، استخراج یا طبقهبندی ساده |
Sol همچنان گرانترین مدل است اما غنیترین عمق استدلال را ارائه میدهد. Terra به عنوان گزینه پیشفرض برای اکثر کاربردها در نظر گرفته شده است، در حالی که Luna یک گزینه «مقیاسپذیر» است که در آن میتوان عمق استدلال را فدای کاهش هزینه کرد.
استفاده از کش (Caching) هزینه را حتی بیشتر کاهش میدهد
OpenAI یک لایه کش معرفی کرده است که عملیات خواندن را با ۹۰٪ تخفیف انجام میدهد. نرخهای ورودی کششده عبارتند از:
- Sol: $0.50 / M tokens
- Terra: $0.20 / M tokens
- Luna: $0.02 / M tokens
نوشتن در کش ۱.۲۵ برابر نرخ ورودی مربوطه هزینه دارد و یک ورودی کش باید حداقل ۳۰ دقیقه باقی بماند تا بتوان آن را حذف (evict) کرد.
هزینههای اضافی طول کانتکست (Context-length)
این API اکنون زمانی که یک درخواست از ۲۷۲ هزار توکن ورودی فراتر رود، هزینه اضافی اعمال میکند. قیمت پایه برای ورودی دو برابر شده و برای خروجی ۱.۵ برابر افزایش مییابد. نرخهای مازاد Sol به ترتیب ۱۰ دلار برای ورودی و ۴۵ دلار برای خروجی بهازای هر میلیون توکن تعیین شده است که محاسبه جریمه برای کانتکستهای بسیار طولانی را آسان میکند.
آنچه توسعهدهندگان از دست میدهند
کاهش قیمتها با دو نکته قابل توجه همراه است. اول اینکه هیچ سطح رایگان (free tier) دائمی وجود ندارد، به این معنی که هر درخواست، هر چقدر هم کوچک باشد، هزینه خواهد داشت. دوم اینکه OpenAI هنوز تخفیفهای مربوط به نقاط پایانی دستهای (batch-endpoint) را برای GPT-5.6 معرفی نکرده است؛ ویژگیای که در نسخههای قبلی به کاربران در مقیاس بزرگ کمک میکرد تا هزینههای هر فراخوانی را کاهش دهند.
چگونه هزینهها را پایین نگه داریم
- مدل مناسب را انتخاب کنید: از Sol فقط برای وظایفی استفاده کنید که واقعاً به استدلال عمیق نیاز دارند؛ برای اکثر کارهای عملیاتی از Terra استفاده کنید؛ و Luna را برای کارهای با حجم بالا و پیچیدگی کم رزرو کنید.
- از کش استفاده کنید: پرامپتها و نتایج میانی را که در فراخوانیهای مختلف دوباره استفاده میشوند، ذخیره کنید؛ تخفیف ۹۰ درصدی خواندن میتواند بسیار بیشتر از کاهش قیمت پایه اثرگذار باشد.
- مراقب طول کانتکست باشید: ورودیهای بسیار طولانی را به بخشهای کوچکتر تقسیم کنید یا قسمتهای غیرضروری را حذف کنید تا از جریمه ۲ برابری ورودی جلوگیری شود.
- به مدتزمان ماندگاری کش توجه کنید: حداقل مدت زمان ماندگاری در کش ۳۰ دقیقه است.
گام بعدی چیست
توسعهدهندگان باید صفحه رسمی قیمتگذاری را برای هرگونه تغییر، بهویژه در مورد هزینههای نوشتن در کش یا آستانههای طول کانتکست، زیر نظر داشته باشند.
نکته کلیدی: قیمتگذاری سطحبندی شده و تخفیفهای تهاجمی کش در GPT-5.6، آن را به مدل مقرونبهصرفهای از OpenAI تبدیل میکند، اما نبود سطح رایگان و تخفیفهای دستهای به این معناست که مدیریت هوشمندانه هزینهها همچنان برای هر استقرار در مقیاس بزرگ ضروری خواهد بود.
