OpenAI در ۳۰ ژوئیه ۲۰۲۶ اعلام کرد که هزینه API مدل GPT-5.6 به‌طور چشمگیری کمتر از نسخه قبلی خواهد بود. این نسخه شامل سه مدل سطح‌بندی شده یعنی Sol، Terra و Luna است، به‌علاوه تخفیف‌های قابل‌توجهی برای خواندن داده‌های کش‌شده (cached reads) ارائه می‌دهد.

چرا قیمت‌گذاری جدید اهمیت دارد

از زمان عرضه GPT-5، هزینه‌های API یکی از بندهای اصلی بودجه برای هر کسی که در حال ساخت عامل‌های گفتگوگر (conversational agents)، خط‌لوله‌های تولید با بازیابی افزوده (RAG) یا ابزارهای استخراج داده در مقیاس بزرگ است، بوده است. OpenAI با کاهش هزینه‌های ورودی به ترتیب به ۵، ۲ و ۰.۲۰ دلار به‌ازای هر میلیون توکن برای مدل‌های Sol، Terra و Luna، راه ارزان‌تری را در اختیار توسعه‌دهندگان قرار می‌دهد تا بدون نیاز به بازطراحی کل زیرساخت خود، سطح استدلال مورد نیازشان را انتخاب کنند. بیشترین میزان صرفه‌جویی مربوط به Terra است که اکنون با ۴۰٪ قیمت مدل پرچم‌دار قبلی کار می‌کند، و Luna که تنها ۴٪ آن معیار را شامل می‌شود.

بررسی دقیق سه مدل

مدل قیمت ورودی (به ازای هر ۱ میلیون توکن) قیمت خروجی (به ازای هر ۱ میلیون توکن) کاربرد معمول
Sol $5 $30 استدلال عمیق، وظایف زنجیره تفکر (chain-of-thought)
Terra $2 $12 بارهای کاری عملیاتی، عملکرد متعادل
Luna $0.20 $1.20 حجم بالا، استخراج یا طبقه‌بندی ساده

Sol همچنان گران‌ترین مدل است اما غنی‌ترین عمق استدلال را ارائه می‌دهد. Terra به عنوان گزینه پیش‌فرض برای اکثر کاربردها در نظر گرفته شده است، در حالی که Luna یک گزینه «مقیاس‌پذیر» است که در آن می‌توان عمق استدلال را فدای کاهش هزینه کرد.

استفاده از کش (Caching) هزینه را حتی بیشتر کاهش می‌دهد

OpenAI یک لایه کش معرفی کرده است که عملیات خواندن را با ۹۰٪ تخفیف انجام می‌دهد. نرخ‌های ورودی کش‌شده عبارتند از:

  • Sol: $0.50 / M tokens
  • Terra: $0.20 / M tokens
  • Luna: $0.02 / M tokens

نوشتن در کش ۱.۲۵ برابر نرخ ورودی مربوطه هزینه دارد و یک ورودی کش باید حداقل ۳۰ دقیقه باقی بماند تا بتوان آن را حذف (evict) کرد.

هزینه‌های اضافی طول کانتکست (Context-length)

این API اکنون زمانی که یک درخواست از ۲۷۲ هزار توکن ورودی فراتر رود، هزینه اضافی اعمال می‌کند. قیمت پایه برای ورودی دو برابر شده و برای خروجی ۱.۵ برابر افزایش می‌یابد. نرخ‌های مازاد Sol به ترتیب ۱۰ دلار برای ورودی و ۴۵ دلار برای خروجی به‌ازای هر میلیون توکن تعیین شده است که محاسبه جریمه برای کانتکست‌های بسیار طولانی را آسان می‌کند.

آنچه توسعه‌دهندگان از دست می‌دهند

کاهش قیمت‌ها با دو نکته قابل توجه همراه است. اول اینکه هیچ سطح رایگان (free tier) دائمی وجود ندارد، به این معنی که هر درخواست، هر چقدر هم کوچک باشد، هزینه خواهد داشت. دوم اینکه OpenAI هنوز تخفیف‌های مربوط به نقاط پایانی دسته‌ای (batch-endpoint) را برای GPT-5.6 معرفی نکرده است؛ ویژگی‌ای که در نسخه‌های قبلی به کاربران در مقیاس بزرگ کمک می‌کرد تا هزینه‌های هر فراخوانی را کاهش دهند.

چگونه هزینه‌ها را پایین نگه داریم

  • مدل مناسب را انتخاب کنید: از Sol فقط برای وظایفی استفاده کنید که واقعاً به استدلال عمیق نیاز دارند؛ برای اکثر کارهای عملیاتی از Terra استفاده کنید؛ و Luna را برای کارهای با حجم بالا و پیچیدگی کم رزرو کنید.
  • از کش استفاده کنید: پرامپت‌ها و نتایج میانی را که در فراخوانی‌های مختلف دوباره استفاده می‌شوند، ذخیره کنید؛ تخفیف ۹۰ درصدی خواندن می‌تواند بسیار بیشتر از کاهش قیمت پایه اثرگذار باشد.
  • مراقب طول کانتکست باشید: ورودی‌های بسیار طولانی را به بخش‌های کوچک‌تر تقسیم کنید یا قسمت‌های غیرضروری را حذف کنید تا از جریمه ۲ برابری ورودی جلوگیری شود.
  • به مدت‌زمان ماندگاری کش توجه کنید: حداقل مدت زمان ماندگاری در کش ۳۰ دقیقه است.

گام بعدی چیست

توسعه‌دهندگان باید صفحه رسمی قیمت‌گذاری را برای هرگونه تغییر، به‌ویژه در مورد هزینه‌های نوشتن در کش یا آستانه‌های طول کانتکست، زیر نظر داشته باشند.

نکته کلیدی: قیمت‌گذاری سطح‌بندی شده و تخفیف‌های تهاجمی کش در GPT-5.6، آن را به مدل مقرون‌به‌صرفه‌ای از OpenAI تبدیل می‌کند، اما نبود سطح رایگان و تخفیف‌های دسته‌ای به این معناست که مدیریت هوشمندانه هزینه‌ها همچنان برای هر استقرار در مقیاس بزرگ ضروری خواهد بود.