Claude Opus 5 اکنون برای یک حجم کاری یکسان، سه برابر بیشتر از Opus 4.8 هزینه دارد، با وجود اینکه هر دو مدل قیمت یکسانی را برای هر توکن فهرست کردهاند. مقصر اصلی ویژگی پیشفرض “adaptive thinking” است که بیسروصدا توکنهای خروجی را به عنوان استدلال پنهان مصرف میکند. خاموش کردن این ویژگی، بدون آسیب رساندن به دقت، برابری هزینه را بازمیگرداند.
Why the price gap appears
هر دو نسخه برای هر یک میلیون توکن ورودی ۵ دلار و برای هر یک میلیون توکن خروجی ۲۵ دلار دریافت میکنند. در بنچمارکهای ما، هزینه Opus 5 هنگام اجرای پرامپتهای یکسان، ۳.۱ برابر بیشتر از Opus 4.8 بود. هزینه اضافی ناشی از قیمت فهرستشدهی بالاتر نیست؛ بلکه در نحوه محاسبه فرآیند تفکر داخلی Opus 5 گنجانده شده است.
What adaptive thinking does
وقتی adaptive thinking فعال باشد، مدل قبل از ارائه پاسخ نهایی، استدلال داخلی اضافی انجام میدهد. آن استدلال به عنوان توکنهای خروجی محاسبه میشود، حتی اگر هرگز به دست کاربر نرسد. در پرسوجوهای ساده، بین ۴۲٪ تا ۹۵٪ از توکنهای خروجی صورتحساب، همین استدلال پنهان هستند. بنابراین، یک مسئله ریاضی ساده که باید یک پاسخ تکرقمی تولید کند، میتواند دهها توکن دیده نشده ایجاد کرده و هزینه را به شدت افزایش دهد.
این ویژگی یک باگ نیست؛ طراحان Claude قصد دارند کیفیت پاسخ را در وظایف پیچیده بهبود بخشند. در عمل، استدلال پنهان اغلب منجر به بهبود اندک دقت در پرامپتهای دشوار میشود، بهویژه زمانی که مدل باید چندین مرحله را زنجیرهوار انجام دهد یا با ابزارهای خارجی تعامل داشته باشد.
How to control costs
این مدل یک پارامتر واحد را میپذیرد که adaptive thinking را غیرفعال میکند:
{
"thinking": {"type": "disabled"}
}
اعمال این تنظیم روی Opus 5، هزینه هر وظیفه را دقیقاً به همان میزانی که Opus 4.8 شارژ میکند کاهش میدهد، در حالی که صحت نتایج در حجم کارهای سادهای که آزمایش کردیم، ثابت میماند.
When to disable
- استخراج داده از متن
- عملیات قالببندی (مانند تبدیل به JSON)
- فراخوانیهای تکمرحلهای که در آن پاسخ یک جستجوی مستقیم یا یک محاسبه ساده است
غیرفعال کردن تفکر در این موارد، «مالیات توکن پنهان» را حذف کرده و صورتحسابها را قابل پیشبینی نگه میدارد.
When to keep it on
- وظایفی که نیاز به زنجیرههای منطقی عمیق یا استدلالهای ظریف دارند
- جریانهای کاری عامل (agent workflows) که به طور مکرر ابزارهای خارجی را فراخوانی میکنند
در سناریوهای مبتنی بر ابزار، شکاف هزینه به حدود ۳۳٪ کاهش مییابد، زیرا مدل هنگام چرخیدن در فراخوانیهای ابزار، هزینه کمتری را صرف استدلال داخلی میکند.
Other notable differences
- Context window: Opus 5 میتواند تا یک میلیون توکن را نگه دارد، که ما این موضوع را با بازیابی یک رشته هدف که در توکن ۹۶۹,۹۵۰ قرار داده شده بود، تأیید کردیم.
- Cache floor: حداقل اندازه کش به ۵۱۲ توکن کاهش یافت که نصف مقدار کف Opus 4.8 است و بر میزان مکالمه قبلی که مدل میتواند بدون توکنسازی مجدد از آن استفاده کند، تأثیر میگذارد.
What to watch next
توسعهدهندگان باید گزارشهای استفاده را برای “reasoning tokens” یا موارد مشابه که نشاندهنده فعال بودن adaptive thinking است، نظارت کنند. با پذیرش بیشتر برنامهها از Claude برای عملیاتهای سبک عامل (agent-style)، توازن بین هزینه و کیفیت به یک تصمیم کلیدی برای بهینهسازی تبدیل خواهد شد. بهروزرسانیهای آینده ممکن است به کاربران اجازه دهند به جای یک سوئیچ «همه یا هیچ»، عمق استدلال را تنظیم کنند که میتواند منحنی هزینه را هموارتر کند.
Takeaway: ویژگی پیشفرض adaptive thinking در Opus 5، استفاده از توکن را در وظایف آسان افزایش میدهد. با استفاده از تنظیم ساده بالا آن را غیرفعال کنید تا با هزینه Opus 4.8 مطابقت داشته باشد، و فقط زمانی آن را فعال کنید که استدلال اضافی، هزینهی اضافی را توجیه کند.
