Claude Opus 5 اکنون برای یک حجم کاری یکسان، سه برابر بیشتر از Opus 4.8 هزینه دارد، با وجود اینکه هر دو مدل قیمت یکسانی را برای هر توکن فهرست کرده‌اند. مقصر اصلی ویژگی پیش‌فرض “adaptive thinking” است که بی‌سروصدا توکن‌های خروجی را به عنوان استدلال پنهان مصرف می‌کند. خاموش کردن این ویژگی، بدون آسیب رساندن به دقت، برابری هزینه را بازمی‌گرداند.

Why the price gap appears

هر دو نسخه برای هر یک میلیون توکن ورودی ۵ دلار و برای هر یک میلیون توکن خروجی ۲۵ دلار دریافت می‌کنند. در بنچمارک‌های ما، هزینه Opus 5 هنگام اجرای پرامپت‌های یکسان، ۳.۱ برابر بیشتر از Opus 4.8 بود. هزینه اضافی ناشی از قیمت فهرست‌شده‌ی بالاتر نیست؛ بلکه در نحوه محاسبه فرآیند تفکر داخلی Opus 5 گنجانده شده است.

What adaptive thinking does

وقتی adaptive thinking فعال باشد، مدل قبل از ارائه پاسخ نهایی، استدلال داخلی اضافی انجام می‌دهد. آن استدلال به عنوان توکن‌های خروجی محاسبه می‌شود، حتی اگر هرگز به دست کاربر نرسد. در پرس‌وجوهای ساده، بین ۴۲٪ تا ۹۵٪ از توکن‌های خروجی صورت‌حساب، همین استدلال پنهان هستند. بنابراین، یک مسئله ریاضی ساده که باید یک پاسخ تک‌رقمی تولید کند، می‌تواند ده‌ها توکن دیده نشده ایجاد کرده و هزینه را به شدت افزایش دهد.

این ویژگی یک باگ نیست؛ طراحان Claude قصد دارند کیفیت پاسخ را در وظایف پیچیده بهبود بخشند. در عمل، استدلال پنهان اغلب منجر به بهبود اندک دقت در پرامپت‌های دشوار می‌شود، به‌ویژه زمانی که مدل باید چندین مرحله را زنجیره‌وار انجام دهد یا با ابزارهای خارجی تعامل داشته باشد.

How to control costs

این مدل یک پارامتر واحد را می‌پذیرد که adaptive thinking را غیرفعال می‌کند:

{
  "thinking": {"type": "disabled"}
}

اعمال این تنظیم روی Opus 5، هزینه هر وظیفه را دقیقاً به همان میزانی که Opus 4.8 شارژ می‌کند کاهش می‌دهد، در حالی که صحت نتایج در حجم کارهای ساده‌ای که آزمایش کردیم، ثابت می‌ماند.

When to disable

  • استخراج داده از متن
  • عملیات قالب‌بندی (مانند تبدیل به JSON)
  • فراخوانی‌های تک‌مرحله‌ای که در آن پاسخ یک جستجوی مستقیم یا یک محاسبه ساده است

غیرفعال کردن تفکر در این موارد، «مالیات توکن پنهان» را حذف کرده و صورت‌حساب‌ها را قابل پیش‌بینی نگه می‌دارد.

When to keep it on

  • وظایفی که نیاز به زنجیره‌های منطقی عمیق یا استدلال‌های ظریف دارند
  • جریان‌های کاری عامل (agent workflows) که به طور مکرر ابزارهای خارجی را فراخوانی می‌کنند

در سناریوهای مبتنی بر ابزار، شکاف هزینه به حدود ۳۳٪ کاهش می‌یابد، زیرا مدل هنگام چرخیدن در فراخوانی‌های ابزار، هزینه کمتری را صرف استدلال داخلی می‌کند.

Other notable differences

  • Context window: Opus 5 می‌تواند تا یک میلیون توکن را نگه دارد، که ما این موضوع را با بازیابی یک رشته هدف که در توکن ۹۶۹,۹۵۰ قرار داده شده بود، تأیید کردیم.
  • Cache floor: حداقل اندازه کش به ۵۱۲ توکن کاهش یافت که نصف مقدار کف Opus 4.8 است و بر میزان مکالمه قبلی که مدل می‌تواند بدون توکن‌سازی مجدد از آن استفاده کند، تأثیر می‌گذارد.

What to watch next

توسعه‌دهندگان باید گزارش‌های استفاده را برای “reasoning tokens” یا موارد مشابه که نشان‌دهنده فعال بودن adaptive thinking است، نظارت کنند. با پذیرش بیشتر برنامه‌ها از Claude برای عملیات‌های سبک عامل (agent-style)، توازن بین هزینه و کیفیت به یک تصمیم کلیدی برای بهینه‌سازی تبدیل خواهد شد. به‌روزرسانی‌های آینده ممکن است به کاربران اجازه دهند به جای یک سوئیچ «همه یا هیچ»، عمق استدلال را تنظیم کنند که می‌تواند منحنی هزینه را هموارتر کند.

Takeaway: ویژگی پیش‌فرض adaptive thinking در Opus 5، استفاده از توکن را در وظایف آسان افزایش می‌دهد. با استفاده از تنظیم ساده بالا آن را غیرفعال کنید تا با هزینه Opus 4.8 مطابقت داشته باشد، و فقط زمانی آن را فعال کنید که استدلال اضافی، هزینه‌ی اضافی را توجیه کند.