Claude Opus 5 अब समान वर्कलोड के लिए Opus 4.8 की तुलना में तीन गुना अधिक लागत लेता है, भले ही दोनों मॉडलों की प्रति टोकन कीमत समान हो। इसका मुख्य कारण डिफ़ॉल्ट “adaptive thinking” फीचर है, जो चुपचाप आउटपुट टोकन को 'हिडन रीजनिंग' (hidden reasoning) के रूप में खर्च करता है। इस फीचर को बंद करने से सटीकता को नुकसान पहुँचाए बिना लागत में समानता वापस आ जाती है।

कीमतों में अंतर क्यों दिखता है

दोनों वर्ज़न $5 प्रति मिलियन इनपुट टोकन और $25 प्रति मिलियन आउटपुट टोकन चार्ज करते हैं। हमारे बेंचमार्क में, समान प्रॉम्प्ट चलाने पर Opus 5 का बिल Opus 4.8 की तुलना में 3.1 × अधिक था। यह अतिरिक्त शुल्क अधिक लिस्ट प्राइस के कारण नहीं है; बल्कि यह उस तरीके से जुड़ा हुआ है जिससे Opus 5 अपनी आंतरिक विचार प्रक्रिया (internal thought process) का हिसाब रखता है।

adaptive thinking क्या करता है

जब adaptive thinking इनेबल होता है, तो मॉडल अंतिम उत्तर देने से पहले अतिरिक्त आंतरिक रीजनिंग (internal reasoning) करता है। उस रीजनिंग को आउटपुट टोकन के रूप में गिना जाता है, भले ही वह उपयोगकर्ता तक कभी न पहुँचे। सीधे-सादे सवालों पर, बिल किए गए आउटपुट टोकन का 42% से 95% तक हिस्सा यही हिडन रीजनिंग होती है। इसलिए, एक साधारण गणितीय समस्या जिसका उत्तर केवल एक अंक का होना चाहिए, वह दर्जनों अनदेखे टोकन उत्पन्न कर सकती है, जिससे लागत नाटकीय रूप से बढ़ जाती है।

यह फीचर कोई बग नहीं है—Claude के डिजाइनरों का उद्देश्य जटिल कार्यों पर उत्तर की गुणवत्ता में सुधार करना है। व्यवहार में, हिडन रीजनिंग अक्सर कठिन प्रॉम्प्ट्स पर सटीकता में मामूली सुधार लाती है, खासकर तब जब मॉडल को कई चरणों को जोड़ना हो या बाहरी टूल्स के साथ इंटरैक्ट करना हो।

लागत को कैसे नियंत्रित करें

मॉडल एक सिंगल पैरामीटर स्वीकार करता है जो adaptive thinking को डिसेबल कर देता है:

{
  "thinking": {"type": "disabled"}
}

Opus 5 पर इस सेटिंग को लागू करने से इसकी प्रति-कार्य लागत (per-task expense) ठीक उतनी ही हो जाती है जितनी Opus 4.8 चार्ज करता है, जबकि हमारे द्वारा टेस्ट किए गए सरल वर्कलोड पर परिणामों की सटीकता वैसी ही बनी रहती है।

कब डिसेबल करें

  • टेक्स्ट से डेटा निकालना (Extraction of data)
  • फॉर्मेटिंग ऑपरेशन्स (जैसे, JSON कन्वर्जन)
  • सिंगल-स्टेप कॉल्स जहाँ उत्तर एक सीधा लुकअप या मामूली गणना हो

इन मामलों में थिंकिंग को डिसेबल करने से हिडन टोकन टैक्स खत्म हो जाता है और बिल अनुमानित (predictable) रहता है।

इसे कब ऑन रखें

  • वे कार्य जिनमें गहरी लॉजिकल चेन या सूक्ष्म रीजनिंग (nuanced reasoning) की आवश्यकता हो
  • एजेंट वर्कफ़्लो जो बार-बार बाहरी टूल्स को कॉल करते हैं

टूल-हैवी परिदृश्यों (scenarios) में लागत का अंतर घटकर लगभग 33% रह जाता है क्योंकि मॉडल टूल कॉल्स के दौरान आंतरिक रीजनिंग पर कम खर्च करता है।

अन्य उल्लेखनीय अंतर

  • Context window: Opus 5 एक मिलियन टोकन तक रख सकता है, जिसे हमने टोकन 969,950 पर रखे गए एक टारगेट स्ट्रिंग को रिट्रीव करके सत्यापित किया है।
  • Cache floor: न्यूनतम कैश साइज घटकर 512 टोकन हो गया है, जो Opus 4.8 के फ्लोर का आधा है। यह इस बात को प्रभावित करता है कि मॉडल री-टोकनाइज़ेशन के बिना कितनी पिछली बातचीत का पुन: उपयोग कर सकता है।

आगे क्या ध्यान रखें

डेवलपर्स को "reasoning tokens" या इसी तरह के अन्य आइटम के लिए उपयोग रिपोर्ट की निगरानी करनी चाहिए, जो यह संकेत देते हैं कि adaptive thinking सक्रिय है। जैसे-जैसे अधिक एप्लिकेशन एजेंट-स्टाइल ऑपरेशन्स के लिए Claude को अपनाएंगे, लागत और गुणवत्ता के बीच का संतुलन (trade-off) एक प्रमुख ऑप्टिमाइज़ेशन निर्णय बन जाएगा। भविष्य के अपडेट उपयोगकर्ताओं को 'ऑल-ऑर-नथिंग' स्विच के बजाय रीजनिंग की गहराई को ट्यून करने की अनुमति दे सकते हैं, जिससे लागत का उतार-चढ़ाव कम हो सकता है।

निष्कर्ष (Takeaway): Opus 5 की डिफ़ॉल्ट adaptive thinking आसान कार्यों पर टोकन के उपयोग को बढ़ा देती है। Opus 4.8 की लागत के बराबर लाने के लिए ऊपर दी गई सरल सेटिंग के साथ इसे डिसेबल करें, और इसे केवल तभी इनेबल करें जब अतिरिक्त रीजनिंग अतिरिक्त खर्च को सही ठहराती हो।