Claude Opus 5 आता समान कामासाठी (workload) Opus 4.8 पेक्षा तीन पटीने जास्त खर्चिक आहे, जरी दोन्ही मॉडेल्सची प्रति टोकन किंमत सारखीच असली तरीही. याचे मुख्य कारण म्हणजे डीफॉल्ट "adaptive thinking" हे फीचर आहे, जे 'hidden reasoning' (लपलेले तर्क) म्हणून आउटपुट टोकन्सचा वापर करते. हे फीचर बंद केल्यास अचूकतेवर परिणाम न होता खर्चात समानता येते.
किमतीतील तफावत का दिसून येते
दोन्ही व्हर्जनमध्ये प्रति १० लाख (million) इनपुट टोकन्ससाठी $5 आणि प्रति १० लाख आउटपुट टोकन्ससाठी $25 आकारले जातात. आमच्या बेंचमार्कमध्ये, समान प्रॉम्प्ट्स चालवताना Opus 5 चे बिल Opus 4.8 पेक्षा 3.1 पट जास्त होते. हा अतिरिक्त खर्च अधिक किमतीमुळे येत नाही; तर Opus 5 त्याच्या अंतर्गत विचार प्रक्रियेचा (internal thought process) हिशोब ज्या पद्धतीने ठेवते, त्यामध्ये तो समाविष्ट आहे.
adaptive thinking काय करते
जेव्हा adaptive thinking सुरू असते, तेव्हा मॉडेल अंतिम उत्तर देण्यापूर्वी अतिरिक्त अंतर्गत तर्क (internal reasoning) करते. हे तर्क आउटपुट टोकन्स म्हणून मोजले जातात, जरी ते वापरकर्त्याला कधीही दिसत नाहीत. साध्या प्रश्नांच्या बाबतीत, बिल केलेल्या आउटपुट टोकन्सपैकी 42% ते 95% टोकन्स हे लपलेले तर्क असू शकतात. त्यामुळे, ज्या गणिती प्रश्नाचे उत्तर केवळ एक अंकी असावे, त्या प्रश्नामुळेही डझनभर न दिसणारे टोकन्स तयार होऊ शकतात, ज्यामुळे खर्च मोठ्या प्रमाणात वाढतो.
हे फीचर कोणतीही त्रुटी (bug) नाही—Claude च्या डिझाइनर्सचा उद्देश क्लिष्ट कामांमध्ये उत्तराचा दर्जा सुधारणे हा आहे. प्रत्यक्षात, कठीण प्रॉम्प्ट्सवर हे लपलेले तर्क अनेकदा अचूकतेमध्ये थोडी वाढ करतात, विशेषतः जेव्हा मॉडेलला अनेक पायऱ्यांची साखळी तयार करावी लागते किंवा बाह्य साधनांशी (external tools) संवाद साधावा लागतो.
खर्च कसा नियंत्रित करायचा
मॉडेलमध्ये एक सिंगल पॅरामीटर आहे जो adaptive thinking बंद करतो:
{
"thinking": {"type": "disabled"}
}
Opus 5 मध्ये हे सेटिंग लागू केल्यास, प्रत्येक कामाचा खर्च अगदी Opus 4.8 इतकाच होतो, तर आम्ही तपासलेल्या साध्या कामांमध्ये निकालांची अचूकता तशीच राहते.
कधी बंद करावे
- मजकुरातून डेटा काढणे (Data extraction)
- फॉरमॅटिंग ऑपरेशन्स (उदा. JSON रूपांतरण)
- सिंगल-स्टेप कॉल्स, जिथे उत्तर थेट शोधणे (lookup) किंवा साधे गणित असते
या प्रकरणांमध्ये 'thinking' बंद केल्यामुळे लपलेला 'token tax' वाचतो आणि बिलिंगचा अंदाज घेणे सोपे जाते.
कधी सुरू ठेवावे
- ज्या कामांसाठी सखोल तार्किक साखळी किंवा सूक्ष्म तर्काची (nuanced reasoning) आवश्यकता असते
- एजंट वर्कफ्लो (Agent workflows) जे वारंवार बाह्य साधनांना कॉल करतात
ज्या कामांमध्ये साधनांचा (tools) जास्त वापर होतो, तिथे किमतीतील तफावत कमी होऊन साधारण 33% पर्यंत येते, कारण टूल कॉल्सच्या दरम्यान मॉडेल अंतर्गत तर्कावर कमी खर्च करते.
इतर महत्त्वाचे फरक
- Context window: Opus 5 एक दशलक्ष (one million) टोकन्सपर्यंत साठवू शकते, ज्याची आम्ही टोकन 969,950 वर ठेवलेली स्ट्रिंग शोधून पडताळणी केली आहे.
- Cache floor: किमान कॅशे आकार (minimum cache size) 512 टोकन्सपर्यंत खाली आला आहे, जो Opus 4.8 च्या अर्धा आहे. याचा परिणाम मॉडेल पुन्हा टोकनायझेशन न करता किती जुना संवाद पुन्हा वापरू शकते यावर होतो.
पुढे काय पाहावे
डेव्हलपर्सनी "reasoning tokens" किंवा तत्सम आयटम्ससाठी वापर अहवाल (usage reports) तपासले पाहिजेत, जे दर्शवतात की adaptive thinking सक्रिय आहे. जसे अधिक ॲप्लिकेशन्स एजंट-स्टाईल ऑपरेशन्ससाठी Claude चा वापर करतील, तसे खर्च आणि गुणवत्ता यांच्यातील समतोल राखणे हा एक महत्त्वाचा निर्णय ठरेल. भविष्यातील अपडेट्समध्ये वापरकर्त्यांना 'all-or-nothing' स्विचऐवजी तर्काची खोली (depth of reasoning) ट्यून करण्याची सुविधा मिळू शकते, ज्यामुळे खर्चाचा चढ-उतार कमी होऊ शकेल.
थोडक्यात महत्त्वाचे (Takeaway): Opus 5 चे डीफॉल्ट adaptive thinking सोप्या कामांसाठी टोकनचा वापर वाढवते. Opus 4.8 च्या खर्चाशी सुसंगत राहण्यासाठी वरील साध्या सेटिंगने ते बंद करा, आणि जेव्हा अतिरिक्त तर्क आवश्यक असेल तेव्हाच ते सुरू करा.
