Claude Opus 5 ની કિંમત સમાન વર્કલોડ માટે Opus 4.8 કરતા ત્રણ ગણી વધારે છે, ભલે બંને મોડલ્સમાં પ્રતિ ટોકન સમાન કિંમત દર્શાવવામાં આવી હોય. આનું કારણ ડિફોલ્ટ “adaptive thinking” ફીચર છે, જે છુપાયેલ રીઝનિંગ (reasoning) તરીકે આઉટપુટ ટોકન્સનો ઉપયોગ કરે છે. આ ફીચર બંધ કરવાથી ચોકસાઈને નુકસાન પહોંચાડ્યા વિના ખર્ચમાં સમાનતા પાછી મેળવી શકાય છે.
કિંમતમાં તફાવત કેમ દેખાય છે
બંને વર્ઝન પ્રતિ મિલિયન ઇનપુટ ટોકન્સ માટે $5 અને પ્રતિ મિલિયન આઉટપુટ ટોકન્સ માટે $25 વસૂલે છે. અમારા બેન્ચમાર્ક્સમાં, સમાન પ્રોમ્પ્ટ્સ ચલાવતી વખતે Opus 5 નું બિલ Opus 4.8 કરતા 3.1 × વધારે હતું. આ વધારાનો ચાર્જ ઊંચી લિસ્ટ પ્રાઇસને કારણે નથી; તે Opus 5 તેની આંતરિક વિચાર પ્રક્રિયા (internal thought process) ને જે રીતે ગણે છે તેમાં સમાવિષ્ટ છે.
adaptive thinking શું કરે છે
જ્યારે adaptive thinking સક્ષમ હોય છે, ત્યારે મોડલ અંતિમ જવાબ આપતા પહેલા વધારાનું આંતરિક રીઝનિંગ કરે છે. તે રીઝનિંગ આઉટપુટ ટોકન્સ તરીકે ગણવામાં આવે છે, ભલે તે વપરાશકર્તા સુધી ક્યારેય પહોંચતું નથી. સીધા પ્રશ્નોમાં, બિલ કરવામાં આવેલા આઉટપુટ ટોકન્સમાંથી 42% થી 95% સુધી આ છુપાયેલું રીઝનિંગ હોઈ શકે છે. તેથી, એક સાદી અંકગણિતની સમસ્યા જેનો જવાબ એક આંકડાનો હોવો જોઈએ, તે ડઝનબંધ અદ્રશ્ય ટોકન્સ જનરેટ કરી શકે છે, જેનાથી ખર્ચમાં મોટો વધારો થાય છે.
આ ફીચર કોઈ બગ (bug) નથી—Claude ના ડિઝાઇનરોનો હેતુ જટિલ કાર્યો પર જવાબની ગુણવત્તા સુધારવાનો છે. વ્યવહારમાં, છુપાયેલું રીઝનિંગ અઘરા પ્રોમ્પ્ટ્સ પર ઘણીવાર ચોકસાઈમાં થોડો વધારો કરે છે, ખાસ કરીને જ્યારે મોડલે અનેક સ્ટેપ્સ જોડવાના હોય અથવા બાહ્ય ટૂલ્સ સાથે કામ કરવાનું હોય.
ખર્ચ કેવી રીતે નિયંત્રિત કરવો
મોડલ એક સિંગલ પેરામીટર સ્વીકારે છે જે adaptive thinking ને નિષ્ક્રિય કરે છે:
{
"thinking": {"type": "disabled"}
}
Opus 5 પર આ સેટિંગ લાગુ કરવાથી તેનો પ્રતિ-કાર્ય ખર્ચ બરાબર એટલો જ થઈ જાય છે જેટલો Opus 4.8 વસૂલે છે, જ્યારે અમે ટેસ્ટ કરેલા સાદા વર્કલોડ પર પરિણામોની ચોકસાઈ સમાન રહે છે.
ક્યારે નિષ્ક્રિય કરવું
- ટેક્સ્ટમાંથી ડેટા એક્સટ્રેક્શન (Extraction)
- ફોર્મેટિંગ કામગીરી (દા.ત., JSON કન્વર્ઝન)
- સિંગલ-સ્ટેપ કોલ્સ જ્યાં જવાબ સીધો લુકઅપ અથવા સામાન્ય ગણતરી હોય
આ કિસ્સાઓમાં રીઝનિંગને નિષ્ક્રિય કરવાથી છુપાયેલું ટોકન ટેક્સ દૂર થાય છે અને બિલ અનુમાનિત રહે છે.
ક્યારે ચાલુ રાખવું
- એવા કાર્યો જેમાં ઊંડા લોજિકલ ચેઇન અથવા સૂક્ષ્મ રીઝનિંગની જરૂર હોય
- એજન્ટ વર્કફ્લો જે વારંવાર બાહ્ય ટૂલ્સનો ઉપયોગ કરે છે
ટૂલ-હેવી (tool-heavy) પરિસ્થિતિઓમાં ખર્ચનો તફાવત ઘટીને અંદાજે 33% થઈ જાય છે કારણ કે ટૂલ કોલ્સ દરમિયાન મોડલ આંતરિક રીઝનિંગ પાછળ ઓછો ખર્ચ કરે છે.
અન્ય નોંધપાત્ર તફાવતો
- Context window: Opus 5 એક મિલિયન ટોકન્સ સુધી રાખી શકે છે, જે અમે ટોકન 969,950 પર રાખેલી ટાર્ગેટ સ્ટ્રિંગ મેળવીને ચકાસ્યું છે.
- Cache floor: લઘુત્તમ કેશ સાઈઝ ઘટીને 512 ટોકન્સ થઈ ગઈ છે, જે Opus 4.8 કરતા અડધી છે, જે મોડલ ફરીથી ટોકનાઇઝ કર્યા વિના કેટલી અગાઉની વાતચીતનો ફરીથી ઉપયોગ કરી શકે છે તેના પર અસર કરે છે.
આગળ શું ધ્યાન રાખવું
ડેવલપર્સે "reasoning tokens" અથવા સમાન લાઇન આઇટમ્સ માટે વપરાશ રિપોર્ટ્સ પર નજર રાખવી જોઈએ જે સૂચવે છે કે adaptive thinking સક્રિય છે. જેમ જેમ વધુ એપ્લિકેશન્સ એજન્ટ-સ્ટાઇલ કામગીરી માટે Claude નો ઉપયોગ કરશે, તેમ ખર્ચ અને ગુણવત્તા વચ્ચેનો સંતુલન (trade-off) એક મુખ્ય ઓપ્ટિમાઇઝેશન નિર્ણય બની જશે. ભવિષ્યના અપડેટ્સ વપરાશકર્તાઓને 'ઓલ-ઓર-નથિંગ' સ્વિચને બદલે રીઝનિંગની ઊંડાઈ સેટ કરવાની સુવિધા આપી શકે છે, જે ખર્ચના વળાંકને સંતુલિત કરી શકે છે.
Takeaway: Opus 5 નું ડિફોલ્ટ adaptive thinking સરળ કાર્યો પર ટોકન વપરાશ વધારે છે. Opus 4.8 ના ખર્ચ સાથે મેળ ખાવા માટે ઉપર આપેલ સરળ સેટિંગ સાથે તેને નિષ્ક્રિય કરો, અને વધારાનું રીઝનિંગ વધારાના ખર્ચને યોગ્ય ઠેરવે ત્યારે જ તેને સક્રિય કરો.
