Anthropic એ Claude Opus 5 રજૂ કર્યું: અડધી કિંમતે શ્રેષ્ઠ પ્રદર્શન

Anthropic એ સત્તાવાર રીતે Claude Opus 5 લોન્ચ કર્યું છે, જે એક નવું ફ્લેગશિપ મોડેલ છે. તેને પ્રીમિયમ Claude Fable 5 ની લગભગ સમાન ક્ષમતા અને નોંધપાત્ર રીતે ઓછી કિંમતે ઓફર કરીને હાઈ-એન્ડ LLM માર્કેટમાં પરિવર્તન લાવવા માટે ડિઝાઇન કરવામાં આવ્યું છે. આ વ્યૂહાત્મક પગલાનો હેતુ GPT-5.6 Sol જેવા સ્પર્ધકો તરફથી આવતા કિંમતની દબાણને નિષ્ક્રિય કરવાનો છે, સાથે જ ડેવલપર્સને કોડિંગ અને જટિલ જ્ઞાન કાર્ય (knowledge work) માટે વધુ કાર્યક્ષમ સાધન પૂરું પાડવાનો છે.

કિંમત-પ્રદર્શન સીમામાં પરિવર્તન

Claude Opus 5 ની સૌથી આકર્ષક વિશેષતા તેની આક્રમક કિંમતનું માળખું છે. જ્યારે ટોપ-ટિયર Claude Fable 5 ની કિંમત પ્રતિ મિલિયન ઇનપુટ ટોકન્સ માટે $10 અને પ્રતિ મિલિયન આઉટપુટ ટોકન્સ માટે $50 છે, ત્યારે Opus 5 આ દરોને અડધા કરી નાખે છે, જે પ્રતિ મિલિયન ઇનપુટ માટે $5 અને પ્રતિ મિલિયન આઉટપુટ માટે $25 છે.

લેટન્સી (latency) જરૂરિયાતોને પહોંચી વળવા માટે, Anthropic એ "Fast Mode" પણ રજૂ કર્યો છે, જે પ્રોસેસિંગ સ્પીડમાં 2.5x નો વધારો કરે છે, જોકે તેના માટે ટોકન કિંમતમાં બમણો વધારો કરવો પડશે. આ સ્તરયુક્ત કિંમત (tiered pricing) અને 1 મિલિયન-ટોકનનું વિશાળ કોન્ટેક્સ્ટ વિન્ડો (context window), Opus 5 ને Claude Max માટે નવા ડિફોલ્ટ મોડેલ તરીકે અને Claude Pro વપરાશકર્તાઓ માટે સૌથી સક્ષમ વિકલ્પ તરીકે સ્થાપિત કરે છે.

કોડિંગ અને રીઝનિંગમાં બેન્ચમાર્ક સર્વોપરિતા

Opus 5 માત્ર એક બજેટ વિકલ્પ નથી; તે ચોક્કસ ક્ષેત્રોમાં પ્રદર્શનની શક્તિશાળી તાકાત છે. Frontier-Bench v0.1 દ્વારા એજન્ટિક ટર્મિનલ કોડિંગમાં, Opus 5 એ 43.3% સ્કોર મેળવ્યો છે, જે Fable 5 (33.7%) અને GPT-5.6 Sol (34.4%) બંને કરતા નોંધપાત્ર રીતે વધુ છે. તેણે જ્ઞાન કાર્યમાં પણ પ્રભુત્વ દર્શાવ્યું છે, જે GDPval-AA v2 બેન્ચમાર્ક સાથે 1,861 ના Elo સ્કોર સાથે અગ્રેસર રહ્યું છે.

કદાચ સૌથી આશ્ચર્યજનક આંકડો ARC-AGI-3 બેન્ચમાર્કમાંથી આવે છે, જે નવીન સમસ્યા-નિવારણ (novel problem-solving) માપે છે. Opus 5 એ 30.2% સ્કોર મેળવ્યો છે, જે GPT-5.6 Sol દ્વારા મેળવેલા 7.8% કરતા લગભગ ચાર ગણો વધારે છે. આ તેના ટ્રેનિંગ ડેટા પેટર્નની બહારના કાર્યોને સંભાળવાની મોડેલની ક્ષમતામાં એક મોટી છલાંગ સૂચવે છે.

બુદ્ધિશાળી એફર્ટ સ્કેલિંગ અને કાર્યક્ષમતા

Anthropic એ એક અત્યાધુનિક "effort" સિસ્ટમ રજૂ કરી છે, જે વપરાશકર્તાઓને પાંચ સેટિંગ્સ વચ્ચે બદલવાની મંજૂરી આપે છે: low, medium, high, xhigh, અને max. આ ટોકન વપરાશ અને રીઝનિંગની ઊંડાઈ વચ્ચે સચોટ સંતુલન જાળવવામાં મદદ કરે છે.

જ્યારે Anthropic ખર્ચ ઘટાડવા માટે સામાન્ય કાર્યો માટે "low" અને "medium" સેટિંગ્સની ભલામણ કરે છે, ત્યારે તેઓ જટિલ એજન્ટિક કોડિંગ માટે "xhigh" નો ઉપયોગ કરવાની સલાહ આપે છે. રસપ્રદ વાત એ છે કે, કંપનીએ "max" સેટિંગ પર ઘટતા વળતર (diminishing return) નોંધ્યું છે; Frontier-Bench v0.1 અને Artificial Analysis Coding Agent Index બંનેમાં, વધુ ખર્ચ હોવા છતાં Opus 5 ના પ્રદર્શનમાં મહત્તમ એફર્ટ પર થોડો ઘટાડો જોવા મળ્યો હતો, જે સૂચવે છે કે કાર્યક્ષમતા માટે "xhigh" સેટિંગ હાલમાં શ્રેષ્ઠ (sweet spot) હોઈ શકે છે.

સુધારેલી સુરક્ષા અને સ્વાયત્તતા

વપરાશકર્તાઓના પ્રતિસાદના સીધા પ્રતિસાદમાં, Anthropic એ Opus 5 માટે સેફ્ટી ક્લાસિફાયર્સને ફાઇન-ટ્યુન કર્યા છે. મોડેલના સાયબર ફિલ્ટર્સ Fable 5 કરતા અંદાજે 85% ઓછા વાર ટ્રિગર થાય છે, જે કાયદેસરના સંશોધનને અતિશય બ્લોક કરવા અંગેની અગાઉની ટીકાઓને દૂર કરે છે. જોકે તે હજુ પણ એક્સપ્લોઇટ જનરેશન અને બાઈનરી-આધારિત સ્કેનિંગને અટકાવે છે, પરંતુ તે સોર્સ કોડ વલ્નરેબિલિટી (vulnerability) સંશોધન માટે વધુ પરવાનગી આપે છે.

વધુમાં, Opus 5 બહેતર સેલ્ફ-કરેક્શન ક્ષમતાઓ દર્શાવે છે. વાસ્તવિક દુનિયાના પરીક્ષણમાં, મોડેલે ભૂમિતિ (geometry) ને સમજવા માટે પોતાનું કમ્પ્યુટર વિઝન પાઇપલાઇન લખીને FreeCAD માં સફળતાપૂર્વક 3D મોડેલ બનાવ્યું—એવું કાર્ય જે અન્ય તમામ સ્પર્ધક મોડેલો માટે અઘરું હતું.

મુખ્ય મુદ્દાઓ

  • ખર્ચમાં મોટો ઘટાડો: Opus 5, Claude Fable 5 ની ટોકન કિંમતના 50% પર ફ્લેગશિપ-સ્તરનું પ્રદર્શન આપે છે.
  • રીઝનિંગમાં મોટી સફળતા: મોડેલે નવીન સમસ્યા-નિવારણ માટેના ARC-AGI-3 બેન્ચમાર્ક માં સ્પર્ધકો કરતા 4 ગણું મોટું અંતર સાબિત કર્યું છે.
  • ઓપ્ટિમાઇઝ્ડ ડેવલપર વર્કફ્લો: સુધારેલા સેફ્ટી ક્લાસિફાયર્સ અને વિશિષ્ટ "effort" સેટિંગ્સ સાથે, Opus 5 એજન્ટિક કોડિંગ અને સંશોધન માટે વધુ સરળ અનુભવ પ્રદાન કરે છે.