Anthropic ने Claude Opus 5 का अनावरण किया: आधी लागत में बेहतरीन प्रदर्शन

Anthropic ने आधिकारिक तौर पर Claude Opus 5 लॉन्च किया है, जो एक नया फ्लैगशिप मॉडल है। इसे प्रीमियम Claude Fable 5 के लगभग बराबर प्रदर्शन को काफी कम कीमत पर पेश करके हाई-एंड LLM मार्केट में हलचल मचाने के लिए डिज़ाइन किया गया है। इस रणनीतिक कदम का उद्देश्य GPT-5.6 Sol जैसे प्रतिस्पर्धियों के मूल्य निर्धारण दबाव (pricing pressure) को कम करना है, साथ ही डेवलपर्स को कोडिंग और जटिल ज्ञान संबंधी कार्यों (knowledge work) के लिए एक अधिक कुशल टूल प्रदान करना है।

मूल्य-प्रदर्शन की सीमा को चुनौती देना

Claude Opus 5 की सबसे आकर्षक विशेषता इसकी आक्रामक मूल्य निर्धारण संरचना है। जहाँ टॉप-टियर Claude Fable 5 की लागत $10 प्रति मिलियन इनपुट टोकन और $50 प्रति मिलियन आउटपुट टोकन है, वहीं Opus 5 इन दरों को आधा कर देता है, जिसकी कीमत $5 प्रति मिलियन इनपुट और $25 प्रति मिलियन आउटपुट टोकन है।

लेटेंसी (latency) की आवश्यकताओं को पूरा करने के लिए, Anthropic ने "Fast Mode" भी पेश किया है, जो प्रोसेसिंग स्पीड को 2.5 गुना बढ़ा देता है, हालांकि इसके लिए टोकन की कीमत दोगुनी हो जाती है। यह टियर वाली प्राइसिंग, 1 मिलियन-टोकन के विशाल कॉन्टेक्स्ट विंडो के साथ मिलकर, Opus 5 को Claude Max के लिए नया डिफॉल्ट मॉडल और Claude Pro उपयोगकर्ताओं के लिए सबसे सक्षम विकल्प के रूप में स्थापित करती है।

कोडिंग और रीजनिंग में बेंचमार्क श्रेष्ठता

Opus 5 केवल एक बजट विकल्प नहीं है; यह विशिष्ट क्षेत्रों में प्रदर्शन का पावरहाउस है। Frontier-Bench v0.1 के माध्यम से एजेंटिक टर्मिनल कोडिंग (agentic terminal coding) में, Opus 5 ने 43.3% का स्कोर हासिल किया, जो Fable 5 (33.7%) और GPT-5.6 Sol (34.4%) दोनों से काफी बेहतर है। इसने ज्ञान संबंधी कार्यों (knowledge work) में भी अपना दबदबा दिखाया, और 1,861 के Elo स्कोर के साथ GDPval-AA v2 बेंचमार्क में बढ़त बनाई।

शायद सबसे चौंकाने वाला आंकड़ा ARC-AGI-3 बेंचमार्क से आता है, जो नई समस्याओं को सुलझाने की क्षमता को मापता है। Opus 5 ने 30.2% स्कोर किया, जो GPT-5.6 Sol द्वारा हासिल किए गए 7.8% से लगभग चार गुना अधिक है। यह मॉडल की उन कार्यों को संभालने की क्षमता में एक बड़ी छलांग का संकेत देता है जो इसके ट्रेनिंग डेटा पैटर्न से बाहर हैं।

इंटेलिजेंट एफर्ट स्केलिंग और दक्षता

Anthropic ने एक परिष्कृत "effort" सिस्टम पेश किया है, जो उपयोगकर्ताओं को पांच सेटिंग्स के बीच स्विच करने की अनुमति देता है: low, medium, high, xhigh, और max। यह टोकन खपत और रीजनिंग की गहराई के बीच एक सूक्ष्म संतुलन (granular trade-off) बनाने की सुविधा देता है।

हालांकि Anthropic लागत को अनुकूलित करने के लिए सामान्य कार्यों के लिए "low" और "medium" सेटिंग्स की सिफारिश करता है, वे जटिल एजेंटिक कोडिंग के लिए "xhigh" का उपयोग करने की सलाह देते हैं। दिलचस्प बात यह है कि कंपनी ने "max" सेटिंग पर घटते लाभ (diminishing return) को नोट किया; Frontier-Bench v0.1 और Artificial Analysis Coding Agent Index दोनों पर, अधिक लागत के बावजूद Opus 5 के प्रदर्शन में अधिकतम एफर्ट पर थोड़ी गिरावट देखी गई, जिससे पता चलता है कि दक्षता के लिए "xhigh" सेटिंग वर्तमान में सबसे उपयुक्त (sweet spot) हो सकती है।

बेहतर सुरक्षा और स्वायत्तता

उपयोगकर्ता फीडबैक के सीधे जवाब में, Anthropic ने Opus 5 के लिए सेफ्टी क्लासिफायर (safety classifiers) को फाइन-ट्यून किया है। मॉडल के साइबर फिल्टर Fable 5 की तुलना में लगभग 85% कम बार ट्रिगर होते हैं, जो वैध शोध को अत्यधिक ब्लॉक करने के संबंध में पिछली आलोचनाओं का समाधान करते हैं। हालांकि यह अभी भी एक्सप्लॉइट जनरेशन (exploit generation) और बाइनरी-आधारित स्कैनिंग को रोकता है, लेकिन यह सोर्स कोड भेद्यता अनुसंधान (vulnerability research) के लिए कहीं अधिक उदार है।

इसके अलावा, Opus 5 बेहतर सेल्फ-करेक्शन क्षमताएं दिखाता है। वास्तविक दुनिया के परीक्षण में, मॉडल ने ज्यामिति (geometry) की व्याख्या करने के लिए अपना स्वयं का कंप्यूटर विजन पाइपलाइन लिखकर FreeCAD में सफलतापूर्वक एक 3D मॉडल बनाया—एक ऐसा कार्य जिसने अन्य सभी प्रतिस्पर्धी मॉडलों को चकित कर दिया।

मुख्य बातें

  • भारी लागत में कमी: Opus 5, Claude Fable 5 की टोकन लागत के 50% पर फ्लैगशिप-स्तर का प्रदर्शन प्रदान करता है।
  • रीजनिंग में बड़ी सफलता: मॉडल ने नई समस्याओं को सुलझाने के लिए ARC-AGI-3 बेंचमार्क में प्रतिस्पर्धियों पर 4 गुना बड़ी बढ़त दिखाई।
  • अनुकूलित डेवलपर वर्कफ़्लो: बेहतर सेफ्टी क्लासिफायर और विशेष "effort" सेटिंग्स के साथ, Opus 5 एजेंटिक कोडिंग और अनुसंधान के लिए अधिक सहज अनुभव प्रदान करता है।