Anthropic ने Claude Opus 5 सादर केले: अर्ध्या किमतीत उत्कृष्ट कामगिरी
Anthropic ने अधिकृतपणे Claude Opus 5 लाँच केले आहे, जे एक नवीन फ्लॅगशिप मॉडेल आहे. प्रीमियम Claude Fable 5 च्या जवळपासची क्षमता अत्यंत कमी किमतीत उपलब्ध करून देऊन हाय-एंड LLM मार्केटमध्ये क्रांती घडवून आणण्यासाठी हे डिझाइन केले आहे. ही धोरणात्मक हालचाल GPT-5.6 Sol सारख्या स्पर्धकांकडून येणारा किंमतीचा दबाव कमी करण्याचे आणि डेव्हलपर्सना कोडिंग आणि जटिल ज्ञान कार्यासाठी (knowledge work) अधिक कार्यक्षम साधन उपलब्ध करून देण्याचे उद्दिष्ट ठेवते.
किंमत-कामगिरीच्या सीमांमध्ये क्रांती
Claude Opus 5 चे सर्वात लक्षवेधी वैशिष्ट्य म्हणजे त्याची आक्रमक किंमत संरचना. उच्च श्रेणीतील Claude Fable 5 ची किंमत प्रति दशलक्ष इनपुट टोकन्ससाठी $10 आणि प्रति दशलक्ष आउटपुट टोकन्ससाठी $50 आहे, तर Opus 5 ने या दरांमध्ये ५०% कपात केली असून, त्याची किंमत प्रति दशलक्ष इनपुटसाठी $5 आणि प्रति दशलक्ष आउटपुटसाठी $25 आहे.
लॅटन्सी (latency) गरजा पूर्ण करण्यासाठी, Anthropic ने "Fast Mode" देखील सादर केला आहे, जो प्रोसेसिंगचा वेग २.५ पटीने वाढवतो, परंतु यासाठी टोकनची किंमत दुप्पट होते. ही टियर्ड प्राइसिंग (tiered pricing) आणि १ दशलक्ष टोकन्सची अवाढव्य कॉन्टेक्स्ट विंडो (context window), Opus 5 ला Claude Max साठी नवीन डिफॉल्ट मॉडेल आणि Claude Pro वापरकर्त्यांसाठी सर्वात सक्षम पर्याय म्हणून स्थापित करते.
कोडिंग आणि रिझनिंगमध्ये बेंचमार्क श्रेष्ठत्व
Opus 5 हे केवळ स्वस्त पर्याय नाही; तर ते विशिष्ट क्षेत्रांमध्ये कामगिरीच्या बाबतीत अत्यंत शक्तिशाली आहे. Frontier-Bench v0.1 द्वारे एजेंटिक टर्मिनल कोडिंगमध्ये, Opus 5 ने ४३.३% स्कोअर मिळवला, जो Fable 5 (३३.७%) आणि GPT-5.6 Sol (३४.४%) या दोघांपेक्षा लक्षणीयरीत्या जास्त आहे. तसेच, ज्ञान कार्यामध्ये वर्चस्व गाजवत, या मॉडेलने GDPval-AA v2 बेंचमार्कमध्ये १,८६१ च्या Elo स्कोअरसह आघाडी घेतली आहे.
कदाचित सर्वात धक्कादायक आकडेवारी ARC-AGI-3 बेंचमार्कमधून येते, जे नवीन समस्या सोडवण्याच्या क्षमतेचे मोजमाप करते. Opus 5 ने ३०.२% स्कोअर मिळवला, जो GPT-5.6 Sol ने मिळवलेल्या ७.८% च्या तुलनेत जवळपास चारपट आहे. हे मॉडेलच्या त्याच्या ट्रेनिंग डेटा पॅटर्नच्या बाहेर असलेल्या कामांना हाताळण्याच्या क्षमतेतील मोठी झेप दर्शवते.
इंटेलिजेंट एफर्ट स्केलिंग आणि कार्यक्षमता
Anthropic ने एक प्रगत "effort" सिस्टम सादर केली आहे, ज्यामुळे वापरकर्त्यांना पाच सेटिंग्जमध्ये बदल करता येतो: low, medium, high, xhigh आणि max. यामुळे टोकनचा वापर आणि रिझनिंगची खोली (reasoning depth) यांच्यात सूक्ष्म संतुलन राखणे शक्य होते.
खर्च कमी करण्यासाठी Anthropic सामान्य कामांसाठी "low" आणि "medium" सेटिंग्ज वापरण्याची शिफारस करते, परंतु जटिल एजेंटिक कोडिंगसाठी "xhigh" वापरण्याचा सल्ला देते. विशेष म्हणजे, कंपनीने "max" सेटिंगमध्ये कमी होणारा परतावा (diminishing return) नोंदवला आहे; Frontier-Bench v0.1 आणि Artificial Analysis Coding Agent Index या दोन्हीमध्ये, जास्त खर्च असूनही Opus 5 च्या कामगिरीत 'maximum effort' वर किंचित घट दिसून आली, ज्यावरून असे सुचते की कार्यक्षमतेसाठी सध्या "xhigh" सेटिंग हे सर्वोत्तम (sweet spot) आहे.
सुधारित सुरक्षा आणि स्वायत्तता
वापरकर्त्यांच्या फीडबॅकला थेट प्रतिसाद म्हणून, Anthropic ने Opus 5 साठी सेफ्टी क्लासिफायर्स (safety classifiers) अधिक अचूक केले आहेत. या मॉडेलचे सायबर फिल्टर्स Fable 5 च्या तुलनेत सुमारे ८५% वेळा कमी सक्रिय होतात, ज्यामुळे वैध संशोधनावर (legitimate research) अति-उत्साहाने बंदी घालण्याबाबतच्या पूर्वीच्या टीकांचे निराकरण झाले आहे. जरी हे मॉडेल अजूनही एक्सप्लॉइट जनरेशन (exploit generation) आणि बायनरी-आधारित स्कॅनिंग रोखते, तरीही सोर्स कोड व्हल्नरेबिलिटी रिसर्चसाठी (source code vulnerability research) ते अधिक लवचिक आहे.
शिवाय, Opus 5 मध्ये सुधारित सेल्फ-करेक्शन (self-correction) क्षमता दिसून येतात. वास्तविक जगातील चाचणीमध्ये, मॉडेलने भूमिती (geometry) समजून घेण्यासाठी स्वतःचे कॉम्प्युटर व्हिजन पाइपलाइन लिहून FreeCAD मध्ये यशस्वीरित्या 3D मॉडेल तयार केले—हे असे काम होते ज्यामध्ये इतर सर्व स्पर्धक मॉडेल्स अपयशी ठरली होती.
मुख्य मुद्दे
- मोठी किंमत कपात: Opus 5, Claude Fable 5 च्या टोकन खर्चाच्या केवळ ५०% किमतीत फ्लॅगशिप-स्तरीय कामगिरी प्रदान करते.
- रिझनिंगमधील मोठी झेप: नवीन समस्या सोडवण्यासाठी ARC-AGI-3 बेंचमार्कमध्ये या मॉडेलने स्पर्धकांपेक्षा ४ पटीने मोठी आघाडी घेतली आहे.
- ऑप्टिमाइझ्ड डेव्हलपर वर्कफ्लो: सुधारित सेफ्टी क्लासिफायर्स आणि विशेष "effort" सेटिंग्जसह, Opus 5 एजेंटिक कोडिंग आणि संशोधनासाठी अधिक सुलभ अनुभव प्रदान करते.
