Claude Opus 5 २४ जुलै रोजी बाजारात आले आणि त्याची मुख्य आकडेवारी जवळच्या स्पर्धकापेक्षा तिप्पट वाढ आणि Anthropic च्या स्वतःच्या Opus 4.8 पेक्षा दुप्पट कामगिरीचे आश्वासन देते. जे लोक AI आउटपुटसाठी पैसे मोजतात, त्यांच्यासाठी खरा प्रश्न हा आहे की, किंमत न वाढवता हे गुणोत्तर प्रत्यक्ष फायद्यांमध्ये रूपांतरित होते का.

ही आकडेवारी का महत्त्वाची आहे

डेव्हलपर्सना SWE-bench Pro स्कोअरची सर्वात जास्त काळजी असते, हा एक असा बेंचमार्क आहे जो मॉडेल किती चांगल्या प्रकारे कोड दुरुस्त करू शकते हे पाहण्यासाठी वास्तविक GitHub समस्यांवर (issues) मॉडेलची चाचणी घेतो. Opus 5 ने ७९.२% स्कोअर मिळवला, तर Opus 4.8 ने ६९.२% मिळवले होते—केवळ दोन महिन्यांत दहा अंकांची वाढ झाली आहे. Anthropic ने प्रति टोकन किंमत तीच ठेवली आहे, त्यामुळे वापरकर्त्यांना त्याच किमतीत लक्षणीयरीत्या अधिक हुशार कोडिंग असिस्टंट मिळत आहे.

जर ही मुख्य आकडेवारी इतर चाचण्यांमध्येही टिकून राहिली, तर खर्च-कार्यक्षमता (cost-performance) यांचा संबंध कंपन्या कोड-केंद्रित कामांसाठी भाषा मॉडेल्सची निवड कशी करतात, हे बदलू शकतो.

प्रमुख चाचण्यांमध्ये Opus 5 ची कामगिरी कशी आहे

  • SWE-bench Pro – ७९.२% विरुद्ध ६९.२% (Opus 4.8). प्रति टोकन किंमत तीच, परंतु वास्तविक जगातील बग फिक्सिंगमध्ये अधिक यश दर.
  • CursorBench 3.2 – टास्क पूर्ण करण्याच्या वेगाच्या बाबतीत आघाडीवर असलेल्या Fable 5 च्या ०.५% च्या मर्यादेत Opus 5 आहे, तरीही प्रति टास्क याचा खर्च साधारण निम्मा आहे.
  • ARC-AGI-3 – Opus 5 ने ३०.२ गुण मिळवले आहेत, तर दुसरा क्रमांक असलेला मॉडेल ७.८ वर आहे. हा फरक खूप मोठा आहे, जे सूचित करतो की Opus 5 अमूर्त-तर्क (abstract-reasoning) समस्या इतर समकालीन मॉडेल्सपेक्षा कितीतरी पटीने चांगल्या प्रकारे हाताळते.
  • General Reasoning – येथे स्पर्धा अधिक चुरशीची आहे. GPT-5.6 Sol ९२.५ च्या सरासरीने आघाडीवर आहे, जो Opus 5 च्या ९०.४ पेक्षा थोडा जास्त आहे. येथे Opus 5 स्पर्धात्मक आहे पण वर्चस्व गाजवत नाही.

ही आकडेवारी एक सूक्ष्म चित्र दर्शवते: Opus 5 कोड-संबंधित आणि काही तर्कशास्त्राच्या बेंचमार्क्समध्ये उत्कृष्ट आहे, तरीही ते अद्याप सर्वोत्तम जनरल-रीझनिंग मॉडेलच्या मागे आहे.

प्रत्यक्ष माहितीच्या पलीकडे जाऊन पाहणे

जर चाचणीच्या अटी स्पष्ट नसतील, तर बेंचमार्क आकडेवारी दिशाभूल करणारी असू शकते. खरे तथ्य आणि केवळ प्रसिद्धी (hype) यातील फरक ओळखण्यासाठी चार गोष्टी मदत करतात:

१. प्रयत्नांची पातळी (Effort level) – मॉडेल कमी, डिफॉल्ट की कमाल प्रयत्नांसह (max effort) चालवले होते का? जास्त प्रयत्नांमुळे स्कोअर वाढू शकतात, परंतु त्यामुळे लॅटन्सी (latency) आणि खर्चही वाढतो. २. चाचण्यांची संख्या (Trial count) – एकदाच केलेल्या चाचण्यांमध्ये योगायोगाने चांगले निकाल मिळू शकतात. वारंवार केलेल्या चाचण्या (पाच किंवा अधिक) अधिक स्थिर चित्र देतात. ३. स्रोत (Source) – विक्रेत्याद्वारे प्रदान केलेले बेंचमार्क बेसलाइनसाठी उपयुक्त असतात, परंतु त्यांची स्वतंत्र प्रयोगशाळांद्वारे पडताळणी होणे आवश्यक आहे. ४. तुलना बेसलाइन (Comparison baseline) – "पुढील मॉडेल" अजूनही सध्याचे लीडर आहे की चाचणी घेतल्यापासून क्षेत्रात एखादा नवीन स्पर्धक आला आहे?

वापरकर्ते आणि स्पर्धकांसाठी याचे महत्त्व

मोठ्या प्रमाणावर कोड-रिव्ह्यू पाइपलाइन चालवणाऱ्या कंपन्या, प्रति टोकन किंमत न बदलता SWE-bench Pro मध्ये दहा अंकांची वाढ मिळाल्यामुळे डीबगिंग सायकलमधील अनेक तास वाचवू शकतात आणि क्लाउड-कंप्युट बिल कमी करू शकतात. लहान टीम्सना बजेट वाढवण्याची गरज न पडता अधिक सक्षम असिस्टंट मिळेल.

General Reasoning मधील चुरशीचे स्कोअर डेव्हलपर्सना याची आठवण करून देतात की, Opus 5 हे सध्याच्या सर्वोत्तम ऑल-राउंड मॉडेलला पूर्णपणे पर्याय ठरणार नाही.

पुढे काय पाहायचे

  • स्वतंत्र बेंचमार्क प्रसिद्धी – थर्ड-पार्टी लॅब्स लवकरच विविध प्रयत्न स्तरांवर (effort levels) Opus 5 ची चाचणी घेतील. त्यांचे निष्कर्ष Anthropic च्या दाव्यांची पुष्टी करतील किंवा त्यांना आव्हान देतील.

मुख्य निष्कर्ष

Claude Opus 5 प्रति टोकन किंमत तीच ठेवून कोडिंग-कार्यक्षमतेत स्पष्ट वाढ देते, ज्यामुळे सॉफ्टवेअर संबंधित कामांवर लक्ष केंद्रित करणाऱ्या डेव्हलपर्ससाठी हे एक आकर्षक अपग्रेड ठरते. जनरल रीझनिंगमध्ये ते अद्याप पूर्णतः आघाडीवर असलेल्या मॉडेलच्या एक पाऊल मागे आहे आणि त्याच्या जाहिरात केलेल्या फायद्यांची अद्याप स्वतंत्र पडताळणी होणे बाकी आहे. AI सेवांचे बजेट ठरवणाऱ्या कोणासाठीही, कोड कामावरील या मॉडेलची खर्च-कार्यक्षमता ही याकडे गांभीर्याने पाहण्याचे सर्वात ठोस कारण आहे.