Claude Opus 5 iliingia sokoni Julai 24, na takwimu zake kuu zinaahidi ongezeko la mara tatu kuliko mshindani wa karibu na mara mbili ya utendaji wa Opus 4.8 ya Anthropic yenyewe. Swali halisi kwa mtu yeyote anayelipia matokeo ya AI ni ikiwa uwiano huo utatafsiriwa kuwa faida zinazoonekana bila kuongeza bei.

Kwa nini takwimu hizi ni muhimu

Waendelezaji wanajali zaidi alama ya SWE-bench Pro, kipimo kinachofanyia modeli majaribio dhidi ya matatizo halisi ya GitHub ili kuona jinsi inavyoweza kurekebisha kodi. Opus 5 ilifikia 79.2 %, wakati Opus 4.8 ilifanikiwa kufikia 69.2 %—ongezeko la alama kumi ndani ya miezi miwili tu. Anthropic iliweka bei ya kila token bila mabadiliko, hivyo watumiaji wanapata msaidizi wa kodi mwenye akili zaidi kwa gharama ileile.

Ikiwa uwiano huo utadumu katika vipimo vingine, hadithi ya gharama na utendaji inaweza kubadilisha jinsi makampuni yanavyochagua mifumo ya lugha kwa kazi nyingi za kodi.

Jinsi Opus 5 inavyofanya katika vipimo muhimu

  • SWE-bench Pro – 79.2 % dhidi ya 69.2 % (Opus 4.8). Bei ileile ya token, kiwango cha juu cha mafanikio katika kurekebisha hitilafu za ulimwengu halisi.
  • CursorBench 3.2 – Opus 5 inakaribia kiongozi Fable 5 kwa takriban 0.5 % katika kasi ya kukamilisha kazi, lakini inagharimu takriban nusu ya kiasi hicho kwa kila kazi.
  • ARC-AGI-3 – Opus 5 inapata 30.2, wakati mshindani wa pili anasalia nyuma kwa 7.8. Pengo ni kubwa, likiashiria kuwa Opus 5 inashughulikia matatizo ya kufikiri kwa kina (abstract reasoning) vizuri zaidi kuliko mifumo mingine ya sasa.
  • General Reasoning – Ushindani ni mkali zaidi. GPT-5.6 Sol inaongoza kwa wastani wa 92.5, ikimzidi Opus 5 iliyopata 90.4. Hapa Opus 5 ina ushindani lakini si mtawala.

Takwimu hizi zinatoa picha yenye maelezo ya kina: Opus 5 inafanya vizuri sana katika vipimo vinavyohusiana na kodi na baadhi ya vipimo vya kufikiri, lakini bado inashindwa na mfumo bora zaidi wa General Reasoning.

Kuchambua kwa kina

Vipimo vya benchmark vinaweza kupotosha ikiwa masharti ya majaribio hayajajulikana wazi. Mambo manne yanasaidia kutofautisha ukweli na sifa za juu:

  1. Kiwango cha juhudi – Je, modeli ilitumika kwa juhudi ndogo, za kawaida, au za juu zaidi? Juhudi kubwa zinaweza kuongeza alama lakini pia huongeza ucheleweshaji (latency) na gharama.
  2. Idadi ya majaribio – Majaribio ya mara moja yanaweza kuonyesha matokeo ya bahati mbaya. Majaribio ya mara kwa mara (matano au zaidi) hutoa picha thabiti zaidi.
  3. Chanzo – Vipimo vinavyotolewa na wauzaji ni muhimu kwa msingi lakini vinapaswa kuthibitishwa na maabara huru.
  4. Msingi wa ulinganishi – Je, 'mfumo unaofu