Claude Opus 5 kwam op 24 juli op de markt, en de belangrijkste cijfers beloven een drievoudige sprong ten opzichte van de dichtstbijzijnde concurrent en een verdubbeling van de prestaties van Anthropic's eigen Opus 4.8. De echte vraag voor iedereen die betaalt voor AI-output is of die verhoudingen zich vertalen in tastbare verbeteringen zonder de prijs te verhogen.

Waarom de cijfers ertoe doen

Ontwikkelaars geven de meeste waarde aan de SWE-bench Pro-score, een benchmark die een model test tegen echte GitHub-issues om te zien hoe goed het code kan repareren. Opus 5 behaalde 79,2%, terwijl Opus 4.8 op 69,2% uitkwam — een stijging van tien punten in slechts twee maanden. Anthropic heeft de prijs per token ongewijzigd gelaten, waardoor gebruikers een aanzienlijk slimmere programmeerassistent krijgen voor dezelfde kosten.

Als de belangrijkste verhoudingen standhouden in andere tests, zou de verhouding tussen kosten en prestaties de manier waarop bedrijven taalsmodellen kiezen voor code-intensieve workloads kunnen hervormen.

Hoe Opus 5 presteert op belangrijke tests

  • SWE-bench Pro – 79,2% vs 69,2% (Opus 4.8). Dezelfde tokenprijs, hoger succespercentage bij het oplossen van echte bugs.
  • CursorBench 3.2 – Opus 5 zit binnen 0,5% van de leidende Fable 5 wat betreft taakvoltooiingssnelheid, maar kost echter ongeveer de helft per taak.
  • ARC-AGI-3 – Opus 5 scoort 30,2, terwijl de nummer twee achterblijft op 7,8. De kloof is groot, wat suggereert dat Opus 5 abstracte redeneerproblemen veel beter aanpakt dan de meeste tijdgenoten.
  • Algemeen redeneren – Het veld is nauwer. GPT-5.6 Sol leidt met een gemiddelde van 92,5, net boven de 90,4 van Opus 5. Hier is Opus 5 competitief, maar niet dominant.

Deze cijfers schetsen een genuanceerd beeld: Opus 5 blinkt uit in code-gerelateerde en bepaalde redeneer-benchmarks, maar blijft nog achter bij het beste algemene redeneermodel.

Tussen de regels door lezen

Benchmarkcijfers kunnen misleidend zijn als de testomstandigheden niet duidelijk zijn. Vier controles helpen om het onderscheid te maken tussen feiten en hype:

  1. Inzetniveau – Werd het model uitgevoerd met een laag, standaard of maximaal inzetniveau? Een hoger inzetniveau kan de scores verbeteren, maar verhoogt ook de latentie en de kosten.
  2. Aantal tests – Enkele runs kunnen toevallige uitschieters vastleggen. Herhaalde tests (vijf of meer) geven een stabieler beeld.
  3. Bron – Door leveranciers verstrekte benchmarks zijn nuttig als basislijn, maar zouden moeten worden bevestigd door onafhankelijke laboratoria.
  4. Vergelijkingsbasis – Is het "volgende model" nog steeds de huidige leider, of is er sinds de test een nieuwere concurrent bijgekomen?

Belangen voor gebruikers en concurrenten

Bedrijven die grootschalige code-review-pipelines draaien, kunnen uren besparen op debugging-cycli en de kosten voor cloudcomputing verlagen met een stijging van tien punten op SWE-bench Pro bij ongewijzigde tokenprijzen. Kleinere teams krijgen een krachtiger assistent zonder dat hun budgetten omhoog moeten.

De krappe scores voor algemeen redeneren herinneren ontwikkelaars eraan dat Opus 5 geen volledige vervanging is voor het huidige beste allround model.

Waar we op moeten letten

  • Onafhankelijke benchmark-publicaties – Onafhankelijke laboratoria zullen Opus 5 binnenkort testen tegen dezelfde suite op verschillende inzetniveaus. Hun bevindingen zullen de claims van Anthropic bevestigen of tegenspreken.

Conclusie

Claude Opus 5 levert een duidelijke verbetering in programmeerprestaties tegen dezelfde tokenprijs, wat het een aantrekkelijke upgrade maakt voor ontwikkelaars die zich richten op softwaretaken. Het blijft een stap achter de absolute leider in algemeen redeneren, en de geadverteerde voordelen moeten nog onafhankelijk worden geverifieerd. Voor iedereen die budgetteert voor AI-diensten, is de kostenefficiëntie van het model bij code-werkzaamheden de meest concrete reden om het serieus te overwegen.