Claude Opus 5 est arrivé sur le marché le 24 juillet, et ses chiffres phares promettent une performance trois fois supérieure à celle de son rival le plus proche et le double de celle de l'Opus 4.8 d'Anthropic. La véritable question pour quiconque paie pour des résultats d'IA est de savoir si ces ratios se traduisent par des gains tangibles sans augmenter le prix.

Pourquoi ces chiffres sont importants

Les développeurs s'intéressent principalement au score SWE-bench Pro, un benchmark qui teste un modèle sur des problèmes GitHub réels pour voir sa capacité à corriger du code. Opus 5 a atteint 79,2 %, tandis qu'Opus 4.8 affichait 69,2 % — une hausse de dix points en seulement deux mois. Anthropic a maintenu le prix par token inchangé, les utilisateurs bénéficient donc d'un assistant de codage nettement plus intelligent pour le même coût.

Si les ratios annoncés se confirment lors d'autres tests, l'équation coût-performance pourrait transformer la manière dont les entreprises choisissent leurs modèles de langage pour les charges de travail intensives en code.

Comment Opus 5 se compare sur les tests clés

  • SWE-bench Pro – 79,2 % contre 69,2 % (Opus 4.8). Même prix par token, taux de réussite plus élevé sur la correction de bugs en conditions réelles.
  • CursorBench 3.2 – Opus 5 se situe à moins de 0,5 % du leader Fable 5 en termes de vitesse d'exécution des tâches, tout en coûtant environ la moitié par tâche.
  • ARC-AGI-3 – Opus 5 obtient un score de 30,2, tandis que le second est à la traîne avec 7,8. L'écart est frappant, ce qui suggère qu'Opus 5 gère les problèmes de raisonnement abstrait bien mieux que la plupart de ses contemporains.
  • Raisonnement général – La compétition est plus serrée. GPT-5.6 Sol mène avec une moyenne de 92,5, devançant légèrement les 90,4 d'Opus 5. Ici, Opus 5 est compétitif mais pas dominant.

Ces chiffres brossent un tableau nuancé : Opus 5 excelle dans le code et certains benchmarks de raisonnement, mais reste en retrait par rapport au meilleur modèle de raisonnement général.

Lire entre les lignes

Les chiffres des benchmarks peuvent être trompeurs si les conditions de test ne sont pas claires. Quatre points permettent de distinguer le signal du battage médiatique :

  1. Niveau d'effort – Le modèle a-t-il été exécuté avec un effort faible, par défaut ou maximal ? Un effort plus élevé peut booster les scores, mais augmente aussi la latence et le coût.
  2. Nombre d'essais – Des exécutions uniques peuvent capturer des cas isolés dus à la chance. Des essais répétés (cinq ou plus) offrent une vision plus stable.
  3. Source – Les benchmarks fournis par le fournisseur sont utiles pour établir une base, mais devraient être corroborés par des laboratoires indépendants.
  4. Référence de comparaison – Le « modèle suivant » est-il toujours le leader actuel, ou un nouveau concurrent est-il entré sur le terrain depuis la réalisation du test ?

Enjeux pour les utilisateurs et les concurrents

Les entreprises qui exploitent des pipelines de revue de code à grande échelle peuvent gagner des heures sur les cycles de débogage et réduire leurs factures de calcul cloud grâce à une hausse de dix points sur SWE-bench Pro, tout en conservant le même prix par token. Les équipes plus restreintes bénéficient d'un assistant plus performant sans avoir à augmenter leurs budgets.

Les scores serrés en raisonnement général rappellent aux développeurs qu'Opus 5 n'est pas un remplacement universel pour le meilleur modèle polyvalent actuel.

À surveiller ensuite

  • Publication de benchmarks indépendants – Des laboratoires tiers testeront bientôt Opus 5 avec la même suite de tests à différents niveaux d'effort. Leurs conclusions confirmeront ou contesteront les affirmations d'Anthropic.

L'essentiel à retenir

Claude Opus 5 offre un gain de performance clair en codage au même prix par token, ce qui en fait une mise à niveau attrayante pour les développeurs concentrés sur les tâches logicielles. Il reste un cran en dessous du leader incontesté en raisonnement général, et ses avantages annoncés nécessitent encore une vérification indépendante. Pour quiconque budgétise des services d'IA, la rentabilité du modèle pour le travail sur le code est la raison la plus concrète de l'examiner de près.