Claude Opus 5 coûte désormais trois fois plus cher qu'Opus 4.8 pour une charge de travail identique, bien que les deux modèles affichent le même prix par jeton. Le coupable est la fonctionnalité par défaut « adaptive thinking », qui consomme silencieusement des jetons de sortie sous forme de raisonnement caché. Désactiver cette fonctionnalité rétablit la parité des coûts sans nuire à la précision.

Pourquoi un écart de prix apparaît

Les deux versions facturent 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie. Dans nos benchmarks, la facture d'Opus 5 était 3,1 fois plus élevée que celle d'Opus 4.8 lors de l'exécution de prompts identiques. Le surcoût ne provient pas d'un prix de vente plus élevé ; il est intégré dans la manière dont Opus 5 comptabilise son processus de réflexion interne.

Ce que fait l'« adaptive thinking »

Lorsque l'« adaptive thinking » est activée, le modèle effectue un raisonnement interne supplémentaire avant de produire la réponse finale. Ce raisonnement est comptabilisé comme des jetons de sortie, même s'il n'est jamais transmis à l'utilisateur. Sur des requêtes simples, entre 42 % et 95 % des jetons de sortie facturés correspondent à ce raisonnement caché. Un simple problème d'arithmétique qui devrait produire une réponse à un seul chiffre peut donc générer des dizaines de jetons invisibles, gonflant ainsi considérablement le coût.

Cette fonctionnalité n'est pas un bug — les concepteurs de Claude l'ont conçue pour améliorer la qualité des réponses sur des tâches complexes. En pratique, le raisonnement caché offre souvent des gains de précision modestes sur des prompts difficiles, en particulier lorsque le modèle doit enchaîner plusieurs étapes ou interagir avec des outils externes.

Comment contrôler les coûts

Le modèle accepte un paramètre unique qui désactive l'« adaptive thinking » :

{
  "thinking": {"type": "disabled"}
}

L'application de ce paramètre à Opus 5 ramène son coût par tâche exactement au niveau de celui d'Opus 4.8, tandis que l'exactitude des résultats reste la même sur les charges de travail simples que nous avons testées.

Quand le désactiver

  • Extraction de données à partir de texte
  • Opérations de formatage (ex. : conversion JSON)
  • Appels en une seule étape où la réponse est une recherche directe ou un calcul trivial

Désactiver la réflexion dans ces cas élimine la « taxe de jetons cachés » et rend la facturation prévisible.

Quand le maintenir activé

  • Tâches nécessitant des chaînes logiques profondes ou un raisonnement nuancé
  • Workflows d'agents qui appellent des outils externes de manière répétée

Dans les scénarios utilisant beaucoup d'outils, l'écart de coût se réduit à environ 33 % car le modèle consacre moins de ressources au raisonnement interne lors des boucles d'appels d'outils.

Autres différences notables

  • Fenêtre de contexte : Opus 5 peut contenir jusqu'à un million de jetons, ce que nous avons vérifié en récupérant une chaîne cible placée au jeton 969 950.
  • Seuil de cache : La taille minimale du cache est tombée à 512 jetons, soit la moitié de celle d'Opus 4.8, ce qui affecte la quantité de conversation précédente que le modèle peut réutiliser sans re-tokenisation.

Ce qu'il faut surveiller ensuite

Les développeurs devraient surveiller les rapports d'utilisation pour les « reasoning tokens » (jetons de raisonnement) ou des lignes similaires indiquant que l'« adaptive thinking » est actif. À mesure que davantage d'applications adoptent Claude pour des opérations de type agent, l'arbitrage entre coût et qualité deviendra une décision d'optimisation clé. Les futures mises à jour pourraient permettre aux utilisateurs de régler la profondeur du raisonnement plutôt que d'utiliser un interrupteur tout ou rien, ce qui pourrait lisser la courbe des coûts.

À retenir : l'« adaptive thinking » par défaut d'Opus 5 gonfle l'utilisation des jetons sur les tâches faciles. Désactivez-le avec le paramètre simple ci-dessus pour égaler le coût d'Opus 4.8, et ne l'activez que lorsque le raisonnement supplémentaire justifie la dépense additionnelle.