Le nouveau header bêta d'Anthropic réduit le coût en tokens des appels d'outils d'environ 14 % pour Claude 3.7 Sonnet, offrant aux agents IA une réduction modeste de leurs factures mensuelles et un léger avantage en termes de latence.
Pourquoi l'utilisation d'outils consomme des tokens
Chaque interaction d'un agent avec Claude implique trois étapes basées sur les tokens :
- Définitions d'outils – les noms et les schémas JSON que vous envoyez dans le prompt.
- Appels d'outils – la sortie structurée que le modèle génère lorsqu'il décide d'invoquer un outil.
- Résultats d'outils – les données que votre code renvoie au modèle.
Les première et troisième étapes sont des tokens d'entrée (input) ; la deuxième étape concerne les tokens de sortie (output). Comme Claude facture davantage la sortie que l'entrée, réduire les tokens de sortie peut abaisser les coûts, même si le nombre total de tokens reste similaire.
Le header bêta
Anthropic a annoncé une fonctionnalité bêta nommée token-efficient tool use. L'ajout du header HTTP
anthropic-beta: token-efficient-tools-2025-02-19
active l'optimisation, mais uniquement lorsque la requête cible Claude 3.7 Sonnet. Si le header est envoyé à un autre modèle, la requête se poursuit sans changement ; le header est ignoré sans erreur.
L'optimisation fonctionne en compressant la sortie des appels d'outils du modèle, réduisant d'environ 14 % le nombre de tokens de sortie pour cette étape.
Ce que vous économisez réellement
Les tokens de sortie sont plus coûteux que les tokens d'entrée, donc une réduction de 14 % sur cette part ne se traduit pas par une baisse proportionnelle de la facture totale. Dans une boucle d'agent typique en quatre étapes, les définitions d'outils dominent souvent les coûts d'entrée, dépassant parfois la moitié des tokens utilisés. Dans ces conditions, l'économie de 14 % sur les tokens de sortie ne produit généralement qu'une réduction d'environ 3 % de la charge totale.
Le chiffre d'économie annoncé semble donc modeste, mais ce changement ne coûte rien de plus et apporte un léger gain de latence : moins de tokens de sortie signifient que le modèle termine la génération un peu plus rapidement.
Des économies plus importantes nécessitent d'autres tactiques
Si l'objectif est de réduire significativement les dépenses, le header seul ne suffira pas. Trois leviers pratiques permettent d'obtenir des gains plus importants :
- Mise en cache du prompt (Prompt caching) – stockez les définitions d'outils une seule fois et réutilisez la version mise en cache lors des appels suivants. Les lectures en cache sont facturées à un tarif inférieur aux tokens d'entrée frais.
- Réduisez le jeu d'outils – n'incluez que les outils essentiels à la tâche en cours. Chaque outil supplémentaire ajoute sa définition à chaque requête, gonflant ainsi les coûts d'entrée.
- Allégez les résultats d'outils – ne renvoyez que les champs dont le modèle a réellement besoin. Les réponses API volumineuses réinjectées dans la conversation gonflent à la fois les tokens d'entrée et l'historique de la conversation.
L'application de ces pratiques peut réduire une part notable de la dépense totale, bien au-delà des 3 % que vous obtiendriez avec la seule version bêta.
À surveiller
Anthropic n'a pas indiqué quand — ou si — le mode "token-efficient" passera du statut de bêta à celui de fonctionnalité par défaut. Les développeurs devraient surveiller les futures annonces qui pourraient étendre la prise en charge au-delà de Claude 3.7 Sonnet ou introduire des techniques de compression de tokens plus poussées. Le suivi de la répartition des tokens par requête aidera également à quantifier l'impact réel à mesure que les modèles d'utilisation évoluent.
L'essentiel
Le header bêta est un ajustement gratuit et simple qui réduit les tokens de sortie des appels d'outils d'environ 14 %, offrant une légère baisse de facture et un petit gain de vitesse. Pour quiconque lutte déjà contre des coûts d'agents élevés, ce header est un ajout utile, mais les véritables économies proviendront de la mise en cache des prompts, de la limitation de l'exposition des outils et du renvoi de résultats plus légers.
Source : https://dev.to/multigrid/token-efficient-tool-use-in-the-claude-api-3j0l
