Votre agent alimenté par un LLM peut fonctionner parfaitement lors d'une démo, puis ralentir et faire exploser sa facture après seulement quelques échanges. Le coupable caché n'est pas un modèle instable — c'est la dérive de jetons (token drift), l'inflation progressive du prompt que le modèle doit traiter à chaque fois.

La dérive de jetons se produit lorsque chaque interaction ajoute du texte au contexte d'entrée du modèle. L'historique de la conversation, les schémas d'outils, les réponses d'API et les documents récupérés s'accumulent, de sorte que chaque appel suivant transporte une charge utile plus importante. Comme le temps de traitement et le prix du modèle augmentent avec le nombre de jetons d'entrée, le coût grimpe de manière quadratique plutôt que linéaire.

Pourquoi le problème apparaît en production, pas en démo

Les déploiements réels conservent tout : chaque intervention de l'utilisateur, chaque sortie d'outil, chaque fragment de connaissance récupéré. L'accumulation reste invisible jusqu'à ce que la latence explose et que la facture arrive.

Sources courantes de dérive de jetons

  • Transcriptions répétées – Conserver tous les anciens messages dans le prompt au lieu de les résumer ou de les supprimer.
  • Schémas d'outils lourds – Envoyer de grandes définitions JSON des capacités des outils à chaque tour.
  • Résultats d'outils volumineux – Inclure des réponses d'API complètes ou des lignes de base de données contenant plus de données que l'agent n'en a réellement besoin.
  • Gonflement du RAG – La génération augmentée par récupération (RAG) qui ajoute de nombreux fragments de documents, dont certains sont obsolètes ou non pertinents.
  • Mémoire dupliquée – Regrouper un résumé, un objet d'état et la transcription brute, ce qui répète la même information trois fois.

Chacun de ces éléments ajoute des jetons qui ne contribuent pas à une nouvelle capacité de raisonnement, mais qui gonflent la taille du prompt.

Comment maîtriser le budget de jetons

1. Adopter une conception de contexte par couches

  • Instructions stables – Gardez les prompts système et les règles de sécurité en haut et référez-vous à eux plutôt que de les renvoyer à chaque tour.
  • État structuré – Stockez une représentation compacte des objectifs, des décisions et des identifiants que l'agent peut lire rapidement.
  • Historique compressé – Résumez les tours plus anciens dans un court paragraphe lisible par l'homme, en ne le mettant à jour que lorsqu'un seuil est atteint.
  • Tours récents – Incluez les derniers messages textuellement pour préserver la continuité.

Séparer le texte constant du contenu résumable vous évite de renvoyer les mêmes mots encore et encore.

2. Élaguez les sorties d'outils

  • Extrayez uniquement les champs que l'agent utilise réellement ; supprimez les descriptions verbeuses.
  • Remplacez les résultats volumineux par un résumé concis ou un identifiant de référence, et stockez la charge utile complète dans une base de données, un cache ou un stockage de type blob.
  • Lorsqu'un outil renvoie une liste, n'envoyez que les N premiers éléments importants pour la décision en cours.

3. Appliquez une synthèse intelligente

  • Ne résumez pas après chaque tour ; le traitement supplémentaire ajoute une surcharge.
  • Actualisez le résumé uniquement lorsque le nombre de jetons accumulés des tours plus anciens dépasse une limite prédéfinie.
  • Conservez les faits critiques — identifiants, montants, horodatages — dans un stockage structuré plutôt que de les intégrer dans la prose, afin que le résumé reste court.

4. Suivez les bonnes métriques

  • Journalisez l'utilisation des jetons par appel de modèle, et pas seulement par requête utilisateur. Cela révèle la croissance cachée du côté des entrées.
  • Surveillez le nombre de jetons d'entrée ajoutés à chaque tour ; un bond soudain indique une source de dérive.
  • Séparez les jetons mis en cache (réutilisés lors d'appels précédents) des jetons nouvellement générés ; seuls les premiers sont responsables de la dérive.

Considérez le prompt comme une ressource finie, et non comme une transcription infinie. En mesurant, en résumant et en élaguant délibérément, vous maintenez votre agent LLM rapide, abordable et prêt pour une mise à l'échelle en production.

À retenir : La dérive de jetons augmente silencieusement les coûts et ralentit les agents. Identifiez les parties croissantes de votre prompt, compressez-les ou externalisez-les, et surveillez l'utilisation des jetons par appel. Une approche disciplinée transforme les chocs de facturation imprévisibles en une opération gérable et respectueuse du budget.