Le journal de mémoire d'un agent LLM en production est passé d'un fichier de 2 Ko à 29 446 octets, faisant grimper le nombre de tokens lus par l'agent d'environ 500 à 7 360 par exécution — une dépense cachée qui est apparue sans aucune alerte sur le tableau de bord de surveillance. Le développeur à l'origine de l'agent affirme que cette hausse silencieuse du coût de lecture est un exemple concret de « dérive des coûts de l'agent » (agent cost drift), un problème qui peut éroder les budgets même lorsque le système semble fonctionner normalement.

Qu'est-ce que la dérive des coûts de l'agent ?

La dérive des coûts de l'agent décrit l'augmentation progressive du coût de calcul des opérations de routine d'un agent IA, causée par la croissance de son propre état. Dans cet exemple, l'agent maintient un fichier de journal de travail qui enregistre les raisons pour lesquelles il a rejeté les sujets d'articles précédents. Chaque nouvelle entrée ajoute un paragraphe de raisonnement, et le fichier est lu dans son intégralité avant que l'agent ne génère un nouveau contenu. Comme le journal s'étend de manière quadratique — chaque entrée ajoutant non seulement sa propre longueur mais faisant également référence aux entrées précédentes — la quantité de texte que l'agent doit ingérer s'accélère avec le temps.

La dérive n'est ni un pic ni une défaillance ; c'est une taxe linéaire qui se cumule. L'agent produit toujours deux articles par jour et le tableau de bord n'indique aucune erreur, pourtant chaque exécution consomme désormais 7 360 tokens, contre environ 500 il y a un mois. Comme la plupart des fournisseurs de LLM facturent au token, l'augmentation du nombre de tokens par exécution se traduit directement par une hausse des coûts d'exploitation.

Pourquoi c'est important

  • Impact budgétaire – La tarification basée sur les tokens signifie que chaque token supplémentaire lu est de l'argent dépensé. Le nombre de tokens est passé de 500 à 7 360.

La mécanique cachée

Le mode de croissance du fichier est la clé. Un journal ligne par ligne qui se contenterait d'ajouter de nouvelles entrées augmenterait de manière linéaire, mais comme chaque entrée explique le raisonnement derrière les rejets précédents, la longueur du texte se cumule. Le résultat est une courbe de croissance quadratique : doubler le nombre d'entrées fait plus que doubler la taille du fichier, et le nombre de tokens nécessaires pour le traiter augmente encore plus rapidement.

Les développeurs repèrent rarement l'augmentation des coûts car chaque entrée « fait sens en soi ». Le résultat de l'agent reste correct et le journal continue de remplir sa fonction, masquant ainsi l'inefficacité.

Stratégie d'atténuation

Le développeur propose une restructuration du journal en trois parties :

  • Fichier des entrées récentes – Conserver un petit fichier lu activement qui ne contient que les dernières entrées nécessaires pour éviter les répétitions immédiates.
  • Index compact – Stocker un résumé d'une ligne pour les entrées plus anciennes. L'index peut être parcouru rapidement pour vérifier la duplication de sujets sans avoir à charger des paragraphes entiers.
  • Texte intégral archivé – Déplacer l'historique complet du raisonnement vers un fichier d'archive séparé que l'agent ne lit pas lors de son fonctionnement normal.

Cette approche préserve la capacité de l'agent à éviter la répétition de sujets tout en réduisant considérablement la charge de tokens par exécution.

Comment détecter la dérive des coûts dans vos agents

  1. Instrumenter la lecture des tokens – Enregistrer le nombre de tokens consommés par l'agent lors du chargement de son fichier de mémoire à chaque exécution.
  2. Suivre l'évolution dans le temps – Comparer le nombre de tokens d'aujourd'hui avec celui d'il y a une semaine ou un mois. Une tendance constante à la hausse signale une dérive.

Vérifier simplement que le fichier se charge toujours sans erreur est insuffisant ; vous devez mesurer le coût de ce chargement.

Ce qu'il faut surveiller ensuite

La dérive des coûts de l'agent est une taxe invisible qui peut silencieusement ronger votre budget IA. En traitant le fichier de mémoire de l'agent comme un centre de coûts — en mesurant les lectures de tokens, en surveillant les courbes de croissance et en restructurant les journaux — vous pouvez maintenir la taxe à un niveau bas et la précision des résultats élevée.

Source : https://dev.to/enjoy_kumawat/i-measured-what-my-agents-own-memory-file-costs-to-read-the-number-only-goes-up-46ob

Rejoignez la discussion : https://t.me/GyaanSetuAi