Claude Code consacre les trois quarts de son budget de tokens à la simple lecture de la base de code, selon l'analyse de Red Hat portant sur 219 sessions réelles. Ce constat renverse l'idée reçue selon laquelle les agents de codage pilotés par l'IA perdent du temps à générer du code, et suggère que les développeurs devraient s'attaquer au problème de la gestion du contexte, et non pas seulement à la vitesse du modèle.

Les données derrière cette affirmation

Red Hat a examiné 219 interactions avec Claude Code d'Anthropic et a calculé l'utilisation des tokens par tour. Sur l'ensemble de l'échantillon, le tour médian a alloué 75 % des tokens à l'ingestion du code et de la documentation environnants, tandis que seulement 25 % ont servi à produire de nouvelles lignes. Comme la plupart des fournisseurs d'IA facturent les tokens d'entrée et de sortie au même tarif, la partie « lecture » de la transaction représente la majeure partie du coût.

Pourquoi le coût de lecture est crucial

Stratégie d'optimisation

De nombreuses équipes investissent des ressources dans des modèles plus rapides ou plus volumineux, espérant qu'un gain de vitesse réduira de quelques secondes chaque génération. Si les trois quarts du travail consistent simplement à intégrer du contexte, un modèle plus rapide ne permet d'économiser qu'une fraction du temps total. Le véritable levier réside dans la quantité de contexte que le modèle doit traiter à chaque tour.

Contrôle des coûts

Lorsqu'un assistant IA relit le même état du dépôt à chaque requête, les tokens d'entrée explosent. Les projets disposant de fenêtres de contexte importantes peuvent voir leurs factures augmenter de manière spectaculaire, même si la quantité de code généré reste modeste.

Priorité à l'ingénierie

Les concepteurs d'outils recherchent souvent une meilleure qualité de modèle tout en négligeant la manière dont les prompts sont construits. L'analyse suggère que l'« ingénierie du contexte » — l'élagage, la mise en cache et la synthèse du code transmis au modèle — offre un meilleur ROI que les mises à niveau incrémentales des modèles.

Étapes pratiques pour limiter la surcharge de lecture

  • Élaguer les fichiers non pertinents – Supprimez du prompt les fichiers dont la tâche actuelle n'a pas besoin. Des prompts plus courts signifient moins de tokens d'entrée.
  • Mettre en cache les lectures répétées – Stockez l'interprétation par le modèle des parties stables de la base de code et réutilisez-la au fil des tours au lieu de renvoyer le même texte.
  • Compresser les sorties d'outils – Lorsque des outils externes renvoient de gros blocs de données (par exemple, des rapports de lint), résumez-les avant de les renvoyer à Claude.
  • Utiliser des diffs incrémentaux – Envoyez uniquement les changements depuis le dernier tour plutôt que le contenu complet du fichier.

Ces tactiques visent à empêcher l'IA de relire le même instantané du dépôt à chaque interaction, réduisant ainsi à la fois la latence et le coût.

Contre-argument : la vitesse compte toujours

Certains développeurs soutiennent qu'un modèle plus rapide reste important car il réduit la latence des 25 % de tokens qui sont générés. Dans les environnements sensibles à la latence — comme les plugins d'IDE qui doivent répondre instantanément — chaque milliseconde compte. Le profil dominé par la lecture n'élimine pas l'avantage d'un modèle plus rapide ; il réduit simplement son impact relatif.

À surveiller par la suite

L'étude de Red Hat est basée sur un ensemble limité de sessions, ainsi qu'un échantillonnage plus large pourrait révéler des distributions de tokens différentes pour d'autres langages ou tailles de projets. Si les données futures confirment le chiffre de 75 % de lecture, nous pourrions voir une évolution vers des outils qui élaguent et mettent en cache le contexte automatiquement, ou même vers des architectures de modèles optimisées pour une ingestion rapide du contexte.

À retenir : Pour le codage assisté par l'IA, le gain de performance le moins coûteux consiste à donner moins d'informations au modèle, et non à le faire écrire plus vite. Les chiffres de Red Hat sont sans appel : élaguez, mettez en cache et résumez vos prompts, et vous verrez des économies tangibles en temps et en argent.