Amazon Bedrock permet désormais aux développeurs de mettre en cache certaines parties d'un prompt, réduisant ainsi les factures liées à l'utilisation des tokens jusqu'à 90 % et diminuant la latence de réponse jusqu'à 85 % pour les applications qui réutilisent un préfixe de prompt statique.
Pourquoi ce changement est important
L'exécution de modèles de langage de grande taille (LLM) à la demande coûte de l'argent chaque fois que des tokens sont envoyés au modèle. Les chatbots, les assistants de code et les outils de recherche documentaire renvoient souvent les mêmes instructions système ou le même matériel de référence, ce qui gonfle les dépenses et ralentit les réponses.
Comment fonctionne la mise en cache des prompts
Bedrock ajoute un indicateur (flag) « cacheable » que les développeurs peuvent attacher à n'importe quel segment d'un prompt — généralement des instructions de niveau système, de longs documents de contexte ou des définitions d'outils qui ne changent jamais au cours d'une session. Lorsqu'une requête arrive, Bedrock vérifie si le segment marqué correspond à une entrée stockée. Si c'est le cas, le service évite de réencoder et de réexécuter cette partie via le modèle, et récupère plutôt la représentation précalculée depuis le cache.
Les chiffres
- Coût des tokens d'entrée : réduction allant jusqu'à 90 % car le préfixe mis en cache ne consomme plus de tokens à chaque appel.
- Latence : jusqu'à 85 % plus rapide puisque le travail de calcul intensif du modèle est évité pour la partie statique.
Scénarios d'utilisation idéaux
Cette fonctionnalité est particulièrement efficace lorsque le prompt contient un bloc important et immuable, suivi d'une requête utilisateur courte et variable. Les modèles courants incluent :
- Les pipelines de génération augmentée par récupération (RAG) qui ajoutent un document récupéré au début de chaque requête.
- Les bots de support client qui commencent toujours par la même déclaration de politique ou le même texte de définition du ton.
- Les assistants de code qui chargent une définition d'outil de langage fixe avant l'extrait du développeur.
Ce que les développeurs doivent modifier
Les développeurs doivent réorganiser le prompt afin que le contenu statique se trouve tout au début et reste identique octet par octet d'un appel à l'autre. L'entrée utilisateur variable suit le préfixe mis en cache. Aucun changement de modèle n'est nécessaire ; les mêmes points de terminaison (endpoints) Bedrock gèrent la requête.
Qui en profite, qui doit rester vigilant
L'avantage s'applique uniquement aux charges de travail où le préfixe reste réellement statique. Les applications qui personnalisent les instructions système par utilisateur ou qui modifient fréquemment le contexte ne verront que peu de bénéfices et devront évaluer la complexité supplémentaire de la gestion des prompts par rapport aux gains modestes obtenus.
En résumé : La mise en cache des prompts offre aux utilisateurs de Bedrock un levier simple pour réduire les coûts d'exploitation de l'IA et améliorer les temps de réponse, à condition que leurs applications puissent isoler un préfixe de prompt réutilisable.
