AWS a ajouté la compression sensible à la requête à son service Bedrock, permettant aux développeurs d'élaguer les fragments de documents non pertinents avant qu'ils n'atteignent un modèle de langage. En réduisant le nombre de tokens qui transitent vers le modèle, cette fonctionnalité peut faire baisser la facture de calcul pour les pipelines de génération augmentée par récupération (RAG).

Pourquoi les pipelines RAG font exploser les coûts

Les systèmes RAG extraient d'abord des passages de texte d'une base de connaissances, puis transmettent ces passages à un modèle génératif pour répondre à la question d'un utilisateur. La plupart des implémentations envoient chaque fragment récupéré directement au modèle, même lorsque de larges portions du texte n'ont aucun rapport avec la requête. Chaque mot supplémentaire devient un token, et chaque token traité par le modèle s'ajoute aux frais de l'API sous-jacente. Pour les petites et moyennes entreprises qui exploitent des bots d'assistance ou des outils de recherche interne, les dépenses en tokens peuvent rapidement éclipser le coût des appels au modèle eux-mêmes.

Ce que fait la compression sensible à la requête

La nouvelle capacité de Bedrock insère une étape de filtrage entre la récupération et la génération :

  • Le système extrait toujours le même ensemble de documents pour une requête.
  • Avant que le modèle ne voie le texte, un processeur léger évalue chaque passage par rapport à la question spécifique.
  • Seules les parties jugées pertinentes sont conservées ; tout le reste est écarté comme étant du bruit.

Vous n'avez pas besoin d'un nouvel index, d'un modèle d'embedding ou d'un modèle de langage affiné. Le changement consiste simplement à reconfigurer le pipeline pour invoquer la couche de compression.

Impact métier

Comme les frais de tokens augmentent avec la quantité de texte envoyée au modèle, la suppression des extraits non pertinents peut réduire la facture ligne par ligne. Les entreprises qui ont vu leurs coûts RAG gonfler à mesure que leur utilisation augmente seront les plus bénéficiaires.

Ce qu'il faut surveiller ensuite

  • Pilotez la fonctionnalité sur vos propres données : Effectuez un test comparatif entre un flux RAG standard et un flux incluant la compression sensible à la requête. Mesurez le nombre de tokens, la latence et la pertinence des réponses.
  • Transparence des fournisseurs : Lors de l'évaluation de plateformes RAG tierces, demandez si elles utilisent la compression ou le filtrage dans leurs pipelines de récupération. Un fournisseur qui envoie des fragments bruts générera probablement des factures mensuelles plus élevées.

L'essentiel

Une légère modification du pipeline — filtrer le texte non pertinent avant qu'il n'atteigne le modèle — peut transformer une dépense cachée en un poste de dépense contrôlable. Pour les organisations qui paient déjà pour du RAG basé sur Bedrock, l'activation de la compression sensible à la requête est une expérience à faible effort, mais les économies réalisées dépendront de vos données spécifiques.