AWS hat seinem Bedrock-Service eine abfragespezifische Kompression hinzugefügt, die es Entwicklern ermöglicht, irrelevante Dokumentenabschnitte zu kürzen, bevor sie ein Sprachmodell erreichen. Durch das Reduzieren der Token, die an das Modell gesendet werden, kann diese Funktion die Rechenkosten für Retrieval-Augmented Generation (RAG)-Pipelines senken.

Warum RAG-Pipelines hohe Kosten verursachen

RAG-Systeme extrahieren zunächst Textpassagen aus einer Wissensdatenbank und speisen diese Passagen dann in ein generatives Modell ein, um die Frage eines Benutzers zu beantworten. Die meisten Implementierungen senden jeden abgerufenen Chunk direkt an das Modell, selbst wenn große Teile des Textes nichts mit der Abfrage zu tun haben. Jedes zusätzliche Wort wird zu einem Token, und jedes Token, das das Modell verarbeitet, erhöht die Kosten der zugrunde liegenden API. Für kleine und mittelständische Unternehmen, die Support-Bots oder interne Suchwerkzeuge betreiben, können die Token-Ausgaben schnell die Kosten der Modellaufrufe selbst übersteigen.

Was abfragespezifische Kompression bewirkt

Die neue Bedrock-Funktion fügt einen Filterschritt zwischen dem Retrieval und der Generierung ein:

  • Das System ruft für eine Abfrage weiterhin denselben Satz an Dokumenten ab.
  • Bevor das Modell Text sieht, bewertet ein leichtgewichtiger Prozessor jede Passage im Hinblick auf die spezifische Frage.
  • Nur die als relevant eingestuften Teile werden beibehalten; alles andere wird als Rauschen verworfen.

Sie benötigen keinen neuen Index, kein Embedding-Modell und kein feinabgestimmtes Sprachmodell. Die Änderung besteht lediglich darin, die Pipeline so umzustrukturieren, dass die Kompressionsschicht aufgerufen wird.

Geschäftliche Auswirkungen

Da die Token-Gebühren mit der Menge des an das Modell gesendeten Textes steigen, kann das Entfernen irrelevanter Textfragmente die Rechnung schrittweise reduzieren. Unternehmen, die erlebt haben, wie ihre RAG-Kosten mit steigender Nutzung explodiert sind, werden den größten Nutzen ziehen.

Worauf Sie als Nächstes achten sollten

  • Testen Sie die Funktion mit Ihren eigenen Daten: Führen Sie einen Vergleichstest zwischen einem Standard-RAG-Flow und einem Flow durch, der abfragespezifische Kompression enthält. Messen Sie die Token-Anzahl, die Latenz und die Relevanz der Antworten.
  • Transparenz der Anbieter: Fragen Sie bei der Bewertung von RAG-Plattformen von Drittanbietern nach, ob diese Kompression oder Filterung in ihren Retrieval-Pipelines einsetzen. Ein Anbieter, der Roh-Chunks liefert, wird wahrscheinlich höhere monatliche Rechnungen erstellen.

Fazit

Eine kleine Anpassung der Pipeline – das Herausfiltern von irrelevantem Text, bevor er das Modell erreicht – kann eine versteckte Ausgabe in einen kontrollierbaren Kostenpunkt verwandeln. Für Unternehmen, die bereits für Bedrock-basiertes RAG bezahlen, ist die Aktivierung der abfragespezifischen Kompression ein Experiment mit geringem Aufwand, wobei die tatsächlichen Einsparungen von Ihren spezifischen Daten abhängen werden.