AWS heeft query-bewuste compressie toegevoegd aan zijn Bedrock-service, waardoor ontwikkelaars irrelevante documentfragmenten kunnen inkorten voordat ze een taalmodel bereiken. Door het aantal tokens dat naar het model wordt verzonden te verminderen, kan deze functie de rekenkosten voor Retrieval-Augmented Generation (RAG)-pipelines verlagen.
Waarom RAG-pipelines veel geld kosten
RAG-systemen halen eerst tekstfragmenten uit een kennisbank en voeden die fragmenten vervolgens aan een generatief model om een vraag van een gebruiker te beantwoorden. De meeste implementaties sturen elk opgehaald fragment rechtstreeks naar het model, zelfs wanneer grote delen van de tekst niets met de zoekopdracht te maken hebben. Elk extra woord wordt een token, en elk token dat het model verwerkt, verhoogt de kosten van de onderliggende API. Voor kleine en middelgrote bedrijven die supportbots of interne zoektools draaien, kunnen de kosten voor tokens snel de kosten van de modeloproepen zelf overstijgen.
Wat query-bewuste compressie doet
De nieuwe Bedrock-functionaliteit voegt een filterstap toe tussen retrieval en generatie:
- Het systeem haalt nog steeds dezelfde set documenten op voor een zoekopdracht.
- Voordat het model tekst ziet, evalueert een lichtgewicht processor elk fragment op basis van de specifieke vraag.
- Alleen de delen die als relevant worden beschouwd, worden behouden; de rest wordt weggegooid als ruis.
Je hebt geen nieuwe index, een embedding-model of een fine-tuned taalmodel nodig. De wijziging bestaat simpelweg uit het herconfigureren van de pipeline om de compressielaag aan te roepen.
Impact op het bedrijfsleven
Omdat de tokenkosten stijgen naarmate er meer tekst naar het model wordt verzonden, kan het verwijderen van irrelevante fragmenten de rekening regel voor regel verkleinen. Bedrijven die hebben gezien hoe hun RAG-kosten explodeerden naarmate het gebruik toenam, zullen het grootste voordeel ervaren.
Waar je op moet letten
- Test de functie met je eigen gegevens: Voer een zij-aan-zij-test uit van een standaard RAG-flow versus een flow die query-bewuste compressie bevat. Meet het aantal tokens, de latentie en de relevantie van het antwoord.
- Transparantie van leveranciers: Vraag bij het evalueren van externe RAG-platforms of ze compressie of filtering gebruiken in hun retrieval-pipelines. Een leverancier die ruwe fragmenten verstuurt, zal waarschijnlijk hogere maandelijkse facturen genereren.
Conclusie
Een kleine aanpassing in de pipeline — het wegfilteren van irrelevante tekst voordat deze het model bereikt — kan een verborgen kostenpost veranderen in een beheersbare post. Voor organisaties die al betalen voor Bedrock-gebaseerde RAG, is het inschakelen van query-bewuste compressie een experiment met weinig inspanning, maar de uiteindelijke besparingen hangen af van je specifieke gegevens.
