AWS ha aggiunto la compressione query-aware al suo servizio Bedrock, consentendo agli sviluppatori di eliminare i frammenti di documento irrilevanti prima che raggiungano un modello linguistico. Riducendo i token che vengono inviati al modello, questa funzionalità può abbassare i costi di calcolo per le pipeline di Retrieval-Augmented Generation (RAG).
Perché le pipeline RAG consumano budget
I sistemi RAG estraggono prima passaggi di testo da una base di conoscenza e poi forniscono tali passaggi a un modello generativo per rispondere alla domanda di un utente. La maggior parte delle implementazioni invia ogni frammento recuperato direttamente al modello, anche quando ampie porzioni del testo non hanno nulla a che fare con la query. Ogni parola extra diventa un token, e ogni token elaborato dal modello aumenta l'addebito sull'API sottostante. Per le piccole e medie imprese che gestiscono bot di supporto o strumenti di ricerca interna, la spesa in token può rapidamente superare il costo delle chiamate al modello stesso.
Cosa fa la compressione query-aware
La nuova funzionalità di Bedrock inserisce un passaggio di filtraggio tra il recupero (retrieval) e la generazione:
- Il sistema estrae comunque lo stesso set di documenti per una query.
- Prima che il modello veda qualsiasi testo, un processore leggero valuta ogni passaggio rispetto alla domanda specifica.
- Vengono mantenute solo le parti giudicate rilevanti; tutto il resto viene scartato come rumore.
Non è necessario un nuovo indice, un modello di embedding o un modello linguistico fine-tuned. La modifica consiste semplicemente nel riconfigurare la pipeline per invocare lo strato di compressione.
Impatto sul business
Poiché le tariffe dei token aumentano con la quantità di testo inviata al modello, rimuovere gli snippet irrilevanti può ridurre la fattura riga per riga. Le aziende che hanno visto i propri costi RAG lievitare con l'aumentare dell'utilizzo trarranno i maggiori benefici.
Prossimi passi
- Testare la funzionalità sui propri dati: Eseguire un test comparativo tra un flusso RAG standard e uno che include la compressione query-aware. Misurare il numero di token, la latenza e la rilevanza della risposta.
- Trasparenza del fornitore: Quando si valutano piattaforme RAG di terze parti, chiedere se utilizzano la compressione o il filtraggio nelle loro pipeline di recupero. Un fornitore che invia frammenti grezzi genererà probabilmente fatture mensili più elevate.
In sintesi
Una modesta modifica alla pipeline — filtrare il testo irrilevante prima che raggiunga il modello — può trasformare una spesa nascosta in una voce di costo controllabile. Per le organizzazioni che già pagano per RAG basato su Bedrock, abilitare la compressione query-aware è un esperimento a basso sforzo, ma i risparmi dipenderanno dai dati specifici.
