A AWS adicionou compressão sensível à consulta (query-aware compression) ao seu serviço Bedrock, permitindo que desenvolvedores reduzam trechos irrelevantes de documentos antes que eles cheguem a um modelo de linguagem. Ao reduzir os tokens que viajam até o modelo, o recurso pode diminuir a conta de computação para pipelines de Geração Aumentada de Recuperação (RAG).

Por que os pipelines de RAG consomem tanto dinheiro

Os sistemas RAG primeiro extraem passagens de texto de uma base de conhecimento e, em seguida, alimentam essas passagens em um modelo generativo para responder à pergunta de um usuário. A maioria das implementações envia cada trecho recuperado diretamente para o modelo, mesmo quando grandes partes do texto não têm nada a ver com a consulta. Cada palavra extra torna-se um token, e cada token que o modelo processa aumenta a cobrança na API subjacente. Para pequenas e médias empresas que operam bots de suporte ou ferramentas de busca interna, o gasto com tokens pode rapidamente eclipsar o custo das próprias chamadas ao modelo.

O que a compressão sensível à consulta faz

A nova capacidade do Bedrock insere uma etapa de filtragem entre a recuperação e a geração:

  • O sistema ainda extrai o mesmo conjunto de documentos para uma consulta.
  • Antes que o modelo veja qualquer texto, um processador leve avalia cada passagem em relação à pergunta específica.
  • Apenas as partes consideradas relevantes são mantidas; todo o resto é descartado como ruído.

Você não precisa de um novo índice, de um modelo de embedding ou de um modelo de linguagem ajustado. A mudança é simplesmente reconfigurar o pipeline para invocar a camada de compressão.

Impacto nos negócios

Como as taxas de tokens aumentam com a quantidade de texto enviada ao modelo, a remoção de trechos irrelevantes pode reduzir a conta linha por linha. Empresas que viram seus custos de RAG dispararem conforme o uso escala verão o maior benefício.

O que observar a seguir

  • Teste o recurso com seus próprios dados: Realize um teste comparativo entre um fluxo RAG padrão e um que inclua a compressão sensível à consulta. Meça a contagem de tokens, a latência e a relevância da resposta.
  • Transparência do fornecedor: Ao avaliar plataformas RAG de terceiros, pergunte se elas utilizam compressão ou filtragem em seus pipelines de recuperação. Um fornecedor que envia trechos brutos provavelmente gerará faturas mensais mais altas.

Resumo

Um pequeno ajuste no pipeline — filtrar o texto irrelevante antes que ele chegue ao modelo — pode transformar uma despesa oculta em um item de custo controlável. Para organizações que já pagam por RAG baseado em Bedrock, habilitar a compressão sensível à consulta é um experimento de baixo esforço, mas qualquer economia dependerá de seus dados específicos.