AWS ha añadido compresión sensible a la consulta a su servicio Bedrock, lo que permite a los desarrolladores recortar fragmentos de documentos irrelevantes antes de que lleguen a un modelo de lenguaje. Al reducir los tokens que viajan al modelo, esta función puede disminuir la factura de computación para los pipelines de Generación Aumentada por Recuperación (RAG).

Por qué los pipelines de RAG consumen tanto dinero

Los sistemas RAG primero extraen pasajes de texto de una base de conocimientos y luego alimentan esos pasajes a un modelo generativo para responder a la pregunta de un usuario. La mayoría de las implementaciones envían cada fragmento recuperado directamente al modelo, incluso cuando gran parte del texto no tiene nada que ver con la consulta. Cada palabra adicional se convierte en un token, y cada token que el modelo procesa aumenta el cargo en la API subyacente. Para las empresas pequeñas y medianas que ejecutan bots de soporte o herramientas de búsqueda interna, el gasto en tokens puede eclipsar rápidamente el costo de las llamadas al modelo en sí.

Qué hace la compresión sensible a la consulta

La nueva capacidad de Bedrock inserta un paso de filtrado entre la recuperación y la generación:

  • El sistema sigue extrayendo el mismo conjunto de documentos para una consulta.
  • Antes de que el modelo vea cualquier texto, un procesador ligero evalúa cada pasaje en relación con la pregunta específica.
  • Solo se conservan las partes consideradas relevantes; todo lo demás se descarta como ruido.

No necesita un nuevo índice, un modelo de embedding o un modelo de lenguaje ajustado (fine-tuned). El cambio consiste simplemente en reconfigurar el pipeline para invocar la capa de compresión.

Impacto empresarial

Debido a que las tarifas de los tokens aumentan con la cantidad de texto enviado al modelo, eliminar los fragmentos irrelevantes puede reducir la factura línea por línea. Las empresas que han visto cómo sus costos de RAG se disparan a medida que el uso escala verán el mayor beneficio.

Qué observar a continuación

  • Pruebe la función con sus propios datos: Realice una prueba comparativa de un flujo RAG estándar frente a uno que incluya compresión sensible a la consulta. Mida el recuento de tokens, la latencia y la relevancia de la respuesta.
  • Transparencia del proveedor: Al evaluar plataformas de RAG de terceros, pregunte si emplean compresión o filtrado en sus pipelines de recuperación. Un proveedor que envíe fragmentos sin procesar probablemente generará facturas mensuales más altas.

En conclusión

Un pequeño ajuste en el pipeline —filtrar el texto irrelevante antes de que llegue al modelo— puede convertir un gasto oculto en una partida controlable. Para las organizaciones que ya pagan por RAG basado en Bedrock, habilitar la compresión sensible a la consulta es un experimento de bajo esfuerzo, pero cualquier ahorro dependerá de sus datos específicos.