Amazon Bedrock ahora permite a los desarrolladores almacenar en caché partes de un prompt, reduciendo las facturas por uso de tokens hasta en un 90 % y disminuyendo la latencia de respuesta hasta un 85 % para aplicaciones que reutilizan un prefijo de prompt estático.

Por qué es importante este cambio

Ejecutar modelos de lenguaje de gran tamaño bajo demanda tiene un coste cada vez que se envían tokens al modelo. Los chatbots, los asistentes de código y las herramientas de búsqueda de documentos suelen reenviar las mismas instrucciones del sistema o el mismo material de referencia, lo que infla el gasto y ralentiza las respuestas.

Cómo funciona el almacenamiento en caché de prompts

Bedrock añade una etiqueta (flag) de "cacheable" que los desarrolladores pueden adjuntar a cualquier segmento de un prompt; normalmente, instrucciones a nivel de sistema, documentos de contexto extensos o definiciones de herramientas que no cambian durante una sesión. Cuando llega una solicitud, Bedrock comprueba si el segmento marcado coincide con una entrada almacenada. Si es así, el servicio omite la re-codificación y la re-ejecución de esa parte a través del modelo y, en su lugar, extrae la representación precalculada desde la caché.

Las cifras

  • Coste de tokens de entrada: reducción de hasta un 90 % porque el prefijo en caché ya no consume tokens en cada llamada.
  • Latencia: hasta un 85 % más rápida, ya que se evita el procesamiento pesado del modelo para la parte estática.

Escenarios ideales

Esta función destaca cuando el prompt contiene un bloque grande e invariable seguido de una consulta de usuario corta y variable. Los patrones comunes incluyen:

  • Pipelines de generación aumentada por recuperación (RAG) que anteponen un documento recuperado a cada consulta.
  • Bots de atención al cliente que siempre comienzan con la misma declaración de política o texto de configuración de tono.
  • Asistentes de programación que cargan una definición fija de herramientas de lenguaje antes del fragmento de código del desarrollador.

Qué deben cambiar los desarrolladores

Los desarrolladores deben reordenar el prompt para que el contenido estático se sitúe al principio de todo y se mantenga idéntico byte por byte en todas las llamadas. La entrada variable del usuario sigue al prefijo en caché. No es necesario cambiar de modelo; los mismos endpoints de Bedrock gestionan la solicitud.

Quién se beneficia y quién debe tener cuidado

La ventaja se aplica únicamente a las cargas de trabajo en las que el prefijo se mantiene realmente estático. Las aplicaciones que personalizan las instrucciones del sistema por usuario o que alteran el contexto con frecuencia verán pocos beneficios y deberán sopesar la complejidad adicional del prompt frente a las ganancias modestas.

En resumen: El almacenamiento en caché de prompts ofrece a los usuarios de Bedrock una palanca directa para reducir los costes operativos de la IA y mejorar los tiempos de respuesta, siempre que sus aplicaciones puedan aislar un prefijo de prompt reutilizable.