AWS ha añadido una opción de “enrutamiento consciente de prefijos” (prefix-aware routing) a Amazon SageMaker Inference, prometiendo mayores tasas de aciertos en la caché y una latencia notablemente menor para los clientes que ejecutan modelos de lenguaje de gran tamaño (LLM) en su propia infraestructura. El cambio es importante porque proporciona una latencia significativamente más baja y reduce los costes de computación de GPU.
Por qué importa la latencia de los LLM
Cuando un LLM recibe una solicitud, normalmente vuelve a computar la atención sobre todo el prompt, un paso costoso que aumenta con cada token añadido. Si el modelo puede reutilizar la caché de atención de una solicitud anterior, solo necesita procesar la nueva parte del texto. Las cargas de trabajo que envían repetidamente el mismo prompt del sistema o mantienen un historial de conversación son candidatas ideales para la reutilización de la caché.
En la configuración predeterminada de SageMaker, las solicitudes entrantes se distribuyen de forma aleatoria entre el grupo de instancias de inferencia. La distribución aleatoria significa que una solicitud que podría haber aprovechado una caché caliente (warm cache) a menudo llega a una instancia fría (cold instance), lo que obliga a una recomputación completa. El resultado es una mayor latencia y ciclos de GPU adicionales que se traducen directamente en un mayor gasto.
Cómo funciona el enrutamiento consciente de prefijos
El nuevo modo de enrutamiento mantiene un mapa ligero de los prefijos de solicitudes recientes; esencialmente, la primera parte de un prompt que tiende a permanecer constante entre las llamadas. Cuando llega una nueva solicitud, SageMaker consulta el mapa y reenvía la solicitud a una instancia que ya haya procesado el mismo prefijo. Si la instancia aún conserva la caché de atención relevante, el modelo puede omitir la mayor parte del trabajo y generar la respuesta más rápido.
Puntos clave:
- No se requieren cambios de código – la función reside enteramente en la capa del servicio de inferencia.
- Se aplica solo a modelos autoalojados – las ofertas gestionadas, como la API de OpenAI o el servicio de Anthropic, no se ven afectadas.
- Transparente para las aplicaciones – la misma URL del endpoint de SageMaker y el contrato de la API permanecen sin cambios.
Quiénes pueden beneficiarse
Las empresas que alojan LLM en SageMaker lo hacen por razones que van desde la privacidad de los datos hasta el control de costes. Para aquellos que ejecutan chatbots de soporte, asistentes de ventas o cualquier agente interactivo que utilice repetidamente un prompt del sistema fijo, este ajuste de enrutamiento puede reducir los tiempos medios de respuesta. En cuanto a los costes, cada acierto en la caché evita que la GPU tenga que reevaluar la parte compartida del prompt.
Límites y contraargumentos
El beneficio depende de la presencia de prefijos repetidos. Los prompts altamente variables —como consultas únicas o mensajes de sistema generados dinámicamente— no verán la misma ventaja de aciertos en la caché.
Debido a que la función está limitada a despliegues autoalojados, los clientes que dependen de servicios de LLM gestionados no pueden aprovecharla.
En resumen: El enrutamiento consciente de prefijos ofrece a los usuarios de SageMaker una forma sencilla y sin código de reducir la latencia en cargas de trabajo repetitivas de LLM, al tiempo que recorta los costes de GPU. Para las organizaciones que ya alojan modelos en la plataforma, la actualización es un ajuste de bajo riesgo que podría traducirse en interacciones de usuario más rápidas y facturas más bajas.
