A AWS adicionou uma opção de “roteamento consciente de prefixo” (prefix-aware routing) ao Amazon SageMaker Inference, prometendo taxas de cache hit mais altas e uma latência visivelmente menor para clientes que executam grandes modelos de linguagem (LLMs) em sua própria infraestrutura. A mudança é importante porque proporciona uma latência significativamente menor e redução nos custos de computação de GPU.
Por que a latência de LLM é importante
Quando um LLM recebe uma requisição, ele normalmente recomputa a atenção sobre todo o prompt — uma etapa dispendiosa que cresce a cada token adicionado. Se o modelo puder reutilizar o cache de atenção de uma requisição anterior, ele precisará processar apenas a nova parte do texto. Cargas de trabalho que enviam repetidamente o mesmo prompt de sistema ou mantêm um histórico de conversa são candidatas ideais para a reutilização de cache.
Na configuração padrão do SageMaker, as requisições recebidas são distribuídas aleatoriamente pelo pool de instâncias de inferência. A distribuição aleatória significa que uma requisição que poderia ter atingido um cache quente frequentemente cai em uma instância fria, forçando uma recomputação completa. O resultado é uma latência maior e ciclos extras de GPU que se traduzem diretamente em gastos mais elevados.
Como funciona o roteamento consciente de prefixo
O novo modo de roteamento mantém um mapa leve dos prefixos de requisições recentes — essencialmente a primeira parte de um prompt que tende a permanecer constante entre as chamadas. Quando uma nova requisição chega, o SageMaker verifica o mapa e encaminha a requisição para uma instância que já processou o mesmo prefixo. Se a instância ainda mantiver o cache de atenção relevante, o modelo pode pular a maior parte do trabalho e gerar a resposta mais rapidamente.
Pontos principais:
- Nenhuma alteração de código é necessária – o recurso reside inteiramente na camada de serviço de inferência.
- Aplica-se apenas a modelos auto-hospedados – ofertas gerenciadas, como a API da OpenAI ou o serviço da Anthropic, não são afetadas.
- Transparente para as aplicações – a mesma URL de endpoint do SageMaker e o contrato de API permanecem os mesmos.
Quem pode se beneficiar
As empresas que hospedam LLMs no SageMaker o fazem por motivos que variam desde a privacidade de dados até o controle de custos. Para aquelas que operam chatbots de suporte, assistentes de vendas ou qualquer agente interativo que utilize repetidamente um prompt de sistema fixo, o ajuste de roteamento pode reduzir os tempos médios de resposta. Do lado dos custos, cada cache hit economiza a GPU de reavaliar a parte compartilhada do prompt.
Limites e contrapontos
O benefício depende da presença de prefixos repetidos. Prompts altamente variáveis — como consultas únicas ou mensagens de sistema geradas dinamicamente — não verão a mesma vantagem de cache hit.
Como o recurso é limitado a implantações auto-hospedadas, os clientes presos a serviços de LLM gerenciados não podem aproveitá-lo.
Resumo: O roteamento consciente de prefixo oferece aos usuários do SageMaker uma maneira simples e sem código de reduzir a latência em cargas de trabalho repetitivas de LLM, ao mesmo tempo em que reduz os custos de GPU. Para organizações que já hospedam modelos na plataforma, a atualização é um ajuste de baixo risco que pode se traduzir em interações de usuário mais rápidas e faturas mais baixas.
