A AWS adicionou uma opção de “roteamento consciente de prefixo” (prefix-aware routing) ao Amazon SageMaker Inference, prometendo taxas de cache hit mais altas e uma latência visivelmente menor para clientes que executam grandes modelos de linguagem (LLMs) em sua própria infraestrutura. A mudança é importante porque proporciona uma latência significativamente menor e redução nos custos de computação de GPU.

Por que a latência de LLM é importante

Quando um LLM recebe uma requisição, ele normalmente recomputa a atenção sobre todo o prompt — uma etapa dispendiosa que cresce a cada token adicionado. Se o modelo puder reutilizar o cache de atenção de uma requisição anterior, ele precisará processar apenas a nova parte do texto. Cargas de trabalho que enviam repetidamente o mesmo prompt de sistema ou mantêm um histórico de conversa são candidatas ideais para a reutilização de cache.

Na configuração padrão do SageMaker, as requisições recebidas são distribuídas aleatoriamente pelo pool de instâncias de inferência. A distribuição aleatória significa que uma requisição que poderia ter atingido um cache quente frequentemente cai em uma instância fria, forçando uma recomputação completa. O resultado é uma latência maior e ciclos extras de GPU que se traduzem diretamente em gastos mais elevados.

Como funciona o roteamento consciente de prefixo

O novo modo de roteamento mantém um mapa leve dos prefixos de requisições recentes — essencialmente a primeira parte de um prompt que tende a permanecer constante entre as chamadas. Quando uma nova requisição chega, o SageMaker verifica o mapa e encaminha a requisição para uma instância que já processou o mesmo prefixo. Se a instância ainda mantiver o cache de atenção relevante, o modelo pode pular a maior parte do trabalho e gerar a resposta mais rapidamente.

Pontos principais:

  • Nenhuma alteração de código é necessária – o recurso reside inteiramente na camada de serviço de inferência.
  • Aplica-se apenas a modelos auto-hospedados – ofertas gerenciadas, como a API da OpenAI ou o serviço da Anthropic, não são afetadas.
  • Transparente para as aplicações – a mesma URL de endpoint do SageMaker e o contrato de API permanecem os mesmos.

Quem pode se beneficiar

As empresas que hospedam LLMs no SageMaker o fazem por motivos que variam desde a privacidade de dados até o controle de custos. Para aquelas que operam chatbots de suporte, assistentes de vendas ou qualquer agente interativo que utilize repetidamente um prompt de sistema fixo, o ajuste de roteamento pode reduzir os tempos médios de resposta. Do lado dos custos, cada cache hit economiza a GPU de reavaliar a parte compartilhada do prompt.

Limites e contrapontos

O benefício depende da presença de prefixos repetidos. Prompts altamente variáveis — como consultas únicas ou mensagens de sistema geradas dinamicamente — não verão a mesma vantagem de cache hit.

Como o recurso é limitado a implantações auto-hospedadas, os clientes presos a serviços de LLM gerenciados não podem aproveitá-lo.

Resumo: O roteamento consciente de prefixo oferece aos usuários do SageMaker uma maneira simples e sem código de reduzir a latência em cargas de trabalho repetitivas de LLM, ao mesmo tempo em que reduz os custos de GPU. Para organizações que já hospedam modelos na plataforma, a atualização é um ajuste de baixo risco que pode se traduzir em interações de usuário mais rápidas e faturas mais baixas.