O Amazon Bedrock agora permite que desenvolvedores façam o cache de partes de um prompt, reduzindo as faturas de uso de tokens em até 90% e diminuindo a latência de resposta em até 85% para aplicações que reutilizam um prefixo de prompt estático.
Por que essa mudança é importante
Executar modelos de linguagem de grande escala (LLMs) sob demanda custa dinheiro toda vez que tokens são enviados ao modelo. Chatbots, assistentes de código e ferramentas de busca de documentos frequentemente reenviam as mesmas instruções de sistema ou materiais de referência, inflando os gastos e retardando as respostas.
Como funciona o cache de prompt
O Bedrock adiciona uma flag “cacheable” que os desenvolvedores anexam a qualquer segmento de um prompt — normalmente instruções de nível de sistema, documentos de contexto longos ou definições de ferramentas que nunca mudam durante uma sessão. Quando uma requisição chega, o Bedrock verifica se o segmento marcado corresponde a uma entrada armazenada. Se corresponder, o serviço pula a re-codificação e a re-execução dessa parte no modelo, buscando a representação pré-computada diretamente do cache.
Os números
- Custo de tokens de entrada: redução de até 90%, pois o prefixo em cache não consome mais tokens em cada chamada.
- Latência: até 85% mais rápida, já que o processamento pesado do modelo é evitado para a parte estática.
Melhores cenários de uso
O recurso se destaca quando o prompt contém um bloco grande e imutável seguido por uma consulta de usuário curta e variável. Padrões comuns incluem:
- Pipelines de geração aumentada por recuperação (RAG) que inserem um documento recuperado no início de cada consulta.
- Bots de suporte ao cliente que sempre começam com a mesma declaração de política ou texto de definição de tom.
- Assistentes de codificação que carregam uma definição fixa de ferramenta de linguagem antes do trecho de código do desenvolvedor.
O que os desenvolvedores precisam alterar
Os desenvolvedores devem reordenar o prompt para que o conteúdo estático fique logo no início e permaneça byte a byte idêntico entre as chamadas. A entrada variável do usuário segue o prefixo em cache. Não é necessária a troca de modelo; os mesmos endpoints do Bedrock processam a requisição.
Quem ganha e quem deve ter cautela
A vantagem aplica-se apenas a cargas de trabalho onde o prefixo permanece verdadeiramente estático. Aplicações que personalizam instruções de sistema por usuário ou alteram o contexto com frequência verão pouco benefício e devem pesar a complexidade adicional de estruturação do prompt contra ganhos modestos.
Resumo: O cache de prompt oferece aos usuários do Bedrock uma alavanca direta para reduzir os custos operacionais de IA e melhorar os tempos de resposta, desde que suas aplicações consigam isolar um prefixo de prompt reutilizável.
