Seu agente baseado em LLM pode funcionar perfeitamente em uma demonstração, mas depois ficar lento e inflar sua conta após apenas algumas interações. O culpado oculto não é um modelo instável — é o token drift, o inchaço gradual do prompt que o modelo precisa processar a cada vez.
O token drift ocorre quando cada interação adiciona mais texto ao contexto de entrada do modelo. O histórico da conversa, os esquemas de ferramentas (tool schemas), as respostas de API e os documentos recuperados se acumulam, de modo que cada chamada subsequente carrega um payload maior. Como o tempo de processamento e o preço do modelo aumentam com o número de tokens de entrada, o custo sobe quadraticamente em vez de linearmente.
Por que o problema aparece em produção, não em demonstrações
Implementações reais preservam tudo: cada fala do usuário, cada saída de ferramenta, cada fragmento de conhecimento recuperado. O acúmulo permanece oculto até que a latência dispare e a fatura chegue.
Fontes comuns de token drift
- Transcritos repetidos – Manter todas as mensagens antigas no prompt em vez de resumi-las ou descartá-las.
- Esquemas de ferramentas pesados – Enviar grandes definições JSON das capacidades das ferramentas em cada interação.
- Resultados de ferramentas volumosos – Incluir respostas completas de API ou linhas de banco de dados que contêm mais dados do que o agente realmente precisa.
- Inchaço de RAG – Geração aumentada por recuperação (RAG) que adiciona muitos fragmentos de documentos, alguns dos quais estão desatualizados ou são irrelevantes.
- Memória duplicada – Agrupar um resumo, um objeto de estado e o transcrito bruto, o que repete a mesma informação três vezes.
Cada um desses itens adiciona tokens que não contribuem com novo poder de raciocínio, mas que inflam o tamanho do prompt.
Como manter o orçamento de tokens sob controle
1. Adote um design de contexto em camadas
- Instruções estáveis – Mantenha os system prompts e as regras de segurança no topo e faça referência a eles em vez de reenviá-los a cada interação.
- Estado estruturado – Armazene uma representação compacta de objetivos, decisões e identificadores que o agente possa ler rapidamente.
- Histórico comprimido – Resuma interações mais antigas em um parágrafo curto e legível por humanos, atualizando apenas quando um limite for atingido.
- Interações recentes – Inclua as últimas mensagens literalmente para preservar a continuidade.
Separar o texto constante do conteúdo resumível evita que você reenvie as mesmas palavras repetidamente.
2. Reduza as saídas das ferramentas
- Extraia apenas os campos que o agente realmente utiliza; descarte descrições verbosas.
- Substitua resultados grandes por um resumo conciso ou um ID de referência, e armazene o payload completo em um banco de dados, cache ou blob store.
- Quando uma ferramenta retornar uma lista, envie apenas os N itens principais que importam para a decisão atual.
3. Aplique o resumo inteligente
- Pule o resumo após cada interação; o processamento extra adiciona sobrecarga (overhead).
- Atualize o resumo apenas quando a contagem acumulada de tokens de interações antigas ultrapassar um limite predefinido.
- Mantenha fatos críticos — IDs, valores, carimbos de data/hora (timestamps) — em um armazenamento estruturado em vez de incorporá-los em prosa, para que o resumo permaneça curto.
4. Monitore as métricas corretas
- Registre o uso de tokens por chamada de modelo, não apenas por solicitação de usuário. Isso revela o crescimento oculto no lado da entrada.
- Monitore o número de tokens de entrada adicionados a cada interação; um salto repentino indica uma fonte de drift.
- Separe os tokens em cache (reutilizados de chamadas anteriores) dos tokens recém-gerados; apenas os primeiros impulsionam o drift.
Trate o prompt como um recurso finito, não como um transcrito infinito. Ao medir, resumir e reduzir deliberadamente, você mantém seu agente de LLM rápido, acessível e pronto para escala de produção.
Resumo: O token drift aumenta silenciosamente os custos e torna os agentes lentos. Identifique as partes crescentes do seu prompt, comprima-as ou externalize-as, e monitore o uso de tokens por chamada. Uma abordagem disciplinada transforma choques de faturas imprevisíveis em uma operação gerenciável e econômica.
