O log de memória de um agente LLM de produção cresceu de um arquivo de 2 KB para 29.446 bytes, elevando a contagem de tokens que o agente lê de cerca de 500 para 7.360 por execução — um custo oculto que surgiu sem qualquer alerta no painel de monitoramento. O desenvolvedor por trás do agente afirma que o aumento silencioso no custo de leitura é um exemplo concreto de “desvio de custo do agente” (agent cost drift), um problema que pode corroer orçamentos mesmo quando o sistema parece funcionar normalmente.
O que é o desvio de custo do agente?
O desvio de custo do agente descreve o aumento gradual no custo computacional das operações rotineiras de um agente de IA, causado pelo crescimento do próprio estado do agente. No exemplo, o agente mantém um arquivo de log de trabalho que registra por que ele rejeitou tópicos de artigos anteriores. Cada nova entrada adiciona um parágrafo de raciocínio, e o arquivo é lido na íntegra antes que o agente gere novo conteúdo. Como o log se expande de forma quadrática — cada entrada não apenas adiciona seu próprio comprimento, mas também faz referência a entradas anteriores — a quantidade de texto que o agente deve ingerir acelera com o tempo.
O desvio não é um pico ou uma falha; é um imposto linear que se acumula. O agente ainda produz dois artigos por dia e o painel não mostra erros, mas cada execução agora consome 7.360 tokens, contra cerca de 500 de um mês atrás. Como a maioria dos provedores de LLM cobra por token, o aumento de tokens por execução traduz-se diretamente em custos operacionais mais altos.
Por que isso é importante
- Impacto no orçamento – O preço baseado em tokens significa que cada token extra lido é dinheiro gasto. A contagem de tokens aumentou de 500 para 7.360.
A mecânica oculta
O padrão de crescimento do arquivo é a chave. Um log linha a linha que apenas acrescenta novas entradas aumentaria linearmente, mas como cada entrada explica o raciocínio por trás de rejeições anteriores, o comprimento do texto se acumula. O resultado é uma curva de crescimento quadrática: dobrar o número de entradas mais do que dobra o tamanho do arquivo, e a contagem de tokens necessária para processá-lo cresce ainda mais rápido.
Os desenvolvedores raramente percebem o aumento do custo porque cada entrada “faz sentido por si só”. A saída do agente permanece correta e o log continua a cumprir seu propósito, mascarando a ineficiência.
Estratégia de mitigação
O desenvolvedor propõe uma reestruturação do log em três partes:
- Arquivo de entradas recentes – Manter um arquivo pequeno e lido ativamente que contenha apenas as últimas entradas necessárias para evitar repetições imediatas.
- Índice compacto – Armazenar um resumo de uma linha para entradas mais antigas. O índice pode ser verificado rapidamente para checar a duplicação de tópicos sem precisar carregar par
