Um pesquisador independente registrou cada token que seu agente de pesquisa baseado em LLM consumiu durante um mês e reduziu a conta em 31%. Os gastos caíram de $945 para $651, enquanto a taxa de sucesso subiu ligeiramente de 91% para 93%, um resultado que qualquer pessoa que execute fluxos de trabalho de IA sensíveis a custos notará.

Por que os dados ao nível de token foram importantes

A maioria dos usuários de LLM vê apenas a fatura final – um valor total que esconde o custo de cada subtarefa. O agente do pesquisador realizava três ações principais: pesquisar registros da SEC, redigir relatórios e compilar sínteses de pesquisa. Sem dados granulares, ele não conseguiria saber se os $312 que pagou em junho foram bem gastos.

Para expor o vazamento oculto, ele adicionou uma camada de log em PostgreSQL que capturava o nome do modelo, a contagem de tokens, o tipo de tarefa e o custo por chamada. Após 30 dias, os dados pintaram um quadro claro:

  • Pesquisa de registros da SEC – 41% do gasto total
  • Redação de relatórios – 28%
  • Síntese de pesquisa – 17%
  • Verificações de qualidade – 9%
  • Diversos – 5%

Os números mostraram que a etapa mais cara não era o modelo em si, mas como o agente inseria os resultados brutos de pesquisa nos prompts.

Três ajustes que geraram a economia

1. Resuma antes de enviar o prompt

Originalmente, o agente inseria 20 resultados de pesquisa brutos em cada prompt, inflando a entrada com um grande número de tokens. Ele inseriu um sumarizador barato primeiro, reduzindo drasticamente a entrada. O custo por tarefa de pesquisa caiu de $0,84 para $0,19 – uma redução de 77%.

2. Direcione verificações simples para um modelo mais barato

As verificações de qualidade eram executadas em um modelo de alto desempenho que custava $0,09 por verificação. Ele substituiu por um modelo de menor preço para a maioria das verificações de aprovação/reprovação, reduzindo o preço por verificação para $0,01. O modelo mais barato respondeu corretamente 89% das vezes; qualquer falha era escalonada para o modelo original, preservando a precisão enquanto reduzia o custo em 87%.

3. Pule verificações quando a confiança for alta

Ele adicionou uma regra para ignorar a etapa de verificação de qualidade sempre que a taxa de sucesso histórica da tarefa fosse alta e o comprimento da saída estivesse dentro dos limites esperados. Isso eliminou cerca de 60% das verificações que seriam executadas de qualquer maneira.

O resultado

Com as três mudanças implementadas, o balanço mensal ficou assim:

  • Gasto total: $945 → $651 (redução de 31%)
  • Custo de pesquisa da SEC por tarefa: $0,84 → $0,19 (redução de 77%)
  • Custo de verificação de qualidade por tarefa: $0,09 → $0,01 (redução de 87%)
  • Taxa de sucesso geral: 91% → 93%

A maior taxa de sucesso sugere que prompts mais curtos reduziram o ruído e ajudaram o modelo a focar na questão central.

Ressalvas e contrapontos

A abordagem baseia-se em duas premissas. Primeiro, o sumarizador mais barato deve reter informações suficientes para o raciocínio subsequente; se ele descartar detalhes críticos, a qualidade da saída pode sofrer. Segundo, o modelo de menor custo usado para as verificações de qualidade não é perfeito; sua precisão de 89% significa que uma pequena fração de erros ainda chega ao produto final, embora o caminho de escalonamento capture a maioria deles. Usuários com necessidades de conformidade mais rigorosas podem precisar de limites mais estreitos ou etapas de validação extras.

O que isso significa para profissionais de LLM

  • Dashboards granulares vencem. Relatórios de gastos de alto nível escondem o desperdício de tokens. Registrar o uso por tarefa revela ineficiências que, de outra forma, permaneceriam ocultas.
  • Modelos de fronteira nem sempre são necessários. Um modelo barato pode comprimir dados ou tomar decisões binárias simples sem comprometer a qualidade geral.

O custo oculto de um agente de LLM é, muitas vezes, o trabalho não mensurado que ele realiza. Ao instrumentar o fluxo de tokens e aplicar otimizações direcionadas, o pesquisador transformou uma conta mensal de $945 em uma operação mais enxuta de $651, ao mesmo tempo em que elevou o desempenho. Para quem faz o orçamento de cargas de trabalho de IA, a lição é clara: meça cada token e, em seguida, deixe os dados ditarem onde cortar.