Um pesquisador independente registrou cada token que seu agente de pesquisa baseado em LLM consumiu durante um mês e reduziu a conta em 31%. Os gastos caíram de $945 para $651, enquanto a taxa de sucesso subiu ligeiramente de 91% para 93%, um resultado que qualquer pessoa que execute fluxos de trabalho de IA sensíveis a custos notará.
Por que os dados ao nível de token foram importantes
A maioria dos usuários de LLM vê apenas a fatura final – um valor total que esconde o custo de cada subtarefa. O agente do pesquisador realizava três ações principais: pesquisar registros da SEC, redigir relatórios e compilar sínteses de pesquisa. Sem dados granulares, ele não conseguiria saber se os $312 que pagou em junho foram bem gastos.
Para expor o vazamento oculto, ele adicionou uma camada de log em PostgreSQL que capturava o nome do modelo, a contagem de tokens, o tipo de tarefa e o custo por chamada. Após 30 dias, os dados pintaram um quadro claro:
- Pesquisa de registros da SEC – 41% do gasto total
- Redação de relatórios – 28%
- Síntese de pesquisa – 17%
- Verificações de qualidade – 9%
- Diversos – 5%
Os números mostraram que a etapa mais cara não era o modelo em si, mas como o agente inseria os resultados brutos de pesquisa nos prompts.
Três ajustes que geraram a economia
1. Resuma antes de enviar o prompt
Originalmente, o agente inseria 20 resultados de pesquisa brutos em cada prompt, inflando a entrada com um grande número de tokens. Ele inseriu um sumarizador barato primeiro, reduzindo drasticamente a entrada. O custo por tarefa de pesquisa caiu de $0,84 para $0,19 – uma redução de 77%.
2. Direcione verificações simples para um modelo mais barato
As verificações de qualidade eram executadas em um modelo de alto desempenho que custava $0,09 por verificação. Ele substituiu por um modelo de menor preço para a maioria das verificações de aprovação/reprovação, reduzindo o preço por verificação para $0,01. O modelo mais barato respondeu corretamente 89% das vezes; qualquer falha era escalonada para o modelo original, preservando a precisão enquanto reduzia o custo em 87%.
3. Pule verificações quando a confiança for alta
Ele adicionou uma regra para ignorar a etapa de verificação de qualidade sempre que a taxa de sucesso histórica da tarefa fosse alta e o comprimento da saída estivesse dentro dos limites esperados. Isso eliminou cerca de 60% das verificações que seriam executadas de qualquer maneira.
O resultado
Com as três mudanças implementadas, o balanço mensal ficou assim:
- Gasto total: $945 → $651 (redução de 31%)
- Custo de pesquisa da SEC por tarefa: $0,84 → $0,19 (redução de 77%)
- Custo de verificação de qualidade por tarefa: $0,09 → $0,01 (redução de 87%)
- Taxa de sucesso geral: 91% → 93%
A maior taxa de sucesso sugere que prompts mais curtos reduziram o ruído e ajudaram o modelo a focar na questão central.
Ressalvas e contrapontos
A abordagem baseia-se em duas premissas. Primeiro, o sumarizador mais barato deve reter informações suficientes para o raciocínio subsequente; se ele descartar detalhes críticos, a qualidade da saída pode sofrer. Segundo, o modelo de menor custo usado para as verificações de qualidade não é perfeito; sua precisão de 89% significa que uma pequena fração de erros ainda chega ao produto final, embora o caminho de escalonamento capture a maioria deles. Usuários com necessidades de conformidade mais rigorosas podem precisar de limites mais estreitos ou etapas de validação extras.
O que isso significa para profissionais de LLM
- Dashboards granulares vencem. Relatórios de gastos de alto nível escondem o desperdício de tokens. Registrar o uso por tarefa revela ineficiências que, de outra forma, permaneceriam ocultas.
- Modelos de fronteira nem sempre são necessários. Um modelo barato pode comprimir dados ou tomar decisões binárias simples sem comprometer a qualidade geral.
O custo oculto de um agente de LLM é, muitas vezes, o trabalho não mensurado que ele realiza. Ao instrumentar o fluxo de tokens e aplicar otimizações direcionadas, o pesquisador transformou uma conta mensal de $945 em uma operação mais enxuta de $651, ao mesmo tempo em que elevou o desempenho. Para quem faz o orçamento de cargas de trabalho de IA, a lição é clara: meça cada token e, em seguida, deixe os dados ditarem onde cortar.
