O experimento de um desenvolvedor solo com três modelos Claude reduziu drasticamente os custos mensais de API em 35% e diminuiu a latência mediana das tarefas de 42 para 27 segundos. Ao rotear tarefas simples e de baixa ambiguidade para o modelo econômico Haiku, o trabalho rotineiro para o Sonnet e reservar o pesado Opus para problemas de alto risco, o autor provou que o hábito de usar o "melhor-modelo-para-tudo" é dispendioso.

Por que o roteamento foi importante

O autor opera um agente de codificação autônomo que recebe um fluxo constante de tarefas de desenvolvimento — correções de lint, adições de funcionalidades, revisões de segurança e sessões profundas de depuração. Durante meses, o agente enviou cada solicitação para o Opus, o modelo Claude mais capaz, assumindo que uma qualidade superior sempre compensaria o preço. O Opus exige um preço premium por token, então a conta cresceu sem controle.

Quando o autor introduziu um esquema de roteamento em camadas, os gastos caíram para 65% do nível original e o uso do Opus caiu para 11% do total de tarefas.

Como funciona o sistema de três níveis

A lógica de roteamento baseia-se na ambiguidade, não em quantas linhas de código uma tarefa toca. O autor definiu três categorias:

  • Haiku – tarefas determinísticas e de baixa ambiguidade. Exemplos: corrigir avisos de lint, renomear variáveis, resumir arquivos de log. A resposta correta geralmente é uma única linha de código ou texto.
  • Sonnet – o cavalo de batalha padrão. Lida com implementação de funcionalidades, correções de bugs rotineiras e refatorações padrão, onde o problema é claro, mas a solução pode envolver várias etapas.
  • Opus – trabalho de alto risco e alta ambiguidade. Decisões de arquitetura, auditorias de segurança, sessões de depuração complexas ou qualquer tarefa em que o caminho correto não seja claro e um erro possa quebrar o pipeline.

Uma tabela de consulta estática mapeia cada solicitação recebida para o modelo apropriado com base nessas regras. O autor tentou um modelo "inteligente" que decidiria a camada em tempo real, mas o uso extra de tokens anulou qualquer economia. Regras estáticas simples cobriram aproximadamente 80% da carga de trabalho e mantiveram o sistema barato e previsível.

A rede de segurança de escalonamento

Modelos baratos ainda cometem erros. Para evitar que uma resposta incorreta do Haiku ou do Sonnet desvie o build, o sistema faz o escalonamento de uma solicitação após duas falhas, promovendo-a para o próximo nível. Essa rede de segurança detecta erros precocemente e mantém o pipeline funcionando sem problemas, sem intervenção manual.

Números que falam por si só

Após quatro semanas operando o roteador em camadas, o autor registrou estas mudanças:

  • Gastos com API caíram para 65% do custo original (uma redução de 35%).
  • Tempo de resposta mediano caiu de 42 para 27 segundos.
  • Uso do Opus encolheu de processar todas as solicitações para apenas 11% do total de tarefas.

Esses números mostram que a maior parte do trabalho de desenvolvimento pode ser delegada a modelos mais baratos sem uma queda perceptível na qualidade, enquanto os problemas mais difíceis ainda se beneficiam da janela de contexto maior do Opus.

Lições para outros desenvolvedores

  1. Comece pelo baixo, não pelo alto. A maioria das tarefas diárias de codificação não precisa do modelo mais poderoso. Tornar o Sonnet o padrão para tarefas ambíguas economizou mais dinheiro do que passar tudo pelo Haiku.
  2. Meça a dificuldade, não o tamanho. Uma correção de uma linha para uma condição de corrida pode ser mais difícil do que refatorar um arquivo inteiro. Roteie com base no quão ambígua é a solução, não pelo número de linhas alteradas.
  3. Fique atento à taxa de escalonamento. Um aumento no número de escalonamentos sinaliza que as regras estáticas não correspondem mais à carga de trabalho. Ajuste as categorias antes que os modelos baratos comecem a causar mais falhas no pipeline.

Reservar o modelo mais caro para os problemas mais difíceis e deixar que os modelos mais baratos lidem com o restante mantém o desenvolvimento assistido por IA rápido e acessível. A verdadeira vantagem reside em uma estratégia de roteamento disciplinada que combina a ferramenta certa com o trabalho certo.