O relatório de participação de tokens de junho da Vercel mostra que modelos de pesos abertos estão lidando com 29% dos tokens do gateway, um aumento em relação aos 11% de abril, com o DeepSeek sozinho representando 22,6% desse volume. O salto sinaliza uma mudança rápida: os desenvolvedores estão se afastando de um único modelo "ideal" e tratando os modelos de IA como infraestrutura roteável.
Por que os desenvolvedores estão tratando modelos como infraestrutura
Modelos de pesos abertos e baratos — muitos de provedores chineses — custam uma fração das ofertas premium como a Anthropic. Para tarefas rotineiras, como extração de código, limpeza de texto ou buscas simples de dados, um modelo que custa centavos em vez de dólares pode ser mais atraente, mesmo que seja alguns por cento menos preciso.
O resultado é um novo padrão de design. Uma aplicação primeiro envia uma requisição para um modelo de baixo custo para a parte "tediosa" do trabalho. Se a saída passar por uma verificação de qualidade simples, o pipeline prossegue; caso contrário, um modelo de preço mais elevado é invocado para uma segunda passagem ou decisão final. A lógica de roteamento torna-se a peça crítica, não a escolha de um único modelo.
O que os números dizem
Os dados da Vercel, extraídos de seu gateway que atende a múltiplos provedores de IA, mostram os modelos de pesos abertos saindo da periferia para o mainstream. Em abril, eles representavam pouco mais de um décimo de todos os tokens; em junho, estavam próximos de um terço. O DeepSeek, um modelo chinês, contribuiu sozinho com mais de um quinto do volume de tokens.
Modelos de ponta ainda dominam os gastos. A Anthropic, por exemplo, continua a capturar a maior parte dos gastos monetários porque seu preço por token é mais alto. A matemática é simples: modelos baratos vencem o trabalho de alto volume e baixa margem, enquanto modelos caros retêm as tarefas de alta margem e alto impacto.
Implicações para agentes de IA
Um agente de IA normalmente executa uma sequência de etapas: planejamento, recuperação de dados, invocação de ferramentas e refinamento de resultados. Quando cada etapa pode ser atribuída ao modelo mais econômico, o custo operacional total cai drasticamente.
- Recuperação de dados e extração geralmente precisam apenas de compreensão linguística básica, uma tarefa na qual modelos baratos se destacam.
- Julgamento final — a parte que decide se a resposta é aceitável — continua sendo o domínio de modelos premium que possuem maior confiabilidade.
Essa abordagem em camadas permite que os desenvolvedores automatizem cargas de trabalho maiores sem estourar os orçamentos. Também força uma mudança de "escolha o melhor modelo" para "meça o sucesso por etapa e faça o roteamento de acordo".
Riscos e limites
A economia é convincente, mas a transição não é isenta de atritos.
- Conformidade (Compliance): Algumas jurisdições impõem regras estritas de manipulação de dados que podem limitar o uso de modelos hospedados no exterior.
- Complexidade de hospedagem: Modelos premium grandes são difíceis de rodar internamente, então as organizações devem depender de APIs externas, o que pode aumentar a latência e as preocupações com vendor lock-in.
Devido a esses fatores, é improvável que os modelos baratos substituam os premium inteiramente. Em vez disso, eles se tornam o padrão para o trabalho rotineiro, enquanto os modelos premium permanecem na "camada de decisão", onde seu custo mais elevado é justificado.
O que observar a seguir
- Ferramentas de roteamento: À medida que a camada de roteamento se torna mais central, podemos esperar uma onda de SDKs e plataformas que automatizam a seleção de modelos com base em latência, custo e limites de confiança.
Desenvolvedores que começarem a medir o sucesso ao nível da tarefa, rastrear tentativas de reprocessamento (retries) e separar claramente o "volume" do trabalho de "julgamento" estarão melhor posicionados para lucrar com a mentalidade de infraestrutura emergente.
Conclusão: A stack de IA está se transformando de uma escolha de modelo único em um problema de roteamento, onde modelos de pesos abertos e baratos lidam com a maior parte do trabalho e modelos premium são reservados para decisões de alto impacto. Dominar esse roteamento será a próxima vantagem competitiva para os construtores de IA.
