The open-source AI movement has produced genuinely impressive models. DeepSeek now processes over a third of all tokens flowing through Vercel’s AI gateway. Z.ai’s GLM-5.2 sits comfortably in the platform’s top four by volume. These are not hobbyist projects. They are production-grade systems handling real enterprise workloads at massive scale. Given these numbers, it would be easy to assume that frontier labs like Anthropic are facing an existential threat to their market position.

That assumption misses what is actually happening.

The Real Work of Frontier Models

Decagon CEO Jesse Zhang has proposed a clearer way to understand the split between proprietary and open-source AI. The competition is not a simple race to replace one another. Instead, the two categories serve different phases of a single enterprise lifecycle.

Frontier models function as the discovery layer. When a company begins exploring how AI might change an internal process, the task is almost always poorly defined. The inputs are messy. The desired outputs are vague. Success requires reasoning through ambiguity, handling edge cases the team has not yet catalogued, and adapting to prompts that change by the hour. This is prototyping and proof-of-concept work. It demands the most capable system available, cost be damned, because the alternative is a failed experiment that teaches nothing.

In this phase, an expensive frontier model is not overhead. It is the cost of market research compressed into a few API calls. Once the use case is proven and the workflow is mapped, the nature of the problem shifts. The ambiguity disappears. Inputs become standardized. Prompts stabilize. The task has become routine. At that point, many enterprises migrate the workload to a lighter, cheaper model. Open-source alternatives step in and own the production stage, while frontier models remain stationed at the frontier, handling the next wave of unknown problems.

This is not a theory about how AI should work. It is a description of how budgets are already moving.

When Workloads Move Downmarket

The migration to open source is real, and it is visible in the traffic data. DeepSeek’s surge to over one-third of token volume on Vercel’s infrastructure shows that companies are running enormous quantities of inference through cheaper models. Z.ai’s GLM-5.2 has also carved out a top-four position by handling steady, predictable traffic.

These models excel at tasks that have been tamed. Think of high-volume data extraction from standardized forms, first-pass customer support triage that routes tickets based on obvious keywords, or routine code linting and documentation generation. The prompts are templated. The error modes are understood. The business risk of a bad output is contained. When the work is defined and repetitive, the cost of inference becomes the primary concern. Running that same workload on a six-cent model instead of a premium tier makes immediate financial sense.

But volume is not revenue. The fact that open-source models dominate token counts does not mean they dominate value creation. Token volume measures activity. Token spend measures what companies are willing to pay for irreplaceable capability.

Where the Money Actually Flows

Vercel’s AI gateway data makes the economic split impossible to ignore. Despite DeepSeek’s dominance in raw token traffic, Anthropic continues to capture more than half of the total AI spend on the platform. The gap between activity and expenditure comes down to a staggering price differential.

According to OpenRouter data, Anthropic’s Opus 4.8 costs approximately $1.37 per million tokens. DeepSeek’s V4Flash costs roughly six cents for the same volume. Opus is priced about twenty-three times higher. That multiplier matters more than raw token counts ever could. A development team could move ninety percent of their inference volume to the cheaper model and still see the expensive model account for the majority of their budget.

Essa discrepância não é um acidente. Ela reflete a realidade de que os provedores de modelos de fronteira estão vendendo algo diferente. Eles não estão vendendo apenas tokens. Eles estão vendendo a capacidade de raciocinar sobre problemas que carecem de playbooks estabelecidos. As empresas que pagam taxas premium não o fazem por ignorância. Elas o fazem porque as tarefas que atribuem a esses modelos são de alto risco ou estruturalmente complexas. Uma equipe jurídica analisando uma nova exposição regulatória não pode tolerar uma citação alucinada. Uma equipe de produto projetando um fluxo de trabalho agêntico de várias etapas precisa que o modelo encadeie a lógica corretamente ao longo de vários turnos. O custo da falha nesses cenários excede em muito o custo da chamada de API.

O investimento de capital flui para a camada onde o valor ainda está sendo criado, não meramente executado.

O Mercado Cresce Mais Rápido do que a Migração

Se os modelos de código aberto são muito mais baratos, e as empresas estão migrando ativamente cargas de trabalho maduras para eles, por que os gastos com modelos de fronteira não colapsaram? A resposta é que o mercado total de tarefas de IA endereçáveis está se expandindo mais rápido do que qualquer modelo individual possa transformá-lo em commodity.

Toda vez que uma empresa automatiza com sucesso um fluxo de trabalho previsível com uma alternativa de código aberto, duas coisas acontecem. Primeiro, essa equipe economiza dinheiro na execução. Segundo, esses recursos e esse talento são redirecionados para problemas adjacentes mais difíceis. O trabalho rotineiro agora é tratado por máquinas, o que significa que os humanos podem se concentrar no irregular, no estratégico e no sem precedentes. O problema recém-descoberto quase sempre exige a profundidade de raciocínio de um modelo de fronteira.

Esse padrão se repete em diversos setores. Um banco automatiza a revisão de documentos usando um modelo barato e, em seguida, volta sua atenção para a construção de um modelo de risco dinâmico que exige um julgamento matizado. Uma empresa de software automatiza a geração de testes e, em seguida, tenta construir um agente de depuração autônomo que deve rastrear erros em sistemas distribuídos. A fronteira continua avançando. Assim que uma tarefa se torna uma commodity, surge um caso de uso mais complexo que exige capacidade premium.

Muitas tarefas empresariais também permanecem sensíveis demais para serem entregues à atual geração de alternativas de código aberto. O suporte de triagem médica, a previsão financeira sob escrutínio regulatório e a análise de estratégia executiva carregam riscos de perda que tornam o custo de inferência irrelevante perto da precisão e da confiabilidade. Essas cargas de trabalho criam um nível premium duradouro. O resultado é uma economia estável de dois níveis: uma camada de alta margem para raciocínio complexo e descoberta, e uma camada de commodity de alto volume para execução de produção rotineira.

O Que Isso Significa para Compradores Corporativos

A conclusão prática é que a seleção de modelos deve seguir a maturidade do trabalho, não a ideologia. Construa e valide novas aplicações de IA nos modelos de fronteira mais capazes que você puder acessar. Pague o prêmio durante a fase de descoberta. É mais barato do que construir sobre um modelo limitado, falhar em provar o valor e abandonar o projeto. Uma vez que as entradas, saídas e modos de falha sejam conhecidos, então otimize agressivamente. Mova a carga de trabalho estável para uma alternativa de código aberto e capture a economia de custos.

Tentar forçar cada tarefa em um único nível é uma receita para desperdício de capital ou perda de capacidade. As empresas que navegarem por isso corretamente executarão arquiteturas híbridas por padrão, não como um compromisso.

A história aqui não é que o código aberto está perdendo, ou que os laboratórios de fronteira são invencíveis. É que ambos os níveis estão crescendo, mas crescem em direções diferentes. Os modelos de código aberto estão engolindo o mundo conhecido das tarefas de IA. Os modelos de fronteira estão reivindicando o desconhecido. Por um futuro previsível, esse é um arranjo confortável para ambos.