A DeepSeek anunciou em 14 de setembro de 2026 que irá aposentar seu modelo de linguagem de grande escala (LLM) V4-Pro e direcionar cada requisição de API para a versão mais recente, V4.1-Flash.

Por que a DeepSeek está descontinuando o V4-Pro

O V4-Pro tem sido a oferta de nível superior da DeepSeek desde o lançamento, comercializado como um LLM de propósito geral com amplo conhecimento. Ao longo do último ano, a empresa comparou o V4.1-Flash com o V4-Pro nas tarefas que importam para seus clientes de API: geração de código, síntese de comandos de terminal e resposta rápida a prompts curtos. Os dados mostram que o modelo mais novo é mais rápido, custa menos por requisição e obtém pontuações mais altas em diversos benchmarks específicos de tarefas.

A mudança reflete a pressão do mercado. Serviços de IA baseados em nuvem agora cobram por token ou por unidade de computação, e os desenvolvedores estão buscando formas de reduzir despesas operacionais sem sacrificar a velocidade. Ao mover todo o tráfego para o V4.1-Flash, a DeepSeek pode encerrar o pipeline de inferência mais caro que alimenta o V4-Pro e repassar a economia aos usuários.

Desempenho e custo em um relance

Benchmark V4.1-Flash V4-Pro
Terminal-Bench 2.1 (geração de código e comandos) 90.6 87.9
Terminal-Bench 4.0 (tarefas complexas de múltiplas etapas) 31.2 12.4
DeepSWE v1.1 (raciocínio de engenharia de software) 74.2 62.7

Em cada teste, o V4.1-Flash obtém uma pontuação maior, às vezes por uma margem ampla. O modelo também supera o Claude Opus 5 e o GPT-5.6 Sol nos mesmos benchmarks focados em codificação, de acordo com as comparações internas da DeepSeek.

O custo por tarefa típica mostra um padrão semelhante:

  • GLM-5.3-Flash: $0.25
  • DeepSeek V4.1-Flash: $0.27
  • Moonshot Kimi K3: $2.00

Os desenvolvedores podem obter uma inteligência comparável por aproximadamente um oitavo do custo ao escolherem o Flash em vez de uma alternativa maior e mais cara.

O compromisso: menos conhecimento enciclopédico

Os ganhos de eficiência vêm acompanhados de uma queda na recuperação de fatos. No benchmark de verificação de fatos SimpleQA-Verified, o V4.1-Flash pontua 42,3, enquanto o V4-Pro registrou 55,2. A DeepSeek descreve o novo modelo como “um trabalhador melhor, mas uma enciclopédia mais fraca”. Aplicações que dependem fortemente de conhecimento de mundo atualizado — como sumarização de notícias ou pesquisa jurídica — podem precisar de bases de conhecimento externas ou de um fallback para um modelo maior.

Como a indústria está se posicionando

A aposta total da DeepSeek contrasta com a de outros provedores de IA:

  • Z.ai oferece um espectro de modelos, do compacto ao grande, permitindo que os clientes equilibrem escala e eficiência por projeto.
  • Moonshot aposta no tamanho com seu modelo Kimi K3, aceitando custos mais altos em troca de capacidade bruta.
  • DeepSeek direcionou todas as requisições de API para o Flash, apostando que o mercado priorizará velocidade e preço em vez de escala pura.

Essas abordagens divergentes mostram que o mercado ainda não se estabeleceu em um único caminho. Alguns desenvolvedores ainda valorizam a amplitude de modelos massivos; outros trocam isso por respostas mais rápidas e baratas.

Conselhos práticos para desenvolvedores

  1. Não escolha um modelo apenas pelo nome ou pelo preço do token. Um modelo “Flash” pode superar um modelo “Pro” nas tarefas que são importantes para você.
  2. Construa flexibilidade em sua stack. Projete seu sistema para alternar entre provedores ou versões de modelos sem a necessidade de grandes reescritas.
  3. Valide com seus próprios dados. Benchmarks públicos fornecem uma base útil, mas o desempenho no mundo real depende da sua carga de trabalho.

Seguir esses passos ajuda as equipes a evitar o lock-in e a garantir o melhor valor à medida que o ecossistema de LLMs evolui.

O que observar a seguir

A aposentadoria do V4-Pro marca uma mudança clara em direção a LLMs focados em eficiência. Se isso encerrará a era dos modelos “flagship” ou se apenas iniciará uma nova fase de um mercado em rápida mudança, ainda está por ver, mas os desenvolvedores que permanecerem ágeis estarão em melhor posição para lucrar com a mudança.