A DeepSeek lançou o modelo V4 Pro em disponibilidade geral (GA). Medições iniciais mostram que ele reduz o uso de tokens de raciocínio entre 18% e 62% em comparação com a versão de prévia (preview). Isso é importante para quem paga por token: os mesmos prompts agora custam visivelmente menos, mantendo uma saída comparável.
O que motivou a comparação
O lançamento GA chegou sem um post no blog ou changelog, então os desenvolvedores tiveram que descobrir as diferenças por conta própria. Um teste da comunidade executou tarefas idênticas em ambas as versões e encontrou a maior mudança — uma queda acentuada nos tokens que o modelo gasta "pensando" antes de responder. Em consultas triviais, o modelo GA usou 62% menos tokens de raciocínio; em consultas mais complexas, a redução foi de 18%.
Eficiência de tokens e seu impacto
Em um fluxo de trabalho de extração típico, a versão de prévia consumiu 159 tokens de raciocínio para extrair alguns campos de um prompt. Ao mudar para a versão GA com o recurso de "thinking" desativado, esse número caiu para 40 tokens. Para usuários em planos tarifados, a economia se traduz diretamente em faturas mais baixas, especialmente em escala.
Extração de JSON: o problema oculto
Ambas as versões falham quando o modo "thinking" está ativado: elas passam na verificação de esquema JSON, mas inserem valores numéricos incorretos. Apenas a versão GA retorna o JSON correto quando o "thinking" é desativado. Equipes que precisam de saída estruturada devem desativar a flag de "thinking" para tarefas de extração, caso contrário, receberão dados sintaticamente válidos, mas numericamente incorretos.
O tratamento de recusas muda o cenário
O modelo de prévia podia recusar uma pergunta que considerasse impossível de responder, respondendo "Eu não sei". O modelo GA não faz mais isso. Em vez disso, ele ou esgota seu orçamento de tokens sem responder, ou fabrica uma resposta. Essa mudança melhora a eficiência de tokens, mas remove uma rede de segurança que impedia o modelo de alucinar sobre tópicos desconhecidos.
Aumento de confiabilidade
Um loop perigoso na versão de prévia — desencadeado por um orçamento de "thinking" modesto — poderia fazer o modelo repetir o mesmo texto até que a janela de 8.192 tokens fosse preenchida. O lançamento GA corrige esse bug, encerrando a repetição desenfreada que anteriormente corria o risco de esgotar a janela de requisição e inflar os custos.
O que os usuários devem observar
- Ative a versão GA para contagens de tokens menores. As reduções medidas mantêm-se em toda a complexidade das tarefas.
- Desative o "thinking" para qualquer extração de JSON ou dados estruturados. Isso gera valores corretos e mantém o uso de tokens no mínimo.
- Não conte com recusas integradas. Se um prompt solicitar dados não verificáveis, o modelo GA ainda pode produzir uma resposta, portanto, a validação posterior continua sendo essencial.
- Fique atento ao faturamento em horários de pico. As novas regras de preços fazem com que o consumo de tokens durante períodos de alto tráfego afete o gasto total de forma mais acentuada do que antes.
Resumo
O modelo V4 Pro GA da DeepSeek oferece uma clara vitória em eficiência — até 62% menos tokens de raciocínio — e corrige um bug crítico de repetição. No entanto, a perda de respostas de recusa explícitas e a necessidade de desativar o "thinking" para uma saída JSON precisa adicionam novas considerações. Equipes que adaptarem seus pipelines podem reduzir custos sem sacrificar a funcionalidade.
Fonte: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
