DeepSeek ha rilasciato il modello V4 Pro in versione general-availability (GA). Le prime misurazioni mostrano una riduzione dell'uso di token di ragionamento (reasoning tokens) tra il 18% e il 62% rispetto alla versione preview. Questo è fondamentale per chiunque paghi per token: gli stessi prompt ora costano sensibilmente meno, pur producendo output comparabili.

Cosa ha stimolato il confronto

Il rilascio GA è arrivato senza un post sul blog o un changelog, quindi gli sviluppatori hanno dovuto scoprire le differenze da soli. Un test della community ha eseguito compiti identici su entrambe le versioni e ha riscontrato il cambiamento principale: un drastico calo dei token che il modello impiega per "pensare" prima di rispondere. Per ricerche banali, il modello GA ha utilizzato il 62% in meno di reasoning tokens; per query più complesse, la riduzione è stata del 18%.

Efficienza dei token e il suo impatto

In un tipico flusso di lavoro di estrazione, la versione preview consumava 159 reasoning tokens per estrarre un manipolo di campi da un prompt. Passando alla versione GA con la funzione "thinking" disabilitata, quel numero è sceso a 40 token. Per gli utenti con piani a consumo, il risparmio si traduce direttamente in bollette più basse, specialmente su larga scala.

Estrazione JSON: l'insidia nascosta

Entrambe le versioni vacillano quando la modalità "thinking" è attiva: superano il controllo dello schema JSON ma inseriscono valori numerici errati. Solo la versione GA restituisce un JSON corretto quando il "thinking" è disattivato. I team che necessitano di output strutturati dovrebbero disabilitare il flag "thinking" per i compiti di estrazione, altrimenti riceveranno dati sintatticamente validi ma numericamente errati.

La gestione dei rifiuti cambia le regole del gioco

Il modello preview poteva rifiutare una domanda che riteneva impossibile da rispondere, rispondendo "Non lo so". Il modello GA non lo fa più. Invece, esaurisce il budget di token senza rispondere oppure inventa una risposta. Questo cambiamento migliora l'efficienza dei token ma rimuove una rete di sicurezza che impediva al modello di allucinare su argomenti sconosciuti.

Incremento dell'affidabilità

Un loop pericoloso nella versione preview — innescato da un budget di "thinking" modesto — poteva spingere il modello a ripetere lo stesso testo finché la finestra di 8.192 token non si riempiva. Il rilascio GA corregge questo bug, ponendo fine alla ripetizione incontrollata che precedentemente rischiava di esaurire la finestra della richiesta e gonfiare i costi.

Cosa dovrebbero monitorare gli utenti

  • Utilizzare la versione GA per ridurre il conteggio dei token. Le riduzioni misurate si mantengono indipendentemente dalla complessità del compito.
  • Disattivare il "thinking" per qualsiasi estrazione di JSON o dati strutturati. Ciò garantisce valori corretti e mantiene al minimo l'uso dei token.
  • Non fare affidamento sui rifiuti integrati. Se un prompt richiede dati non verificabili, il modello GA potrebbe comunque produrre una risposta, quindi la validazione a valle rimane essenziale.
  • Monitorare la fatturazione nelle ore di punta. Le nuove regole di prezzo fanno sì che il consumo di token durante i periodi di alto traffico influenzi la spesa complessiva in modo più marcato rispetto al passato.

In sintesi

Il modello DeepSeek V4 Pro GA offre un chiaro vantaggio in termini di efficienza — fino al 62% in meno di reasoning tokens — e corregge un bug critico di ripetizione. Tuttavia, la perdita di risposte di rifiuto esplicite e la necessità di disabilitare il "thinking" per ottenere output JSON accurati introducono nuove considerazioni. I team che adattano le proprie pipeline possono ridurre i costi senza sacrificare la funzionalità.

Source: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l