DeepSeek heeft het V4 Pro general-availability (GA) model uitgebracht. Vroege metingen laten zien dat het het gebruik van reasoning-tokens met 18% tot 62% vermindert in vergelijking met de preview-versie. Dat is belangrijk voor iedereen die per token betaalt: dezelfde prompts kosten nu aanzienlijk minder, terwijl de output vergelijkbaar blijft.
Wat de vergelijking aanleiding gaf
De GA-release verscheen zonder blogpost of changelog, waardoor ontwikkelaars de verschillen zelf moesten ontdekken. Een test vanuit de community voerde identieke taken uit op beide versies en vond de grootste verandering: een sterke daling in het aantal tokens dat het model besteedt aan "nadenken" voordat het antwoordt. Bij eenvoudige zoekopdrachten gebruikte het GA-model 62% minder reasoning-tokens; bij complexere queries was de vermindering 18%.
Token-efficiëntie en de impact ervan
In een typische extractie-workflow verbruikte de preview-versie 159 reasoning-tokens om een handvol velden uit een prompt te halen. Door over te stappen naar de GA-versie met de "thinking"-functie uitgeschakeld, daalde dit aantal naar slechts 40 tokens. Voor gebruikers met een verbruikstarief vertalen deze besparingen zich direct in lagere rekeningen, vooral bij grootschalig gebruik.
JSON-extractie: de verborgen hindernis
Beide versies maken fouten wanneer de "thinking"-modus aan staat: ze halen de JSON-schema-check wel, maar voegen onjuiste numerieke waarden in. Alleen de GA-versie geeft correcte JSON terug wanneer "thinking" is uitgeschakeld. Teams die gestructureerde output nodig hebben, zouden de thinking-flag voor extractietaken moeten uitschakelen, anders ontvangen ze syntactisch correcte maar numeriek onjuiste gegevens.
Afwijzingsgedrag verandert de regels
Het preview-model kon een vraag weigeren die het onbeantwoordbaar achtte, met de reactie: "Ik weet het niet." Het GA-model doet dit niet meer. In plaats daarvan raakt het ofwel zijn tokenbudget op zonder antwoord te geven, of het verzint een antwoord. Deze verandering verbetert de token-efficiëntie, maar haalt een vangnet weg dat voorkwam dat het model hallucineerde bij onbekende onderwerpen.
Verbetering van de betrouwbaarheid
Een gevaarlijke lus in de preview-versie — veroorzaakt door een bescheiden "thinking"-budget — kon ervoor zorgen dat het model dezelfde tekst bleef herhalen totdat het venster van 8.192 tokens vol was. De GA-release lost deze bug op, waardoor de ongecontroleerde herhalingen stoppen die voorheen het risico liepen het request-venster uit te putten en de kosten op te drijven.
Waar gebruikers op moeten letten
- Gebruik de GA-versie voor een lager aantal tokens. De gemeten verminderingen blijven standhouden, ongeacht de complexiteit van de taak.
- Schakel "thinking" uit voor JSON- of gestructureerde data-extractie. Dit levert correcte waarden op en houdt het tokenverbruik minimaal.
- Vertrouw niet op ingebouwde weigeringen. Als een prompt vraagt om niet-verifieerbare gegevens, kan het GA-model nog steeds een antwoord genereren, dus validatie in een latere fase blijft essentieel.
- Let op de facturatie tijdens piekuren. Nieuwe prijsregels zorgen ervoor dat het tokenverbruik tijdens perioden met veel verkeer een grotere impact heeft op de totale kosten dan voorheen.
Conclusie
Het V4 Pro GA-model van DeepSeek levert een duidelijke efficiëntiewinst op — tot 62% minder reasoning-tokens — en lost een kritieke herhalingsbug op. Het verlies van expliciete weigeringen en de noodzaak om "thinking" uit te schakelen voor nauwkeurige JSON-output brengen echter nieuwe overwegingen met zich mee. Teams die hun pipelines aanpassen, kunnen de kosten verlagen zonder in te leveren op functionaliteit.
Bron: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
