Whisper versus API: Wanneer een "gratis" model de duurste post op de factuur wordt

Je team ziet de factuur van AssemblyAI. Iemand vraagt: "Waarom hosten we Whisper niet gewoon zelf om geld te besparen?"

Het klinkt simpel. Download een checkpoint. Voer een commando uit. Klaar in een middag.

Maar de echte vraag is: wat zijn de kosten om die endpoint de komende twee jaar te draaien?

Waarom de API-factuur goedkoop lijkt

Managed transcriptieservices rekenen per seconde aan verwerkte audio. AssemblyAI brengt bijvoorbeeld ongeveer $0,15 – $0,21 in rekening voor elke uur aan content die door hun asynchrone pipeline gaat. Die cijfers verbergen een hoop werk: de provider onderhoudt de inference-hardware, reinigt ruis uit audio, scheidt sprekers, formatteert entiteiten (creditcardnummers, e-mailadressen, verificatiecodes), streamt resultaten in realtime en monitort de service 24/7. De factuur die je ontvangt is de som van al dat werk, gebundeld in een eenvoudig tarief per seconde.

Wat de GPU-prijs werkelijk betekent

Whisper Large-v3 kan draaien op een enkele A100- of H100-GPU. Cloudproviders bieden deze kaarten aan voor $2 – $4 per uur on-demand. Het addertje onder het gras is dat je het volledige uurtarief betaalt, zelfs als de chip niets doet. Als je workload slechts 15% van de capaciteit van de GPU gebruikt, betaal je nog steeds de volledige $2 – $4.

De technische schuld die je overneemt

Zelf hosten stopt niet bij het lanceren van een model checkpoint. Het verborgen werk weegt al snel zwaarder dan de hardwarekosten die in de krantenkoppen staan.

  • Speaker diarization – Open-source Whisper scheidt geen stemmen. Het bouwen van een betrouwbare diarization-pipeline vereist een apart model, data en voortdurende afstemming.
  • Streamingondersteuning – Whisper verwerkt volledige bestanden asynchroon. Realtime ondertiteling of reacties van voice-agents hebben een aangepaste streaminglaag nodig, inclusief back-pressure-afhandeling en latency-monitoring.
  • Entiteitsformattering – Ruwe transcripties missen de logica om gevoelige tekstfragmenten te maskeren of te herformatteren. Het toevoegen van regels voor creditcardnummers, e-mailadressen of OTP-codes is een aanzienlijke engineering-inspanning, en één typefout kan een transcript onbruikbaar maken.
  • Reliability engineering – Een demo die op één GPU draait is eenvoudig; een productieservice moet omgaan met concurrency, retries, zero-downtime upgrades en alerting.

Wanneer zelf hosten daadwerkelijk rendabel is

De rekensom slaat alleen om in een paar specifieke scenario's:

  • Zware, continue batchverwerking – Als je genoeg audio hebt om een GPU maandenlang op bijna 100% benutting te houden, kunnen de hardwarekosten per uur worden afgeschreven over een enorme hoeveelheid transcripties, waardoor de kosten per audiofragment lager worden dan het API-tarief.
  • Strikte privacyvoorschriften – Regelgeving die verbiedt dat audio je bedrijfspand verlaat, dwingt je om de verwerking intern te houden, ongeacht de kosten.
  • Volledige modelcontrole voor prototyping – Experimenten in een vroeg stadium waarbij de architectuur van Whisper, prompts moeten worden aangepast of waarbij fine-tuning op eigen data nodig is, profiteren van het direct bezitten van het checkpoint.

Buiten deze scenario's wordt het "gratis" model de duurste post op de factuur, omdat de verborgen technische schuld en de onbenutte GPU-tijd de bescheiden API-kosten per seconde snel overschaduwen.

Conclusie: De licentievrije status van Whisper is verleidelijk, maar de totale eigendomskosten (TCO) omvatten GPU-prijzen, inactiviteit en een reeks engineering-taken die de meeste teams al uitbesteden aan transcriptie-API's. Alleen wanneer je de hardware volledig kunt benutten, data on-prem moet houden of diepgaande modelcontrole nodig hebt, is zelf hosten de goedkopere route. Anders is het "gratis" model waarschijnlijk het duurste onderdeel van je transcriptiebudget.