Whisper versus API : quand un modèle « gratuit » devient le poste de dépense le plus coûteux

Votre équipe consulte la facture AssemblyAI. Quelqu'un demande : « Pourquoi ne pas simplement héberger Whisper nous-mêmes pour économiser de l'argent ? »

Cela semble simple. Télécharger un checkpoint. Lancer une commande. Terminé en un après-midi.

Mais la vraie question est la suivante : quel sera le coût de fonctionnement de ce point de terminaison (endpoint) au cours des deux prochaines années ?

Pourquoi la facture de l'API semble peu élevée

Les services de transcription gérés facturent à la seconde d'audio traitée. AssemblyAI, par exemple, facture environ 0,15 $ – 0,21 $ pour chaque heure de contenu passant par son pipeline asynchrone. Ces chiffres cachent un travail considérable : le fournisseur assure la maintenance du matériel d'inférence, nettoie l'audio bruité, sépare les interlocuteurs, formate les entités (numéros de carte bancaire, e-mails, codes de vérification), diffuse les résultats en temps réel et surveille le service 24h/24 et 7j/7. La facture que vous recevez est la somme de tout cela, regroupée dans un simple tarif à la seconde.

Ce que le prix du GPU signifie réellement

Whisper Large-v3 peut fonctionner sur un seul GPU A100 ou H100. Les fournisseurs de cloud proposent ces cartes à environ 2 $ – 4 $ par heure à la demande. Le piège est que vous payez le tarif horaire complet même lorsque la puce est inactive. Si votre charge de travail n'utilise que 15 % de la capacité du GPU, vous supportez tout de même la charge complète de 2 $ – 4 $.

La dette technique que vous héritez

L'auto-hébergement ne s'arrête pas au lancement d'un checkpoint de modèle. Le travail caché dépasse rapidement le coût matériel affiché.

  • Diarisation des locuteurs – Whisper en version open-source ne sépare pas les voix. La construction d'un pipeline de diarisation fiable nécessite un modèle distinct, des données et un réglage continu.
  • Support du streaming – Whisper traite les fichiers entiers de manière asynchrone. Les sous-titres en temps réel ou les réponses d'agents vocaux nécessitent une couche de streaming personnalisée, incluant la gestion de la contre-pression (back-pressure) et la surveillance de la latence.
  • Formatage des entités – Les transcriptions brutes manquent de logique pour masquer ou reformater les chaînes sensibles. L'ajout de règles pour les numéros de carte bancaire, les adresses e-mail ou les codes OTP est un effort d'ingénierie non négligeable, et une seule erreur de frappe peut rendre une transcription inutilisable.
  • Ingénierie de la fiabilité – Une démo qui tourne sur un seul GPU est facile à réaliser ; un service de production doit gérer la concurrence, les tentatives de reconnexion (retries), les mises à jour sans interruption de service et les alertes.

Quand l'auto-hébergement est réellement rentable

L'équation change uniquement dans quelques scénarios précis :

  • Traitement par lots (batch) intensif et continu – Si vous avez suffisamment d'audio pour maintenir un GPU à une utilisation proche de 100 % pendant des mois, le coût matériel horaire peut être amorti sur un volume massif de transcriptions, rendant le coût par audio inférieur au tarif de l'API.
  • Exigences strictes de confidentialité des données – Les réglementations interdisant que l'audio quitte vos locaux vous obligent à maintenir le traitement en interne, quel qu'en soit le coût.
  • Contrôle total du modèle pour le prototypage – Les expérimentations précoces nécessitant d'ajuster l'architecture de Whisper, les prompts, ou d'effectuer un fine-tuning sur des données propriétaires bénéficient de la possession directe du checkpoint.

En dehors de ces cas, le modèle « gratuit » devient le poste de dépense le plus élevé, car la dette technique cachée et le temps d'utilisation sous-optimal du GPU éclipsent rapidement les modestes frais par seconde de l'API.

À retenir : L'absence de frais de licence pour Whisper est tentante, mais le coût total de possession inclut le prix du GPU, le temps d'inactivité et une série de tâches d'ingénierie que la plupart des équipes sous-traitent déjà à des API de transcription. L'auto-hébergement ne devient une option plus économique que lorsque vous pouvez pleinement utiliser le matériel, que vous devez conserver les données sur site (on-prem), ou que vous avez besoin d'un contrôle profond du modèle. Autrement, le modèle « gratuit » est probablement la partie la plus coûteuse de votre budget de transcription.