Whisper kontra API: Kiedy „darmowy” model staje się najdroższą pozycją w budżecie

Twój zespół widzi rachunek od AssemblyAI. Ktoś pyta: „Dlaczego nie hostujemy Whisper samodzielnie, żeby zaoszczędzić?”

Brzmi to prosto. Pobierz checkpoint. Uruchom komendę. Gotowe w jedno popołudnie.

Ale prawdziwe pytanie brzmi: jaki będzie koszt utrzymania tego endpointu przez najbliższe dwa lata?

Dlaczego rachunek za API wydaje się tani

Zarządzane usługi transkrypcji naliczają opłaty za każdą sekundę przetworzonego dźwięku. AssemblyAI, na przykład, pobiera około 0,15–0,21 USD za każdą godzinę treści przechodzącej przez jego potok asynchroniczny. Te liczby ukrywają mnóstwo pracy: dostawca utrzymuje sprzęt do wnioskowania (inference), oczyszcza zaszumiony dźwięk, rozdziela mówców, formatuje encje (numery kart kredytowych, adresy e-mail, kody weryfikacyjne), przesyła wyniki w czasie rzeczywistym i monitoruje usługę 24/7. Faktura, którą otrzymujesz, jest sumą tego wszystkiego, ujętą w prostą stawkę za sekundę.

Co tak naprawdę oznacza cena GPU

Whisper Large-v3 może działać na pojedynczym GPU A100 lub H100. Dostawcy chmurowi oferują te karty w trybie on-demand za 2–4 USD za godzinę. Haczyk polega na tym, że płacisz pełną stawkę godzinową nawet wtedy, gdy chip pozostaje bezczynny. Jeśli Twoje obciążenie wykorzystuje tylko 15% mocy GPU, i tak ponosisz pełną opłatę w wysokości 2–4 USD.

Dług techniczny, który przejmujesz

Samodzielne hostowanie nie kończy się na uruchomieniu checkpointu modelu. Ukryta praca szybko przewyższa główne koszty sprzętowe.

  • Diarization mówców – Open-source'owy Whisper nie rozróżnia głosów. Budowa niezawodnego potoku diarization wymaga osobnego modelu, danych i ciągłego dostrajania.
  • Obsługa streamingu – Whisper przetwarza całe pliki w sposób asynchroniczny. Napisy w czasie rzeczywistym lub odpowiedzi agentów głosowych wymagają własnej warstwy streamingu, wraz z obsługą back-pressure i monitorowaniem opóźnień.
  • Formatowanie encji – Surowe transkrypcje nie posiadają logiki pozwalającej na maskowanie lub reformatowanie wrażliwych ciągów znaków. Dodawanie reguł dla numerów kart kredytowych, adresów e-mail czy kodów OTP to niebagatelny wysiłek inżynieryjny, a jeden błąd może sprawić, że transkrypcja stanie się bezużyteczna.
  • Inżynieria niezawodności – Uruchomienie wersji demo na jednym GPU jest proste; usługa produkcyjna musi radzić sobie z współbieżnością, ponawianiem prób, aktualizacjami bez przestojów i systemem powiadomień.

Kiedy samodzielne hostowanie faktycznie się opłaca

Matematyka zmienia się tylko w kilku wąskich scenariuszach:

  • Ciężkie, ciągłe przetwarzanie wsadowe – Jeśli masz wystarczającą ilość dźwięku, aby utrzymywać GPU na poziomie bliskim 100% utylizacji przez wiele miesięcy, koszt godzinowy sprzętu można rozłożyć na ogromną liczbę transkrypcji, co sprawi, że koszt jednostkowy za nagranie będzie niższy niż stawka API.
  • Rygorystyczne wymogi dotyczące prywatności danych – Przepisy zabraniające przesyłania dźwięku poza Twoją infrastrukturę zmuszają do przetwarzania danych lokalnie, niezależnie od kosztów.
  • Pełna kontrola nad modelem na potrzeby prototypowania – Wczesne eksperymenty wymagające modyfikacji architektury Whisper, promptów lub dostrajania (fine-tuning) na własnych danych zyskują dzięki bezpośredniemu posiadaniu checkpointu.

Poza tymi przypadkami „darmowy” model staje się najdroższą pozycją w budżecie, ponieważ ukryty dług techniczny i niewykorzystany czas pracy GPU szybko przyćmiewają skromną stawkę API za sekundę.

Podsumowanie: Brak opłat licencyjnych za Whisper jest kuszący, ale całkowity koszt posiadania obejmuje ceny GPU, czas bezczynności oraz szereg zadań inżynieryjnych, które większość zespołów i tak zleca zewnętrznym usługom API. Tylko wtedy, gdy możesz w pełni wykorzystać sprzęt, musisz przechowywać dane lokalnie lub potrzebujesz głębokiej kontroli nad modelem, samodzielne hostowanie staje się tańszą drogą. W przeciwnym razie „darmowy” model prawdopodobnie okaże się najdroższą częścią Twojego budżetu na transkrypcję.