Whisper проти API: коли «безкоштовна» модель стає найдорожчим рядком у бюджеті
Ваша команда бачить рахунок від AssemblyAI. Хтось запитує: «Чому б нам просто не хостити Whisper самостійно, щоб заощадити?»
Це звучить просто. Завантажити чекпоінт. Запустити команду. Готово за один день.
Але справжнє питання полягає в іншому: якою буде вартість утримання цього ендпоінту протягом наступних двох років?
Чому рахунок за API здається дешевим
Керовані сервіси транскрибації стягують плату за кожну секунду обробленого аудіо. AssemblyAI, наприклад, виставляє рахунок приблизно $0,15–$0,21 за кожну годину контенту, що проходить через її асинхронний конвеєр. Ці цифри приховують величезний обсяг роботи: провайдер обслуговує обладнання для інференсу, очищує зашумлене аудіо, розділяє спікерів, форматує сутності (номери кредитних карток, електронні адреси, коди підтвердження), стрімить результати в реальному часі та здійснює моніторинг сервісу 24/7. Рахунок, який ви отримуєте, — це сума всього цього, об'єднана в просту посекундну ставку.
Що насправді означає ціна на GPU
Whisper Large-v3 може працювати на одному GPU A100 або H100. Хмарні провайдери пропонують ці карти за $2–$4 за годину за запитом. Підвох полягає в тому, що ви платите повну погодинну вартість, навіть якщо чип простоює. Якщо ваше робоче навантаження використовує лише 15% потужності GPU, ви все одно сплачуєте повні $2–$4.
Технічний борг, який ви успадковуєте
Самостійний хостинг не обмежується лише запуском чекпоінту моделі. Прихована робота швидко перевищує основні витрати на обладнання.
- Speaker diarization (розділення голосів) – Whisper з відкритим кодом не розділяє голоси. Побудова надійного конвеєра діаризації потребує окремої моделі, даних та постійного налаштування.
- Підтримка стрімінгу – Whisper обробляє цілі файли асинхронно. Для субтитрів у реальному часі або відповідей голосових агентів потрібен власний шар стрімінгу з механізмами керування зворотним тиском (back-pressure) та моніторингом затримки.
- Форматування сутностей – у сирих транскриптах немає логіки для маскування або реформатування конфіденційних даних. Додавання правил для номерів кредитних карток, електронних адрес або OTP-кодів — це нетривіальне інженерне завдання, і одна помилка може зробити транскрипцію непридатною для використання.
- Інженерія надійності – легко запустити демо-версію на одному GPU; але сервіс у продакшені має керувати паралелізмом, повторними спробами, оновленнями без простоїв та системою сповіщень.
Коли самостійний хостинг справді вигідний
Математика змінюється лише в кількох вузьких сценаріях:
- Велике, безперервне пакетне оброблення – якщо у вас достатньо аудіо, щоб тримати GPU завантаженим майже на 100% протягом багатьох місяців, погодинну вартість обладнання можна амортизувати на величезний обсяг транскрибації, що зробить вартість обробки одного аудіофайлу нижчою за тариф API.
- Суворі вимоги до конфіденційності даних – нормативні акти, які забороняють передачу аудіо за межі вашої інфраструктури, змушують вас здійснювати обробку локально (on-premise), незалежно від вартості.
- Повний контроль над моделлю для прототипування – експерименти на ранніх стадіях, які потребують зміни архітектури Whisper, промптів або fine-tuning на власних даних, виграють від прямого володіння чекпоїнтом.
Поза цими межами «безкоштовна» модель стає найдорожчим рядком у бюджеті, оскільки прихований технічний борг і недовикористаний час GPU швидко перекривають скромну посекундну плату за API.
Висновок: Відсутність ліцензійних платежів за Whisper є спокусливою, але загальна вартість володіння включає ціну на GPU, час простою та цілий набір інженерних завдань, які більшість команд уже передає на аутсорс через API для транскрибації. Тільки коли ви можете повністю завантажити обладнання, зобов'язані зберігати дані локально або потребуєте глибокого контролю над моделлю, самостійний хостинг стає дешевшим шляхом. В іншому випадку «безкоштовна» модель, швидше за все, стане найдорожчою частиною вашого бюджету на транскрибацію.
