Whisper در مقابل API: وقتی یک مدل «رایگان» به گران‌ترین بند در صورت‌حساب تبدیل می‌شود

تیم شما صورت‌حساب AssemblyAI را می‌بیند. کسی می‌پرسد: «چرا برای صرفه‌جویی در هزینه‌ها، خودمان Whisper را میزبانی (host) نکنیم؟»

ساده به نظر می‌رسد. یک checkpoint دانلود کنید. یک دستور اجرا کنید. تمام؛ در یک بعدازظهر انجام می‌شود.

اما سوال اصلی این است: هزینه اجرای آن endpoint برای دو سال آینده چقدر خواهد بود؟

چرا صورت‌حساب API ارزان به نظر می‌رسد

سرویس‌های مدیریت‌شده‌ی تبدیل گفتار به متن، بر اساس ثانیه‌های فایل صوتی پردازش‌شده هزینه دریافت می‌کنند. برای مثال، AssemblyAI تقریباً برای هر ساعت محتوایی که از خط لوله (pipeline) ناهمگام (asynchronous) آن عبور می‌کند، حدود ۰.۱۵ تا ۰.۲۱ دلار هزینه می‌گیرد. این اعداد حجم زیادی از کار را پنهان می‌کنند: ارائه‌دهنده سخت‌افزار استنتاج (inference hardware) را نگهداری می‌کند، صداهای نویزدار را پاکسازی می‌کند، گویندگان را از هم جدا می‌کند، موجودیت‌ها (مانند شماره کارت‌های اعتباری، ایمیل‌ها، کدهای تأیید) را قالب‌بندی می‌کند، نتایج را به‌صورت بلادرنگ (real-time) استریم می‌کند و سرویس را به‌صورت ۲۴/۷ نظارت می‌کند. فاکتوری که دریافت می‌کنید، مجموع تمام این موارد است که در قالب یک نرخ ساده‌ی ثانیه‌ای بسته‌بندی شده است.

معنای واقعی قیمت GPU چیست

مدل Whisper Large-v3 می‌تواند روی یک GPU واحد از نوع A100 یا H100 اجرا شود. ارائه‌دهندگان ابری قیمت این کارت‌ها را در حالت On-demand حدود ۲ تا ۴ دلار در ساعت اعلام می‌کنند. نکته اینجاست که شما حتی زمانی که تراشه بیکار (idle) است، باید تمام هزینه ساعتی را بپردازید. اگر حجم کاری شما تنها ۱۵ درصد از ظرفیت GPU را اشغال کند، باز هم باید کل هزینه ۲ تا ۴ دلاری را پرداخت کنید.

بدهی مهندسی که به ارث می‌برید

میزبانی شخصی (Self-hosting) تنها به راه‌اندازی یک checkpoint مدل ختم نمی‌شود. کارهای پنهان خیلی زود از هزینه اصلی سخت‌افزار پیشی می‌گیرند.

  • Speaker diarization (تشخیص گوینده) – نسخه متن‌باز Whisper صداها را از هم جدا نمی‌کند. ساخت یک pipeline قابل اعتماد برای diarization نیازمند مدل، داده و تنظیمات (tuning) مداوم است.
  • پشتیبانی از استریمینگ (Streaming support) – Whisper فایل‌ها را به‌صورت کامل و ناهمگام پردازش می‌کند. زیرنویس‌های بلادرنگ یا پاسخ‌های عامل صوتی (voice-agent) به یک لایه استریمینگ سفارشی نیاز دارند که شامل مدیریت فشار معکوس (back-pressure handling) و نظارت بر تأخیر (latency monitoring) باشد.
  • قالب‌بندی موجودیت‌ها (Entity formatting) – متن‌های خام فاقد منطقی برای ماسک کردن یا بازقالب‌بندی رشته‌های حساس هستند. افزودن قوانین برای شماره کارت‌های اعتباری، آدرس‌های ایمیل یا کدهای OTP یک تلاش مهندسی غیرساده است و یک غلط تایپی کوچک می‌تواند متن استخراج‌شده را غیرقابل استفاده کند.
  • مهندسی قابلیت اطمینان (Reliability engineering) – اجرای یک نسخه دموی روی یک GPU آسان است؛ اما یک سرویس عملیاتی (production) باید همزمان مدیریت همزمانی (concurrency)، تلاش‌های مجدد (retries)، ارتقاء بدون قطعی (zero-downtime upgrades) و سیستم‌های هشداردهی را بر عهده داشته باشد.

چه زمانی میزبانی شخصی واقعاً به‌صرفه است

محاسبات تنها در چند سناریوی محدود تغییر می‌کند:

  • پردازش دسته‌ای (Batch processing) سنگین و مداوم – اگر فایل‌های صوتی کافی داشته باشید که یک GPU را ماه‌ها در سطح بهره‌وری نزدیک به ۱۰۰ درصد نگه دارد، هزینه ساعتی سخت‌افزار می‌تواند در حجم عظیمی از تبدیل گفتار به متن توزیع (amortized) شود و هزینه هر فایل صوتی را کمتر از نرخ API کند.
  • الزامات سخت‌گیرانه حریم خصوصی داده‌ها – مقرراتی که خروج فایل‌های صوتی از محل شرکت را ممنوع می‌کنند، شما را مجبور می‌کنند فرآیند پردازش را صرف‌نظر از هزینه، در داخل سازمان انجام دهید.
  • کنترل کامل مدل برای نمونه‌سازی (Prototyping) – آزمایش‌های مراحل اولیه که نیاز به تغییر در معماری Whisper، پرامپت‌ها یا تنظیم دقیق (fine-tune) روی داده‌های اختصاصی دارند، از داشتن مستقیم checkpoint سود می‌برند.

خارج از این چارچوب‌ها، مدل «رایگان» به گران‌ترین بند در صورت‌حساب تبدیل می‌شود؛ زیرا بدهی مهندسی پنهان و زمان بلااستفاده از GPU به‌سرعت بر هزینه ناچیز ثانیه‌ای API سایه می‌اندازند.

نکته کلیدی: هزینه لایسنس صفر برای Whisper وسوسه‌انگیز است، اما هزینه کل مالکیت (TCO) شامل قیمت GPU، زمان بیکاری و مجموعه‌ای از وظایف مهندسی است که اکثر تیم‌ها آن‌ها را به APIهای تبدیل گفتار به متن برون‌سپاری می‌کنند. تنها زمانی که بتوانید از سخت‌افزار به‌طور کامل استفاده کنید، مجبور به نگهداری داده‌ها در محل (on-prem) باشید، یا به کنترل عمیق روی مدل نیاز داشته باشید، میزبانی شخصی به مسیر ارزان‌تر تبدیل می‌شود. در غیر این صورت، مدل «رایگان» احتمالاً گران‌ترین بخش بودجه تبدیل گفتار به متن شما خواهد بود.