מאמר: Whisper מול API: מתי מודל "חינמי" הופך לסעיף היקר ביותר בתקציב

הצוות שלכם רואה את החשבונית של AssemblyAI. מישהו שואל: "למה שלא פשוט נאחסן את Whisper בעצמנו כדי לחסוך כסף?"

זה נשמע פשוט. מורידים checkpoint. מריצים פקודה. מסיימים תוך אחה"צ.

אבל השאלה האמיתית היא: מה תהיה העלות של הרצת ה-endpoint הזה בשנתיים הקרובות?

למה חשבונית ה-API נראית זולה

שירותי תמלול מנוהלים גובים תשלום לפי שנייה של אודיו שעבר עיבוד. AssemblyAI, למשל, גובה בערך $0.15–$0.21 עבור כל שעת תוכן שעוברת דרך ה-asynchronous pipeline שלה. המספרים האלה מסתירים הרבה עבודה: הספק מתחזק את חומרת ה-inference, מנקה אודיו רועש, מפריד בין דוברים, מעצב entities (מספרי כרטיסי אשראי, אימיילים, קודי אימות), משדר תוצאות בזמן אמת, ומנטר את השירות 24/7. החשבונית שאתם מקבלים היא הסכום של כל זה, מאוחד לתעריף פשוט לפי שנייה.

מה מחיר ה-GPU באמת אומר

Whisper Large-v3 יכול לרוץ על GPU מסוג A100 או H100 בודד. ספקי ענן מציעים את הכרטיסים האלה במחיר של $2–$4 לשעה לפי דרישה (on demand). המלכוד הוא שאתם משלמים את המחיר השעתי המלא גם כשהצ'יפ נמצא במצב idle. אם עומס העבודה שלכם משתמש רק ב-15% מהקיבולת של ה-GPU, אתם עדיין סופגים את החיוב המלא של $2–$4.

חוב הנדסי שאתם יורשים

אירוח עצמי (Self-hosting) לא מסתיים בהרצת model checkpoint. העבודה הנסתרת מהירה מאוד עולה על עלות החומרה הגלויה.

  • Speaker diarization – Whisper בקוד פתוח אינו מפריד בין קולות. בניית pipeline אמין ל-diarization דורשת מודל נפרד, נתונים וכוונון (tuning) מתמשך.
  • תמיכה ב-Streaming – Whisper מעבד קבצים שלמים באופן אסינכרוני. כתוביות בזמן אמת או תגובות של סוכני קול