מאמר: Whisper מול API: מתי מודל "חינמי" הופך לסעיף היקר ביותר בתקציב
הצוות שלכם רואה את החשבונית של AssemblyAI. מישהו שואל: "למה שלא פשוט נאחסן את Whisper בעצמנו כדי לחסוך כסף?"
זה נשמע פשוט. מורידים checkpoint. מריצים פקודה. מסיימים תוך אחה"צ.
אבל השאלה האמיתית היא: מה תהיה העלות של הרצת ה-endpoint הזה בשנתיים הקרובות?
למה חשבונית ה-API נראית זולה
שירותי תמלול מנוהלים גובים תשלום לפי שנייה של אודיו שעבר עיבוד. AssemblyAI, למשל, גובה בערך $0.15–$0.21 עבור כל שעת תוכן שעוברת דרך ה-asynchronous pipeline שלה. המספרים האלה מסתירים הרבה עבודה: הספק מתחזק את חומרת ה-inference, מנקה אודיו רועש, מפריד בין דוברים, מעצב entities (מספרי כרטיסי אשראי, אימיילים, קודי אימות), משדר תוצאות בזמן אמת, ומנטר את השירות 24/7. החשבונית שאתם מקבלים היא הסכום של כל זה, מאוחד לתעריף פשוט לפי שנייה.
מה מחיר ה-GPU באמת אומר
Whisper Large-v3 יכול לרוץ על GPU מסוג A100 או H100 בודד. ספקי ענן מציעים את הכרטיסים האלה במחיר של $2–$4 לשעה לפי דרישה (on demand). המלכוד הוא שאתם משלמים את המחיר השעתי המלא גם כשהצ'יפ נמצא במצב idle. אם עומס העבודה שלכם משתמש רק ב-15% מהקיבולת של ה-GPU, אתם עדיין סופגים את החיוב המלא של $2–$4.
חוב הנדסי שאתם יורשים
אירוח עצמי (Self-hosting) לא מסתיים בהרצת model checkpoint. העבודה הנסתרת מהירה מאוד עולה על עלות החומרה הגלויה.
- Speaker diarization – Whisper בקוד פתוח אינו מפריד בין קולות. בניית pipeline אמין ל-diarization דורשת מודל נפרד, נתונים וכוונון (tuning) מתמשך.
- תמיכה ב-Streaming – Whisper מעבד קבצים שלמים באופן אסינכרוני. כתוביות בזמן אמת או תגובות של סוכני קול
