Whisper بمقابلہ API: جب ایک "مفت" ماڈل سب سے مہنگا خرچہ بن جائے
آپ کی ٹیم AssemblyAI کا بل دیکھتی ہے۔ کوئی پوچھتا ہے: "پیسے بچانے کے لیے ہم خود Whisper کیوں نہیں ہوسٹ کر لیتے؟"
یہ سننے میں سادہ لگتا ہے۔ ایک چیک پوائنٹ ڈاؤن لوڈ کریں۔ ایک کمانڈ چلائیں۔ ایک دوپہر میں کام ختم۔
لیکن اصل سوال یہ ہے کہ: اگلے دو سالوں تک اس اینڈ پوائنٹ (endpoint) کو چلانے کی لاگت کیا ہوگی؟
API کا بل سستا کیوں لگتا ہے
مینیجڈ ٹرانسکرپشن سروسز آڈیو پروسیسنگ کے ہر سیکنڈ کے حساب سے چارج کرتی ہیں۔ مثال کے طور پر، AssemblyAI اپنے asynchronous پائپ لائن کے ذریعے گزرنے والے ہر گھنٹے کے مواد کے لیے تقریباً $0.15 – $0.21 چارج کرتا ہے۔ یہ اعداد و شمار بہت سے کاموں کو چھپاتے ہیں: فراہم کنندہ (provider) انفرنس ہارڈ ویئر کی دیکھ بھال کرتا ہے، شور والی آڈیو کو صاف کرتا ہے، بولنے والوں کو الگ کرتا ہے، اینٹیٹیز (جیسے کریڈٹ کارڈ نمبر، ای میلز، تصدیقی کوڈز) کو فارمیٹ کرتا ہے، نتائج کو ریئل ٹائم میں اسٹریم کرتا ہے، اور 24 × 7 سروس کی نگرانی کرتا ہے۔ آپ کو موصول ہونے والا انوائس ان تمام چیزوں کا مجموعہ ہے، جسے ایک سادہ فی سیکنڈ ریٹ میں یکجا کر دیا گیا ہے۔
GPU کی قیمت کا اصل مطلب کیا ہے
Whisper Large-v3 ایک سنگل A100 یا H100 GPU پر چل سکتا ہے۔ کلاؤڈ فراہم کنندہ ان کارڈز کو ڈیمانڈ پر $2 – $4 فی گھنٹہ کے حساب سے لسٹ کرتے ہیں۔ مسئلہ یہ ہے کہ جب چپ خالی (idle) بیٹھی ہو تب بھی آپ کو مکمل گھنٹہ وار قیمت ادا کرنی پڑتی ہے۔ اگر آپ کا ورک لوڈ GPU کی صلاحیت کا صرف 15% استعمال کرتا ہے، تب بھی آپ کو پورا $2 – $4 چارج ادا کرنا ہوگا۔
وہ انجینئرنگ قرض (engineering debt) جو آپ کو ورثے میں ملتا ہے
سیلف ہوسٹنگ کا مطلب صرف ایک ماڈل چیک پوائنٹ لانچ کرنا نہیں ہے۔ چھپا ہوا کام جلد ہی ہارڈ ویئر کی ظاہری لاگت سے کہیں زیادہ ہو جاتا ہے۔
- اسپیکر ڈائیرائزیشن (Speaker diarization) – اوپن سورس Whisper آوازوں کو الگ نہیں کرتا۔ ایک قابل اعتماد ڈائیرائزیشن پائپ لائن بنانے کے لیے ایک الگ ماڈل، ڈیٹا اور مسلسل ٹیوننگ کی ضرورت ہوتی ہے۔
- اسٹریمنگ سپورٹ – Whisper مکمل فائلوں کو asynchronous طریقے سے پروسیس کرتا ہے۔ ریئل ٹائم کیپشنز یا وائس ایجنٹ کے جوابات کے لیے ایک کسٹم اسٹریمنگ لیئر کی ضرورت ہوتی ہے، جس میں بیک پریشر ہینڈلنگ (back-pressure handling) اور لیٹنسی مانیٹرنگ شامل ہو۔
- اینٹیٹی فارمیٹنگ – خام ٹرانسکرپٹس میں حساس معلومات کو چھپانے یا دوبارہ فارمیٹ کرنے کے لیے منطق (logic) کی کمی ہوتی ہے۔ کریڈٹ کارڈ نمبروں، ای میل ایڈریسز، یا OTP کوڈز کے لیے قوانین شامل کرنا ایک مشکل انجینئرنگ کام ہے، اور ایک معمولی غلطی بھی ٹرانسکرپٹ کو ناقابل استعمال بنا سکتی ہے۔
- ریلی ایبلٹی انجینئرنگ – ایک GPU پر چلنے والا ڈیمو بنانا آسان ہے؛ لیکن ایک پروڈکشن سروس کو کنکرنسی (concurrency)، ری ٹرائیز (retries)، زیرو ڈاؤن ٹائم اپ گریڈز، اور الرٹنگ کو سنبھالنا پڑتا ہے۔
سیلف ہوسٹنگ کب واقعی فائدہ مند ہوتی ہے
حساب کتاب صرف چند مخصوص حالات میں بدلتا ہے:
- بھاری، مسلسل بیچ پروسیسنگ – اگر آپ کے پاس اتنا آڈیو ہے کہ مہینوں تک GPU کو تقریباً 100% استعمال میں رکھا جا سکے، تو فی گھنٹہ ہارڈ ویئر چارج کو ٹرانسکرپشن کے ایک بہت بڑے حجم پر تقسیم (amortize) کیا جا سکتا ہے، جس سے فی آڈیو لاگت API ریٹ سے کم ہو جاتی ہے۔
- ڈیٹا پرائیویسی کے سخت قوانین – ایسے قوانین جو آڈیو کو آپ کے ادارے سے باہر لے جانے سے روکتے ہیں، آپ کو لاگت کی پرواہ کیے بغیر پروسیسنگ کو ان ہاؤس (in-house) رکھنے پر مجبور کرتے ہیں۔
- پروٹو ٹائپنگ کے لیے مکمل ماڈل کنٹرول – ابتدائی مرحلے کے تجربات جن میں Whisper کے آرکیٹیکچر، پرامپٹس (prompts) میں تبدیلی یا پراپرائٹری ڈیٹا پر فائن ٹیوننگ کی ضرورت ہو، انہیں براہ راست چیک پوائنٹ کے مالک ہونے سے فائدہ ہوتا ہے۔
ان حالات کے علاوہ، "مفت" ماڈل سب سے مہنگا خرچہ بن جاتا ہے کیونکہ چھپا ہوا انجینئرنگ قرض اور غیر استعمال شدہ GPU کا وقت جلد ہی API کی معمولی فی سیکنڈ فیس پر بھاری پڑ جاتا ہے۔
خلاصہ: Whisper کی زیرو لائسنس فیس پرکشش ہے، لیکن ملکیت کی کل لاگت (total cost of ownership) میں GPU کی قیمت، فارغ وقت، اور انجینئرنگ کے وہ کام شامل ہیں جنہیں زیادہ تر ٹیمیں پہلے ہی ٹرانسکرپشن APIs کو آؤٹ سورس کر دیتی ہیں۔ سیلف ہوسٹنگ صرف اس وقت سستا راستہ بنتی ہے جب آپ ہارڈ ویئر کا مکمل استعمال کر سکیں، ڈیٹا کو آن پریمیس (on-prem) رکھنا ضروری ہو، یا آپ کو ماڈل پر گہرا کنٹرول چاہیے ہو۔ ورنہ، "مفت" ماڈل غالباً آپ کے ٹرانسکرپشن بجٹ کا سب سے مہنگا حصہ ہوگا۔
