Whisper ਬਨਾਮ API: ਜਦੋਂ ਇੱਕ “ਮੁਫ਼ਤ” ਮਾਡਲ ਸਭ ਤੋਂ ਮਹਿੰਗੀ ਲਾਈਨ ਆਈਟਮ ਬਣ ਜਾਂਦਾ ਹੈ

ਤੁਹਾਡੀ ਟੀਮ AssemblyAI ਦਾ ਬਿੱਲ ਦੇਖਦੀ ਹੈ। ਕੋਈ ਪੁੱਛਦਾ ਹੈ: "ਪੈਸੇ ਬਚਾਉਣ ਲਈ ਅਸੀਂ Whisper ਨੂੰ ਖੁਦ ਕਿਉਂ ਨਹੀਂ ਚਲਾਉਂਦੇ (host ਕਰਦੇ)?"

ਇਹ ਸੁਣਨ ਵਿੱਚ ਸੌਖਾ ਲੱਗਦਾ ਹੈ। ਇੱਕ checkpoint ਡਾਊਨਲੋਡ ਕਰੋ। ਇੱਕ command ਚਲਾਓ। ਇੱਕ ਦੁਪਹਿਰ ਵਿੱਚ ਕੰਮ ਖ਼ਤਮ।

ਪਰ ਅਸਲੀ ਸਵਾਲ ਇਹ ਹੈ: ਅਗਲੇ ਦੋ ਸਾਲਾਂ ਲਈ ਉਸ endpoint ਨੂੰ ਚਲਾਉਣ ਦੀ ਕੀ ਲਾਗਤ ਹੋਵੇਗੀ?

API ਬਿੱਲ ਸਸਤਾ ਕਿਉਂ ਲੱਗਦਾ ਹੈ

Managed transcription ਸੇਵਾਵਾਂ ਪ੍ਰੋਸੈਸ ਕੀਤੇ ਗਏ ਆਡੀਓ ਦੇ ਹਰ ਸੈਕਿੰਡ ਦੇ ਹਿਸਾਬ ਨਾਲ ਚਾਰਜ ਕਰਦੀਆਂ ਹਨ। ਉਦਾਹਰਨ ਲਈ, AssemblyAI ਇਸਦੇ asynchronous pipeline ਰਾਹੀਂ ਲੰਘਣ ਵਾਲੇ ਹਰ ਇੱਕ ਘੰਟੇ ਦੇ ਕੰਟੈਂਟ ਲਈ ਲਗਭਗ $0.15 – $0.21 ਬਿੱਲ ਕਰਦਾ ਹੈ। ਇਹ ਅੰਕੜੇ ਬਹੁਤ ਸਾਰੇ ਕੰਮਾਂ ਨੂੰ ਛੁਪਾਉਂਦੇ ਹਨ: ਪ੍ਰੋਵਾਈਡਰ inference hardware ਦਾ ਰੱਖ-ਰਖਾਅ ਕਰਦਾ ਹੈ, ਸ਼ੋਰ ਵਾਲੀ ਆਡੀਓ ਨੂੰ ਸਾਫ਼ ਕਰਦਾ ਹੈ, ਬੋਲਣ ਵਾਲਿਆਂ ਨੂੰ ਵੱਖ ਕਰਦਾ ਹੈ, entities (ਕ੍ਰੈਡਿਟ-ਕਾਰਡ ਨੰਬਰ, ਈਮੇਲ, ਵੈਰੀਫਿਕੇਸ਼ਨ ਕੋਡ) ਨੂੰ ਫਾਰਮੈਟ ਕਰਦਾ ਹੈ, ਰੀਅਲ-ਟਾਈਮ ਵਿੱਚ ਨਤੀਜੇ ਸਟ੍ਰੀਮ ਕਰਦਾ ਹੈ, ਅਤੇ 24 × 7 ਸੇਵਾ ਦੀ ਨਿਗਰਾਨੀ ਕਰਦਾ ਹੈ। ਤੁਹਾਨੂੰ ਮਿਲਣ ਵਾਲਾ ਇਨਵੌਇਸ ਇਹ ਸਭ ਕੁਝ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਸਧਾਰਨ ਪ੍ਰਤੀ-ਸੈਕਿੰਡ ਦਰ ਵਿੱਚ ਮਿਸ਼ਰਤ ਹੁੰਦਾ ਹੈ।

GPU ਦੀ ਕੀਮਤ ਦਾ ਅਸਲ ਮਤਲਬ ਕੀ ਹੈ

Whisper Large-v3 ਇੱਕ ਸਿੰਗਲ A100 ਜਾਂ H100 GPU 'ਤੇ ਚੱਲ ਸਕਦਾ ਹੈ। Cloud ਪ੍ਰੋਵਾਈਡਰ ਉਹਨਾਂ ਕਾਰਡਾਂ ਨੂੰ ਆਨ-ਡਿਮਾਂਡ $2 – $4 ਪ੍ਰਤੀ ਘੰਟਾ ਦਰ 'ਤੇ ਸੂਚੀਬੱਧ ਕਰਦੇ ਹਨ। ਮੁੱਖ ਗੱਲ ਇਹ ਹੈ ਕਿ ਜਦੋਂ ਚਿੱਪ (chip) ਵਿਹਲੀ ਹੋਵੇ ਉਦੋਂ ਵੀ ਤੁਹਾਨੂੰ ਪੂਰੀ ਘੰਟਾ ਦਰ ਅਦਾ ਕਰਨੀ ਪੈਂਦੀ ਹੈ। ਜੇਕਰ ਤੁਹਾਡਾ ਕੰਮ (workload) GPU ਦੀ ਸਮਰੱਥਾ ਦਾ ਸਿਰਫ਼ 15% ਵਰਤਦਾ ਹੈ, ਤਾਂ ਵੀ ਤੁਹਾਨੂੰ ਪੂਰਾ $2 – $4 ਦਾ ਚਾਰਜ ਦੇਣਾ ਪਵੇਗਾ।

ਇੰਜੀਨੀਅਰਿੰਗ ਦੇਣ (Engineering debt) ਜੋ ਤੁਹਾਨੂੰ ਵਿਰਾਸਤ ਵਿੱਚ ਮਿਲਦਾ ਹੈ

Self-hosting ਸਿਰਫ਼ ਇੱਕ ਮਾਡਲ checkpoint ਲਾਂਚ ਕਰਨ ਤੱਕ ਹੀ ਸੀਮਤ ਨਹੀਂ ਹੈ। ਲੁਕਿਆ ਹੋਇਆ ਕੰਮ ਜਲਦੀ ਹੀ ਮੁੱਖ ਹਾਰਡਵੇਅਰ ਲਾਗਤ ਤੋਂ ਵੱਧ ਜਾਂਦਾ ਹੈ।

  • Speaker diarization – Open-source Whisper ਆਵਾਜ਼ਾਂ ਨੂੰ ਵੱਖ ਨਹੀਂ ਕਰਦਾ। ਇੱਕ ਭਰੋਸੇਯੋਗ diarization pipeline ਬਣਾਉਣ ਲਈ ਇੱਕ ਵੱਖਰੇ ਮਾਡਲ, ਡੇਟਾ ਅਤੇ ਲਗਾਤਾਰ ਟਿਊਨਿੰਗ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
  • Streaming support – Whisper ਪੂਰੀਆਂ ਫਾਈਲਾਂ ਨੂੰ asynchronously ਪ੍ਰੋਸੈਸ ਕਰਦਾ ਹੈ। ਰੀਅਲ-ਟਾਈਮ ਕੈਪਸ਼ਨ ਜਾਂ ਵੌਇਸ-ਏਜੰਟ ਜਵਾਬਾਂ ਲਈ ਇੱਕ ਕਸਟਮ ਸਟ੍ਰੀਮਿੰਗ ਲੇਅਰ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਜਿਸ ਵਿੱਚ back-pressure handling ਅਤੇ latency ਮਾਨੀਟਰਿੰਗ ਸ਼ਾਮਲ ਹੋਵੇ।
  • Entity formatting – Raw transcripts ਵਿੱਚ ਸੰਵੇਦਨਸ਼ੀਲ ਸਟ੍ਰਿੰਗਾਂ (sensitive strings) ਨੂੰ ਮਾਸਕ ਕਰਨ ਜਾਂ ਰੀਫਾਰਮੈਟ ਕਰਨ ਲਈ ਲੋਜਿਕ ਦੀ ਕਮੀ ਹੁੰਦੀ ਹੈ। ਕ੍ਰੈਡਿਟ-ਕਾਰਡ ਨੰਬਰਾਂ, ਈਮੇਲ ਪਤੇ, ਜਾਂ OTP ਕੋਡਾਂ ਲਈ ਨਿਯਮ ਜੋੜਨਾ ਇੱਕ ਗੁੰਝਲਦਾਰ ਇੰਜੀਨੀਅਰਿੰਗ ਯਤਨ ਹੈ, ਅਤੇ ਇੱਕ ਇਕਲੌਤੀ ਟਾਈਪੋ (typo) ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਨੂੰ ਬੇਕਾਰ ਕਰ ਸਕਦਾ ਹੈ।
  • Reliability engineering – ਇੱਕ GPU 'ਤੇ ਚੱਲਣ ਵਾਲਾ ਡੈਮੋ ਲਾ easy ਹੈ; ਪਰ ਇੱਕ production ਸੇਵਾ ਨੂੰ concurrency, retries, zero-downtime upgrades, ਅਤੇ alerting ਨੂੰ ਸੰਭਾਲਣਾ ਪੈਂਦਾ ਹੈ।

ਜਦੋਂ self-hosting ਅਸਲ ਵਿੱਚ ਫਾਇਦੇਮੰਦ ਹੁੰਦੀ ਹੈ

ਗਣਿਤ ਸਿਰਫ਼ ਕੁਝ ਸੀਮਤ ਸਥਿਤੀਆਂ ਵਿੱਚ ਬਦਲਦਾ ਹੈ:

  • ਭਾਰੀ, ਲਗਾਤਾਰ ਬੈਚ ਪ੍ਰੋਸੈਸਿੰਗ – ਜੇਕਰ ਤੁਹਾਡੇ ਕੋਲ ਇੰਨੀ ਆਡੀਓ ਹੈ ਕਿ ਮਹੀਨਿਆਂ ਤੱਕ GPU ਦੀ ਵਰਤੋਂ ਲਗਭਗ 100% ਰੱਖੀ ਜਾ ਸਕੇ, ਤਾਂ ਪ੍ਰਤੀ-ਘੰਟਾ ਹਾਰਡਵੇਅਰ ਚਾਰਜ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਦੇ ਵਿਸ਼ਾਲ ਆਯਾਮ ਵਿੱਚ ਵੰਡਿਆ (amortized) ਜਾ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਪ੍ਰਤੀ-ਆਡੀਓ ਲਾਗਤ API ਦਰ ਨਾਲੋਂ ਘੱਟ ਹੋ ਜਾਂਦੀ ਹੈ।
  • ਸਖ਼ਤ ਡੇਟਾ-ਪ੍ਰਾਈਵੇਸੀ ਨਿਯਮ – ਉਹ ਨਿਯਮ ਜੋ ਆਡੀਓ ਨੂੰ ਤੁਹਾਡੇ ਅਹਾਤੇ ਤੋਂ ਬਾਹਰ ਜਾਣ ਤੋਂ ਰੋਕਦੇ ਹਨ, ਤੁਹਾਨੂੰ ਲਾਗਤ ਦੀ ਪਰਵਾਹ ਕੀਤੇ ਬਿਨਾਂ ਪ੍ਰੋਸੈਸਿੰਗ ਨੂੰ ਅੰਦਰੂਨੀ (in-house) ਰੱਖਣ ਲਈ ਮਜਬੂਰ ਕਰਦੇ ਹਨ।
  • ਪ੍ਰੋਟੋਟਾਈਪਿੰਗ ਲਈ ਪੂਰਾ ਮਾਡਲ ਕੰਟਰੋਲ – ਸ਼ੁਰੂਆਤੀ ਪੜਾਅ ਦੇ ਪ੍ਰਯੋਗ ਜਿਨ੍ਹਾਂ ਨੂੰ Whisper ਦੀ ਆਰਕੀਟੈਕਚਰ, ਪ੍ਰੋਂਪਟਸ (prompts) ਨੂੰ ਬਦਲਣ, ਜਾਂ proprietary ਡੇਟਾ 'ਤੇ fine-tune ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਉਹਨਾਂ ਨੂੰ ਸਿੱਧੇ ਤੌਰ 'ਤੇ checkpoint ਦੇ ਮਾਲਕ ਹੋਣ ਦਾ ਫਾਇਦਾ ਮਿਲਦਾ ਹੈ।

ਇਹਨਾਂ ਸਥਿਤੀਆਂ ਤੋਂ ਬਾਹਰ, “ਮੁਫ਼ਤ” ਮਾਡਲ ਸਭ ਤੋਂ ਮਹਿੰਗੀ ਲਾਈਨ ਆਈਟਮ ਬਣ ਜਾਂਦਾ ਹੈ ਕਿਉਂਕਿ ਲੁਕਿਆ ਹੋਇਆ ਇੰਜੀਨੀਅਰਿੰਗ ਦੇਣ ਅਤੇ ਘੱਟ ਵਰਤਿਆ ਗਿਆ GPU ਸਮਾਂ ਜਲਦੀ ਹੀ API ਦੀ ਮਾਮੂਲੀ ਪ੍ਰਤੀ-ਸੈਕਿੰਡ ਫੀਸ ਨੂੰ ਪਿੱਛੇ ਛੱਡ ਦਿੰਦਾ ਹੈ।

ਮੁੱਖ ਨੁਕਤਾ (Takeaway): Whisper ਦੀ ਜ਼ੀਰੋ-ਲਾਈਸੈਂਸ ਫੀਸ ਆਕਰਸ਼ਕ ਹੈ, ਪਰ ਮਾਲਕੀ ਦੀ ਕੁੱਲ ਲਾਗਤ (total cost of ownership) ਵਿੱਚ GPU ਦੀ ਕੀਮਤ, ਵਿਹਲਾ ਸਮਾਂ, ਅਤੇ ਇੰਜੀਨੀਅਰਿੰਗ ਕਾਰਜਾਂ ਦਾ ਇੱਕ ਸਮੂਹ ਸ਼ਾਮਲ ਹੈ ਜਿਸ ਨੂੰ ਜ਼ਿਆਦਾਤਰ ਟੀਮਾਂ ਪਹਿਲਾਂ ਹੀ transcription APIs ਨੂੰ ਆਊਟਸੋਰਸ ਕਰ ਦਿੰਦੀਆਂ ਹਨ। ਸਿਰਫ਼ ਉਦੋਂ ਹੀ self-hosting ਸਸਤਾ ਰਸਤਾ ਬਣਦੀ ਹੈ ਜਦੋਂ ਤੁਸੀਂ ਹਾਰਡਵੇਅਰ ਦੀ ਪੂਰੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹੋ, ਡੇਟਾ ਨੂੰ on-prem ਰੱਖਣਾ ਜ਼ਰੂਰੀ ਹੋਵੇ, ਜਾਂ ਡੂੰਘੇ ਮਾਡਲ ਕੰਟਰੋਲ ਦੀ ਲੋੜ ਹੋਵੇ। ਨਹੀਂ ਤਾਂ, “ਮੁਫ਼ਤ” ਮਾਡਲ ਤੁਹਾਡੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਬਜਟ ਦਾ ਸਭ ਤੋਂ ਮਹਿੰਗਾ ਹਿੱਸਾ ਹੋਣ ਦੀ ਸੰਭਾਵਨਾ ਹੈ।