OpenAI ਨੇ GPT Transcribe ਅਤੇ GPT Live Transcribe ਦੀ ਰਿਲੀਜ਼ ਨਾਲ ਆਪਣੀਆਂ speech-to-text ਸਮਰੱਥਾਵਾਂ ਦਾ ਅਧਿਕਾਰਤ ਤੌਰ 'ਤੇ ਵਿਸਥਾਰ ਕੀਤਾ ਹੈ। ਇਹ ਨਵੇਂ API-driven ਮਾਡਲਾਂ ਦਾ ਉਦੇਸ਼ batch processing ਅਤੇ real-time streaming ਐਪਲੀਕੇਸ਼ਨਾਂ ਦੋਵਾਂ ਲਈ ਤੇਜ਼ ਰਫ਼ਤਾਰ ਅਤੇ ਕਿਫਾਇਤੀ transcription ਪ੍ਰਦਾਨ ਕਰਨਾ ਹੈ।

ਰਫ਼ਤਾਰ, ਸ਼ੁੱਧਤਾ, ਅਤੇ ਬਿਹਤਰ ਕੀਮਤਾਂ

ਨਵੀਂ ਰਿਲੀਜ਼ ਦੋ ਵੱਖਰੇ ਵਰਕਫਲੋ ਪੇਸ਼ ਕਰਦੀ ਹੈ: GPT Transcribe, ਜੋ ਪਹਿਲਾਂ ਤੋਂ ਰਿਕਾਰਡ ਕੀਤੀਆਂ ਆਡੀਓ ਫਾਈਲਾਂ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ, ਅਤੇ GPT Live Transcribe, ਜੋ low-latency, real-time streaming ਲਈ ਆਪਟੀਮਾਈਜ਼ ਕੀਤਾ ਗਿਆ ਹੈ। ਇੱਕ ਖਾਸ ਤਕਨੀਕੀ ਪ੍ਰਾਪਤੀ GPT Transcribe ਦੀ ਰਫ਼ਤਾਰ ਹੈ, ਜੋ ਆਡੀਓ ਫਾਈਲਾਂ ਨੂੰ real-time ਨਾਲੋਂ ਲਗਭਗ 34 ਗੁਣਾ ਤੇਜ਼ੀ ਨਾਲ ਪ੍ਰੋਸੈਸ ਕਰ ਸਕਦੀ ਹੈ।

ਸ਼ੁੱਧਤਾ ਦੇ ਮਾਮਲੇ ਵਿੱਚ, OpenAI ਨੇ ਮਹੱਤਵਪੂਰਨ ਪ੍ਰਗਤੀ ਕੀਤੀ ਹੈ। Artificial Analysis ਦੇ AA-WER ਬੈਂਚਮਾਰਕ ਅਨੁਸਾਰ, GPT Transcribe 3.31 ਪ੍ਰਤੀਸ਼ਤ ਦਾ Word Error Rate (WER) ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। ਇਹ ਇਸਦੇ ਪਿਛਲੇ ਮਾਡਲ, GPT-4o Transcribe ਦੇ ਮੁਕਾਬਲੇ 0.7 ਪ੍ਰਤੀਸ਼ਤ ਅੰਕ ਦਾ ਸੁਧਾਰ ਹੈ। ਸ਼ੁੱਧਤਾ ਵਿੱਚ ਇਸ ਉਛਾਲ ਦੇ ਨਾਲ-ਨਾਲ ਕੀਮਤਾਂ ਵਿੱਚ 25 ਪ੍ਰਤੀਸ਼ਤ ਦੀ ਕਮੀ ਵੀ ਆਈ ਹੈ, ਜਿਸ ਵਿੱਚ ਨਵੀਂ ਦਰ $0.0045 ਪ੍ਰਤੀ ਮਿੰਟ ਆਡੀਓ ਰੱਖੀ ਗਈ ਹੈ। ਸੰਦਰਭਿਕ ਸ਼ੁੱਧਤਾ (contextual accuracy) ਨੂੰ ਵਧਾਉਣ ਲਈ, ਦੋਵੇਂ ਮਾਡਲ ਟੈਕਸਟ ਕੰਟੈਕਸਟ, ਖਾਸ ਕੀਵਰਡਸ ਅਤੇ ਕਈ ਇਨਪੁਟ ਭਾਸ਼ਾਵਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨ ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹਨ।

ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦਾ ਦ੍ਰਿਸ਼: OpenAI ਬਨਾਮ ਦਿੱਗਜ

ਸੁਧਾਰਾਂ ਦੇ ਬਾਵਜੂਦ, OpenAI ਆਪਣੇ ਆਪ ਨੂੰ speech supremacy ਲਈ ਇੱਕ ਭਖਦੀ ਹੋਈ ਦੌੜ ਵਿੱਚ ਪਾਉਂਦਾ ਹੈ, ਜਿੱਥੇ ਇਹ ਸ਼ੁੱਧਤਾ ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਵਿਸ਼ੇਸ਼ ਲੀਡਰਾਂ ਤੋਂ ਪਿੱਛੇ ਹੈ। AA-WER ਰੈਂਕਿੰਗ ਦੱਸਦੀ ਹੈ ਕਿ OpenAI ਦੀ 3.31% ਗਲਤੀ ਦੀ ਦਰ ਨੂੰ ਵਰਤਮਾਨ ਵਿੱਚ ਕਈ ਮੁੱਖ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਦੁਆਰਾ ਪਛਾੜ ਦਿੱਤਾ ਗਿਆ ਹੈ:

  • ElevenLabs: ਆਪਣੇ Scribe v2 ਮਾਡਲ ਨਾਲ ਉਦਯੋਗ ਦੀ ਅਗਵਾਈ ਕਰਦਾ ਹੈ, ਜੋ 2.3% ਦੀ ਉੱਤਮ ਗਲਤੀ ਦੀ ਦਰ ਦਾ ਦਾਅਵਾ ਕਰਦਾ ਹੈ।
  • Google: ਇਸਦਾ Gemini 3 Pro ਮਾਡਲ 2.9% ਗਲਤੀ ਦੀ ਦਰ ਨਾਲ ਨੇੜਿਓਂ ਆਉਂਦਾ ਹੈ।
  • Mistral: Voxtral Small ਮਾਡਲ 3% ਗਲਤੀ ਦੀ ਦਰ ਨਾਲ ਮਜ਼ਬੂਤ ਸਥਿਤੀ ਵਿੱਚ ਹੈ।

ਸ਼ੁੱਧਤਾ ਤੋਂ ਇਲਾਵਾ, ਲੜਾਈ ਹੁਣ ਕੀਮਤ ਦੇ ਮੁਕਾਬਲੇ ਵੱਲ ਵੀ ਵਧ ਰਹੀ ਹੈ। Mistral ਨੇ ਹਾਲ ਹੀ ਵਿੱਚ ਆਪਣੇ Voxtral Transcribe V2 ਨਾਲ ਮਾਰਕੀਟ ਵਿੱਚ ਕੀਮਤ ਘਟਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ ਹੈ, ਜੋ ਕਿ ਬਹੁਤ ਹੀ ਘੱਟ $0.003 ਪ੍ਰਤੀ ਮਿੰਟ ਤੋਂ ਸ਼ੁਰੂ ਹੁੰਦੀ ਹੈ।

OpenAI Ecosystem ਨਾਲ ਇੱਕੀਕਰਨ

ਇਹ transcription ਮਾਡਲ ਕੋਈ ਸੁਤੰਤਰ ਟੂਲ ਨਹੀਂ ਹਨ; ਉਹ OpenAI ਦੀ ਵਿਆਪਕ multimodal ਰਣਨੀਤੀ ਦੇ ਅਨਿੱਖੜਵਾਂ ਅੰਗ ਹਨ। ਉਹ ਹਾਲ ਹੀ ਵਿੱਚ ਐਲਾਨੇ ਗਏ Realtime ਮਾਡਲ ਜਨਰੇਸ਼ਨ ਦੀ ਪੂਰਤੀ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤੇ ਗਏ ਹਨ, ਜਿਸ ਵਿੱਚ GPT-Realtime-Whisper ਮਾਡਲ ਸ਼ਾਮਲ ਹੈ। ਉੱਚ-ਰਫ਼ਤਾਰ batch transcription ਅਤੇ low-latency live streaming ਦੋਵਾਂ ਦੀ ਪੇਸ਼ਕਸ਼ ਕਰਕੇ, OpenAI ਆਪਣੇ ਆਪ ਨੂੰ ਡਿਵੈਲਪਰਾਂ ਦੀ ਇੱਕ ਵਿਸ਼ਾਲ ਸ਼੍ਰੇਣੀ ਦੀ ਸੇਵਾ ਕਰਨ ਲਈ ਤਿਆਰ ਕਰ ਰਿਹਾ ਹੈ—ਉਹਨਾਂ ਤੋਂ ਲੈ ਕੇ ਜੋ ਆਟੋਮੇਟਡ ਮੀਟਿੰਗ ਅਸਿਸਟੈਂਟ ਬਣਾ ਰਹੇ ਹਨ, ਉਹਨਾਂ ਤੱਕ ਜੋ ਰੀਅਲ-ਟਾਈਮ ਅਨੁਵਾਦ ਸੇਵਾਵਾਂ ਬਣਾ ਰਹੇ ਹਨ।

ਵਿਆਪਕ AI ਲੈਂਡਸਕੇਪ ਲਈ, ਇਹ ਵਿਕਾਸ "ਕਿਸੇ ਵੀ ਕੀਮਤ 'ਤੇ ਸ਼ੁੱਧਤਾ" ਤੋਂ ਰਫ਼ਤਾਰ, ਲਾਗਤ ਅਤੇ ਸ਼ੁੱਧਤਾ ਦੇ ਵਧੇਰੇ ਸੰਤੁਲਿਤ ਅਨੁਕੂਲਨ (optimization) ਵੱਲ ਇੱਕ ਤਬਦੀਲੀ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ। ਭਾਵੇਂ OpenAI ਸਭ ਤੋਂ ਘੱਟ ਗਲਤੀ ਦੀ ਦਰ ਦਾ ਖਿਤਾਬ ਨਾ ਰੱਖਦਾ ਹੋਵੇ, ਪਰ ਇਸਦੀ ਵੱਡੀ ਕੁਸ਼ਲਤਾ ਪ੍ਰਦਾਨ ਕਰਨ ਦੀ ਯੋਗਤਾ ਇਸਨੂੰ ਪ੍ਰੋਡਕਸ਼ਨ-ਗ੍ਰੇਡ AI ਮਾਰਕੀਟ ਵਿੱਚ ਇੱਕ ਸ਼ਕਤੀਸ਼ਾਲੀ ਖਿਡਾਰੀ ਬਣਾਉਂਦੀ ਹੈ।

ਮੁੱਖ ਗੱਲਾਂ

  • ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਸੁਧਾਰ: GPT Transcribe Word Error Rate ਨੂੰ ਘਟਾ ਕੇ 3.31% ਕਰ ਦਿੰਦਾ ਹੈ ਅਤੇ ਆਡੀਓ ਨੂੰ real-time ਨਾਲੋਂ 34 ਗੁਣਾ ਤੇਜ਼ੀ ਨਾਲ ਪ੍ਰੋਸੈਸ ਕਰਦਾ ਹੈ।
  • ਲਾਗਤ ਕੁਸ਼ਲਤਾ: OpenAI ਨੇ transcription ਦੀਆਂ ਕੀਮਤਾਂ ਵਿੱਚ 25% ਦੀ ਕਟੌਤੀ ਕੀਤੀ ਹੈ, ਜਿਸ ਨਾਲ ਲਾਗਤ ਘਟ ਕੇ $0.0045 ਪ੍ਰਤੀ ਮਿੰਟ ਹੋ ਗਈ ਹੈ।
  • ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦਾ ਦਬਾਅ: OpenAI ਅਜੇ ਵੀ ਸ਼ੁੱਧਤਾ ਵਿੱਚ ElevenLabs (2.3% WER) ਅਤੇ Google (2.9% WER) ਤੋਂ ਪਿੱਛੇ ਹੈ, ਜਦੋਂ ਕਿ Mistral ਕੀਮਤ ਦੇ ਮਾਮਲੇ ਵਿੱਚ ਅੱਗੇ ਹੈ।

OpenAI ਨੇ ਦੋ ਨਵੇਂ speech-to-text APIs—batch ਫਾਈਲਾਂ ਲਈ GPT Transcribe ਅਤੇ streaming ਲਈ GPT Live Transcribe—ਲਾਂਚ ਕੀਤੇ ਹਨ, ਜੋ 34 ਗੁਣਾ ਤੇਜ਼ ਪ੍ਰੋਸੈਸਿੰਗ ਅਤੇ 25 ਪ੍ਰਤੀਸ਼ਤ ਕੀਮਤ ਵਿੱਚ ਕਟੌਤੀ ਦਾ ਵਾਅਦਾ ਕਰਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਲਾਗਤ $0.0045 ਪ੍ਰਤੀ ਮਿੰਟ ਹੋ ਜਾਂਦੀ ਹੈ।

ਇਹ ਲਾਂਚ ਉਦੋਂ ਹੋਇਆ ਹੈ ਜਦੋਂ ਡਿਵੈਲਪਰ ਅਜਿਹੀਆਂ transcription ਸੇਵਾਵਾਂ ਦੀ ਭਾਲ ਕਰ ਰਹੇ ਹਨ ਜੋ ਘੱਟ ਮੁਨਾਫੇ ਦੇ ਮਾਰਜਿਨ ਦੇ ਅੰਦਰ ਰਹਿੰਦੇ ਹੋਏ ਵੱਡੇ ਆਡੀਓ ਡੇਟਾਸੈਟਾਂ ਦੇ ਨਾਲ ਚੱਲ ਸਕਣ।

ਅਪਗ੍ਰੇਡ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

GPT Live Transcribe low-latency streaming ਜੋੜਦਾ ਹੈ, ਜਿਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਡਿਵੈਲਪਰ ਇੱਕ ਲਾਈਵ ਮਾਈਕ੍ਰੋਫੋਨ ਫੀਡ ਨੂੰ API ਵਿੱਚ ਭੇਜ ਸਕਦੇ ਹਨ ਅਤੇ ਲਗਭਗ ਤੁਰੰਤ ਟੈਕਸਟ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੇ ਹਨ। ਦੋਵੇਂ ਮਾਡਲ ਸਹਾਇਕ ਟੈਕਸਟ ਕੰਟੈਕਸਟ, ਕੀਵਰਡ ਹਿੰਟਸ ਅਤੇ ਬਹੁ-ਭਾਸ਼ਾਈ ਇਨਪੁਟ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦੇ ਹਨ, ਜੋ ਸਿਸਟਮ ਨੂੰ ਖੇਤਰ-ਵਿਸ਼ੇਸ਼ ਸ਼ਬਦਾਵਲੀ (domain-specific terminology) ਦਾ ਧਿਆਨ ਰੱਖਣ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ।

ਸ਼ੁੱਧਤਾ ਵੀ ਸੁਧਰਦੀ ਹੈ। Artificial Analysis ਦਾ AA-WER ਬੈਂਚਮਾਰਕ GPT Transcribe ਲਈ 3.31 ਪ੍ਰਤੀਸ਼ਤ ਦਾ Word Error Rate (WER) ਦਰਜ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਪਿਛਲੇ GPT-4o Transcribe ਮਾਡਲ ਨਾਲੋਂ 0.7-ਪੁਆਇੰਟ ਦੀ ਗਿਰਾਵਟ ਹੈ। ਭਾਵੇਂ ਇਹ ਲੀਡਰਬੋਰਡ 'ਤੇ ਸਭ ਤੋਂ ਘੱਟ ਅੰਕੜਾ ਨਹੀਂ ਹੈ, ਪਰ ਇਹ ਮਾਰਜਿਨ ਇੰਨਾ ਛੋਟਾ ਹੈ ਕਿ ਕਈ ਪ੍ਰੋਡਕਸ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਇਸਨੂੰ ਸਹਿਣ ਕਰ ਸਕਦੀਆਂ ਹਨ, ਖਾਸ ਕਰਕੇ ਜਦੋਂ ਰਫ਼ਤਾਰ ਵਿੱਚ ਵਾਧਾ ਕੰਪਿਊਟ ਬਿੱਲਾਂ ਨੂੰ ਘਟਾਉਣ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ।

ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦੀ ਤਸਵੀਰ

ਉਹੀ AA-WER ਰੈਂਕਿੰਗ ਤਿੰਨ ਵਿਰੋਧੀਆਂ ਨੂੰ ਸ਼ੁੱਧ ਗਲਤੀ ਦੀ ਦਰ 'ਤੇ OpenAI ਤੋਂ ਅੱਗੇ ਨਿਕਲਦੇ ਦਿਖਾਉਂਦੀ ਹੈ:

  • ElevenLabs ਦਾ Scribe v2 2.3 ਪ੍ਰਤੀਸ਼ਤ 'ਤੇ
  • Google ਦਾ Gemini 3 Pro 2.9 ਪ੍ਰਤੀਸ਼ਤ 'ਤੇ
  • Mistral ਦਾ Voxtral Small 3 ਪ੍ਰਤੀਸ਼ਤ 'ਤੇ

Mistral ਦਾ ਹਾਲੀਆ Voxtral Transcribe V2 ਕੀਮਤ ਦੇ ਮਾਮਲੇ ਵਿੱਚ OpenAI ਤੋਂ ਵੀ ਘੱਟ ਹੈ, ਜੋ ਕਿ $0.003 ਪ੍ਰਤੀ ਮਿੰਟ ਦੀ ਦਰ 'ਤੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ (transcription) ਦੀ ਸਹੂਲਤ ਦਿੰਦਾ ਹੈ। ਇਹ ਅੰਕੜੇ ਇੱਕ ਸਪੱਸ਼ਟ ਤਾਲਮੇਲ (trade-off) ਪੈਦਾ ਕਰਦੇ ਹਨ: ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਇਹ ਫੈਸਲਾ ਕਰਨਾ ਹੋਵੇਗਾ ਕਿ ਉਹ ਸਭ ਤੋਂ ਸਸਤੀ ਪ੍ਰਤੀ-ਮਿੰਟ ਦਰ, ਸਭ ਤੋਂ ਘੱਟ ਗਲਤੀ ਦੀ ਮਾਰਜਿਨ, ਜਾਂ OpenAI ਦੇ ਵਿਆਪਕ ਈਕੋਸਿਸਟਮ ਦੁਆਰਾ ਪ੍ਰਦਾਨ ਕੀਤੀ ਜਾਣ ਵਾਲੀ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਦੀ ਸਹੂਲਤ ਵਿੱਚੋਂ ਕਿਸ ਨੂੰ ਮਹੱਤਵ ਦਿੰਦੇ ਹਨ।

ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਕੀ ਮਿਲਦਾ ਹੈ – ਅਤੇ ਉਹ ਕੀ ਗੁਆਉਂਦੇ ਹਨ

ਸਪੀਡ ਅਤੇ ਲਾਗਤ ਮੁੱਖ ਲਾਭ ਹਨ। ਇੱਕ ਬੈਚ ਜੌਬ (batch job) ਜਿਸ ਲਈ ਪਹਿਲਾਂ ਇੱਕ ਪੂਰਾ ਘੰਟਾ ਕੰਪਿਊਟਿੰਗ ਦੀ ਲੋੜ ਹੁੰਦੀ ਸੀ, ਹੁਣ ਬਹੁਤ ਤੇਜ਼ੀ ਨਾਲ ਖਤਮ ਹੋ ਜਾਂਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਹੋਰ ਕੰਮਾਂ ਲਈ GPU ਸਮਾਂ ਬਚ ਜਾਂਦਾ ਹੈ। $0.0045-ਪ੍ਰਤੀ-ਮਿੰਟ ਦੀ ਦਰ ਪਿਛਲੀ ਕੀਮਤਾਂ ਦੇ ਮੁਕਾਬਲੇ ਦਸ ਘੰਟੇ ਦੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਦੀ ਲਾਗਤ ਨੂੰ ਵੀ ਘਟਾਉਂਦੀ ਹੈ, ਜੋ ਕਿ ਹਜ਼ਾਰਾਂ ਘੰਟਿਆਂ ਤੱਕ ਵਧਾਉਣ 'ਤੇ ਇੱਕ ਮਾਮੂਲੀ ਪਰ ਮਹਿਸੂਸ ਕੀਤੇ ਜਾਣ ਯੋਗ ਬਚਤ ਹੈ।

ਈਕੋਸਿਸਟਮ ਸਿੰਰਜੀ (Ecosystem synergy) ਇੱਕ ਹੋਰ ਵਿਕਰੀ ਬਿੰਦੂ ਹੈ। ਨਵੇਂ ਮਾਡਲ OpenAI ਦੀਆਂ ਮਲਟੀਮੋਡਲ ਪੇਸ਼ਕਸ਼ਾਂ ਦੇ ਨਾਲ ਮੌਜੂਦ ਹਨ, ਜਿਸ ਵਿੱਚ ਹਾਲ ਹੀ ਵਿੱਚ ਐਲਾਨਿਆ ਗਿਆ Realtime ਮਾਡਲ ਜਨਰੇਸ਼ਨ ਅਤੇ GPT-Realtime-Whisper ਸ਼ਾਮਲ ਹਨ। ਇਸ ਲਈ, ਇੱਕ ਸਿੰਗਲ API ਕੀ (key) ਵੱਖ-ਵੱਖ ਪ੍ਰੋਵਾਈਡਰਾਂ ਨੂੰ ਜੋੜੇ ਬਿਨਾਂ ਇਮੇਜ ਜਨਰੇਸ਼ਨ, ਚੈਟ, ਅਤੇ ਹੁਣ ਤੇਜ਼ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਨੂੰ ਚਲਾ ਸਕਦੀ ਹੈ। ਉਹਨਾਂ ਟੀਮਾਂ ਲਈ ਜੋ ਪਹਿਲਾਂ ਹੀ OpenAI ਸਟੈਕ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ, ਉਹ ਇਕਸਾਰਤਾ ਅਥੈਂਟੀਕੇਸ਼ਨ ਦੇ ਬੋਝ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ ਅਤੇ ਬਿਲਿੰਗ ਨੂੰ ਸਰਲ ਬਣਾਉਂਦੀ ਹੈ।

ਸ਼ੁੱਧਤਾ ਦੇ ਤਾਲਮੇਲ (Accuracy trade-offs) ਅਜੇ ਵੀ ਮੁੱਖ ਚਿੰਤਾ ਦਾ ਵਿਸ਼ਾ ਹਨ। 3.31 ਪ੍ਰਤੀਸ਼ਤ WER ਦਾ ਮਤਲਬ ਸ਼ੋਰ ਵਾਲੇ ਜਾਂ ਖਾਸ ਖੇਤਰ ਨਾਲ ਸਬੰਧਤ ਆਡੀਓ ਵਿੱਚ ਲਗਭਗ ਹਰ ਤੀਹ ਸ਼ਬਦਾਂ ਬਾਅਦ ਇੱਕ ਗਲਤੀ ਹੁੰਦੀ ਹੈ। ਮੈਡੀਕਲ ਡਿਕਟੇਸ਼ਨ ਜਾਂ ਕਾਨੂੰਨੀ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਵਰਗੀਆਂ ਐਪਲੀਕੇਸ਼ਨਾਂ, ਜਿੱਥੇ ਗਲਤੀਆਂ ਦਾ ਜੋਖਮ ਜ਼ਿਆਦਾ ਹੁੰਦਾ ਹੈ, ਉੱਚੀ ਲਾਗਤ ਦੇ ਬਾਵਜੂਦ ਅਜੇ ਵੀ ElevenLabs ਜਾਂ Google ਨੂੰ ਤਰਜੀਹ ਦੇ ਸਕਦੀਆਂ ਹਨ। ਕਸਟਮ ਕੀਵਰਡਸ ਅਤੇ ਸੰਦਰਭ (context) ਦੇਣ ਦੀ ਸਮਰੱਥਾ ਇਸ ਪਾੜੇ ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ, ਪਰ ਇਸ ਲਈ ਵਾਧੂ ਇੰਜੀਨੀਅਰਿੰਗ ਕੋਸ਼ਿਸ਼ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਵਿਆਪਕ ਮਾਰਕੀਟ ਵਿੱਚ ਬਦਲਾਅ

OpenAI ਦਾ ਕੀਮਤ ਬਦਲਣ ਦਾ ਕਦਮ "ਕਿਸੇ ਵੀ ਕੀਮਤ 'ਤੇ ਸ਼ੁੱਧਤਾ" ਤੋਂ ਹਟ ਕੇ ਸਪੀਡ, ਲਾਗਤ ਅਤੇ ਸਟੀਕਤਾ ਦੇ ਵਧੇਰੇ ਸੰਤੁਲਿਤ ਫਾਰਮੂਲੇ ਵੱਲ ਜਾਣ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ। ਸਪੀਚ-ਟੂ-ਟੈਕਸਟ (speech-to-text) ਮਾਰਕੀਟ ਰਵਾਇਤੀ ਤੌਰ 'ਤੇ ਵੰਡੀ ਹੋਈ ਰਹੀ ਹੈ: ਬੁਟੀਕ ਫਰਮਾਂ ਸਭ ਤੋਂ ਘੱਟ ਗਲਤੀ ਦੀ ਦਰ ਦੀ ਭਾਲ ਕਰਦੀਆਂ ਹਨ, ਕਲਾਉਡ ਦਿੱਗਜ ਪੈਮਾਨੇ (scale) 'ਤੇ ਮੁਕਾਬਲਾ ਕਰਦੇ ਹਨ, ਅਤੇ ਨਵੇਂ ਆਉਣ ਵਾਲੇ ਕੀਮਤ 'ਤੇ ਲੜਦੇ ਹਨ। ਇੱਕ ਸਤਿਕਾਰਯੋਗ ਗਲਤੀ ਦੀ ਦਰ ਅਤੇ ਬਹੁਤ ਜ਼ਿਆਦਾ ਥਰੂਪੁੱਟ (throughput) ਪ੍ਰਦਾਨ ਕਰਦੇ ਹੋਏ ਕੀਮਤ ਨੂੰ ਘਟਾ ਕੇ, OpenAI ਆਪਣੇ ਵਿਰੋਧੀਆਂ ਨੂੰ ਆਪਣੇ ਕੀਮਤ ਦੇ ਢਾਂਚੇ 'ਤੇ ਮੁੜ ਵਿਚਾਰ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ।

Mistral ਦੀ ਹਮਲਾਵਰ $0.003-ਪ੍ਰਤੀ-ਮਿੰਟ ਦੀ ਪੇਸ਼ਕਸ਼ ਪਹਿਲਾਂ ਹੀ OpenAI 'ਤੇ ਆਪਣੀਆਂ ਦਰਾਂ ਨੂੰ ਮੁਕਾਬਲੇਬਾਜ਼ ਬਣਾਈ ਰੱਖਣ ਲਈ ਦਬਾਅ ਪਾ ਰਹੀ ਹੈ। ElevenLabs ਅਤੇ Google, ਵੱਡੇ ਖੋਜ ਬਜਟਾਂ ਦੇ ਨਾਲ, ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਹੁੱਕਸ ਨੂੰ ਸਖ਼ਤ ਕਰਕੇ ਜਾਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਨੂੰ ਹੋਰ ਪ੍ਰੀਮੀਅਮ ਸੇਵਾਵਾਂ ਦੇ ਨਾਲ ਬੰਡਲ ਕਰਕੇ ਜਵਾਬ ਦੇ ਸਕਦੇ ਹਨ। ਅਗਲੇ ਕੁਝ ਤਿਮਾਹੀਆਂ ਵਿੱਚ "pay-as-you-go" ਪੱਧਰਾਂ, ਵੌਲਯੂਮ ਡਿਸਕਾਊਂਟ, ਜਾਂ ਲੰਬੇ ਸਮੇਂ ਦੀ ਵਰਤੋਂ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਣ ਦੇ ਉਦੇਸ਼ ਨਾਲ ਡਿਵੈਲਪਰ-ਅਨੁਕੂਲ SDKs ਦੀ ਲਹਿਰ ਦੇਖਣ ਨੂੰ ਮਿਲ ਸਕ