Alibaba ਦੇ Qwen-Audio-3.0-TTS-Plus ਨੇ TTS ਰੈਂਕਿੰਗ ਵਿੱਚ ਸਿਖਰਲਾ ਸਥਾਨ ਹਾਸਲ ਕੀਤਾ

Alibaba ਨੇ Qwen-Audio-3.0-TTS-Plus ਦੀ ਰਿਲੀਜ਼ ਨਾਲ ਸਪੀਚ ਸਿੰਥੇਸਿਸ (speech synthesis) ਦੇ ਖੇਤਰ ਵਿੱਚ ਇੱਕ ਵੱਡਾ ਬਦਲਾਅ ਲਿਆਂਦਾ ਹੈ, ਇੱਕ ਨਵਾਂ ਮਾਡਲ ਜਿਸ ਨੇ ਅਧਿਕਾਰਤ ਤੌਰ 'ਤੇ Artificial Analysis Speech Arena ਲੀਡਰਬੋਰਡ 'ਤੇ ਮੋਹਰੀ ਸਥਾਨ ਹਾਸਲ ਕਰ ਲਿਆ ਹੈ। ਪ੍ਰਗਟਾਵੇਸ਼ੀ ਸੂਖਮਤਾ (expressive nuance) ਅਤੇ ਬਹੁ-ਭਾਸ਼ਾਈ ਡੂੰਘਾਈ ਨੂੰ ਤਰਜੀਹ ਦੇ ਕੇ, Alibaba ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੀਆਂ ਆਰਟੀਫੀਸ਼ੀਅਲ ਆਵਾਜ਼ਾਂ ਲਈ ਇੱਕ ਨਵਾਂ ਮਾਪਦੰਡ ਸਥਾਪਤ ਕਰ ਰਿਹਾ ਹੈ।

Elo ਸਕੋਰਾਂ ਵਿੱਚ ਉਦਯੋਗ ਦੇ ਦਿੱਗਜਾਂ ਨੂੰ ਪਛਾੜਨਾ

Artificial Analysis ਦੀਆਂ ਤਾਜ਼ਾ ਰੈਂਕਿੰਗਾਂ ਤੋਂ ਬਾਅਦ Text-to-Speech (TTS) ਤਕਨਾਲੋਜੀ ਦਾ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਵਾਲਾ ਖੇਤਰ ਬਦਲ ਗਿਆ ਹੈ। Alibaba ਦੇ Qwen-Audio-3.0-TTS-Plus ਨੇ 1,236 ਦੇ ਪ੍ਰਭਾਵਸ਼ਾਲੀ Elo ਸਕੋਰ ਨਾਲ ਪ੍ਰੋਵਾਈਡਰ ਆਵਾਜ਼ਾਂ ਲਈ ਸਿਖਰਲਾ ਸਥਾਨ ਪ੍ਰਾਪਤ ਕੀਤਾ ਹੈ। ਇਹ ਬਹੁਤ ਹੀ ਘੱਟ ਫਰਕ ਵਾਲੀ ਜਿੱਤ ਇਸ ਨੂੰ SpeechifyAI ਦੇ Simba 3.2 ਤੋਂ ਸਿਰਫ ਦੋ ਅੰਕ ਅੱਗੇ ਰੱਖਦੀ ਹੈ, ਜਿਸਦਾ ਸਕੋਰ 1,234 ਹੈ।

ਇਸ ਖੇਤਰ ਦੇ ਹੋਰ ਵੱਡੇ ਨਾਮ, ਜਿਨ੍ਹਾਂ ਵਿੱਚ Google ਦਾ Gemini 3.1 Flash TTS (1,214) ਅਤੇ Sonic 3.5 (1,207) ਸ਼ਾਮਲ ਹਨ, ਇਸ ਸਮੇਂ ਪਿੱਛੇ ਹਨ। ਇਹ ਰੈਂਕਿੰਗ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਉਪਭੋਗਤਾ ਅਤੇ ਮੁਲਾਂਕਣਕਰਤਾ ਸਥਾਪਿਤ ਉਦਯੋਗਿਕ ਲੀਡਰਾਂ ਦੇ ਮੁਕਾਬਲੇ Alibaba ਦੇ ਨਵੇਂ ਆਰਕੀਟੈਕਚਰ ਵਿੱਚ ਕਾਫ਼ੀ ਜ਼ਿਆਦਾ ਕੁਦਰਤੀਪਨ ਅਤੇ ਗੁਣਵੱਤਾ ਪਾ ਰਹੇ ਹਨ।

ਦੋਹਰਾ-ਮਾਡਲ ਆਰਕੀਟੈਕਚਰ ਅਤੇ ਪ੍ਰਗਟਾਵੇਸ਼ੀ ਕੰਟਰੋਲ

ਵੱਖ-ਵੱਖ ਡਿਵੈਲਪਰਾਂ ਦੀਆਂ ਲੋੜਾਂ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ, Alibaba ਨੇ ਇਸ ਮਾਡਲ ਨੂੰ ਦੋ ਵੱਖ-ਵੱਖ ਵਰਜ਼ਨਾਂ ਵਿੱਚ ਰਿਲੀਜ਼ ਕੀਤਾ ਹੈ:

  • Flash: ਲੋਅ-ਲੇਟੈਂਸੀ (low-latency), ਰੀਅਲ-ਟਾਈਮ ਇੰਟਰੈਕਸ਼ਨਾਂ ਲਈ ਅਨੁਕੂਲਿਤ, ਜਿਸ ਵਿੱਚ ਲਗਭਗ 300 ਮਿਲੀਸੈਕਿੰਡ ਦੀ ਦੇਰੀ ਹੁੰਦੀ ਹੈ।
  • Plus: ਵੱਧ ਤੋਂ ਵੱਧ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੀ ਸਪੀਚ ਆਊਟਪੁੱਟ ਅਤੇ ਜੀਵੰਤ ਪ੍ਰੋਸੋਡੀ (prosody) ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ।

Qwen-Audio-3.0 ਵਿੱਚ ਸਭ ਤੋਂ ਮਹੱਤਵਪੂਰਨ ਤਕਨੀਕੀ ਉਛਾਲ ਬੋਲਣ ਦੇ ਅੰਦਾਜ਼ ਨੂੰ ਕੰਟਰੋਲ ਕਰਨ ਲਈ ਕੁਦਰਤੀ ਭਾਸ਼ਾ ਦੇ ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਸਮਝਣ ਦੀ ਇਸਦੀ ਯੋਗਤਾ ਹੈ। ਡਿਵੈਲਪਰ ਆਊਟਪੁੱਟ ਵਿੱਚ ਮਨੁੱਖੀ ਭਾਵਨਾਵਾਂ ਭਰਨ ਲਈ ਵਿਸ਼ੇਸ਼ ਟੈਗਾਂ, ਜਿਵੇਂ ਕਿ [angry] ਜਾਂ [giggles], ਰਾਹੀਂ ਗੈਰ-ਮੌਖਿਕ ਸੰਕੇਤਾਂ (nonverbal cues) ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹਨ। ਇਸ ਤੋਂ ਇਲਾਵਾ, ਇਹ ਮਾਡਲ ਵੌਇਸ ਕਲੋਨਿੰਗ ਵਿੱਚ ਬਿਹਤਰ ਮਜ਼ਬੂਤੀ ਦਾ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਪਿਛਲੇ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ ਸ਼ੋਰ-ਸ਼ਰਾਬੇ ਵਾਲੀਆਂ ਜਾਂ ਗੂੰਜ ਵਾਲੀਆਂ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਬਹੁਤ ਜ਼ਿਆਦਾ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਸੰਭਾਲਦਾ ਹੈ।

ਬਹੁ-ਭਾਸ਼ਾਈ ਸਮਰੱਥਾਵਾਂ ਅਤੇ ਪ੍ਰਦਰਸ਼ਨ ਦੇ ਸਮਝੌਤੇ

ਜਦੋਂ ਕਿ ਬਹੁਤ ਸਾਰੇ TTS ਮਾਡਲ ਮੁੱਖ ਤੌਰ 'ਤੇ ਅੰਗਰੇਜ਼ੀ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਦੇ ਹਨ, Qwen-Audio-3.0-TTS-Plus 16 ਭਾਸ਼ਾਵਾਂ ਦਾ ਸਮਰਥਨ ਕਰਕੇ ਵਿਆਪਕ ਭਾਸ਼ਾਈ ਉਪਯੋਗਤਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਇਸ ਵਿੱਚ ਉੱਚ-ਮੰਗ ਵਾਲੀਆਂ ਭਾਸ਼ਾਵਾਂ ਦੇ ਨਾਲ-ਨਾਲ ਟੈਗਾਲੌਗ, ਮਲੇਅ, ਥਾਈ ਅਤੇ ਵੀਅਤਨਾਮੀ ਵਰਗੀਆਂ ਘੱਟ ਆਮ ਭਾਸ਼ਾਵਾਂ ਅਤੇ ਵੱਖ-ਵੱਖ ਚੀਨੀ ਉਪ-ਭਾਸ਼ਾਵਾਂ ਵੀ ਸ਼ਾਮਲ ਹਨ।

ਹਾਲਾਂਕਿ, ਇਸ ਮਾਡਲ ਵਿੱਚ ਕੁਝ ਸੀਮਾਵਾਂ ਵੀ ਹਨ। ਜੇਕਰ ਅਸੀਂ ਸਪੀਡ ਦੀ ਗੱਲ ਕਰੀਏ, ਤਾਂ ਇਹ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਤੋਂ ਕਾਫ਼ੀ ਪਿੱਛੇ ਹੈ। 16 ਅੱਖਰ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਦੀ ਰਫ਼ਤਾਰ ਨਾਲ, ਇਹ Sonic 3.5 (ਜੋ 120 ਅੱਖਰ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਹੈ) ਅਤੇ Simba 3.2 (ਜੋ 30.2 ਤੱਕ ਪਹੁੰਚਦਾ ਹੈ) ਤੋਂ ਪਿੱਛੇ ਹੈ। ਉੱਚ-ਥਰੂਪੁੱਟ (high-throughput) ਵਾਲੀਆਂ ਐਪਲੀਕੇਸ਼ਨਾਂ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਲਈ, ਅੱਖਰਾਂ ਦੇ ਜਨਰੇਸ਼ਨ ਵਿੱਚ ਇਸ ਦੇਰੀ ਨੂੰ ਮਾਡਲ ਦੀ ਬਿਹਤਰ ਪ੍ਰਗਟਾਵੇਸ਼ੀ ਗੁਣਵੱਤਾ ਦੇ ਸੰਦਰਭ ਵਿੱਚ ਤੋਲਣਾ ਪਵੇਗਾ।

ਵਰਤਮਾਨ ਵਿੱਚ, ਇਹ ਮਾਡਲ Alibaba Cloud Model Studio ਰਾਹੀਂ ਉਪਲਬਧ ਹੈ, ਜਿਸਦੀ ਕੀਮਤ $27.60 ਪ੍ਰਤੀ ਮਿਲੀਅਨ ਅੱਖਰ ਹੈ।

AI ਦੇ ਖੇਤਰ ਲਈ ਇਹ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

Qwen-Audio-3.0-TTS-Plus ਦਾ ਉਭਾਰ TTS ਉਦਯੋਗ ਵਿੱਚ ਸਿਰਫ਼ "ਸਪੀਚ ਜਨਰੇਸ਼ਨ" ਤੋਂ "ਭਾਵਨਾਤਮਕ ਬੁੱਧੀ" (emotional intelligence) ਵੱਲ ਇੱਕ ਬਦਲਾਅ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ। ਜਿਵੇਂ-ਜਿਵੇਂ LLMs ਵਧੇਰੇ ਗੱਲਬਾਤ ਕਰਨ ਯੋਗ ਬਣ ਰਹੇ ਹਨ, ਰੁਕਾਵਟ ਹੁਣ ਸਿਰਫ਼ ਟੈਕਸਟ ਜਨਰੇਸ਼ਨ ਨਹੀਂ ਹੈ, ਸਗੋਂ ਆਵਾਜ਼ ਦੀ ਉਹ ਯੋਗਤਾ ਹੈ ਜੋ ਮੂਲ ਪ੍ਰੋਂਪਟ ਵਿੱਚ ਮੌਜੂਦ ਸੂਖਮਤਾ, ਵਿਅੰਗ ਅਤੇ ਭਾਵਨਾ ਨੂੰ ਪ੍ਰਗਟ ਕਰ ਸਕੇ। ਨਾਨ-ਵਰਬਲ ਟੈਗਾਂ ਨੂੰ ਜੋੜਨ ਅਤੇ ਕਲੋਨਿੰਗ ਲਈ ਅਧੂਰੀ ਆਡੀਓ ਨੂੰ ਸੰਭਾਲਣ ਦੀ Alibaba ਦੀ ਯੋਗਤਾ ਉਨ੍ਹਾਂ ਨੂੰ ਅਗਲੀ ਪੀੜ੍ਹੀ ਦੇ ਇਮਰਸਿਵ (immersive) AI ਏਜੰਟਾਂ ਦੇ ਮੋਹਰੀ ਸਥਾਨ 'ਤੇ ਰੱਖਦੀ ਹੈ।

ਮੁੱਖ ਗੱਲਾਂ

  • ਲੀਡਰਬੋਰਡ 'ਤੇ ਦਬਦਬਾ: Qwen-Audio-3.0-TTS-Plus 1,236 Elo ਸਕੋਰ ਦੇ ਨਾਲ Speech Arena ਦੀ ਅਗਵਾਈ ਕਰ ਰਿਹਾ ਹੈ, ਜੋ Simba 3.2 ਅਤੇ Gemini 3.1 Flash TTS ਤੋਂ ਅੱਗੇ ਹੈ।
  • ਭਾਵਨਾਤਮਕ ਸੂਖਮਤਾ: ਮਾਡਲ ਹਕੀਕਤ ਨੂੰ ਵਧਾਉਣ ਲਈ ਕੁਦਰਤੀ ਭਾਸ਼ਾ ਸ਼ੈਲੀ ਸਟੀਅਰਿੰਗ ਅਤੇ [giggles] ਵਰਗੇ ਗੈਰ-ਮੌਖਿਕ ਸੰਕੇਤਾਂ ਦਾ ਸਮਰਥਨ ਕਰਦਾ ਹੈ।
  • ਬਹੁ-ਭਾਸ਼ਾਈ ਵਿਸ਼ਾਲਤਾ: ਇਹ 16 ਭਾਸ਼ਾਵਾਂ ਲਈ ਮਜ਼ਬੂਤ ਸਮਰਥਨ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ ਦੱਖਣ-ਪੂਰਬੀ ਏਸ਼ੀਆਈ ਭਾਸ਼ਾਵਾਂ ਅਤੇ ਚੀਨੀ ਉਪ-ਭਾਸ਼ਾਵਾਂ ਲਈ ਵਿਸ਼ੇਸ਼ ਕਵਰੇਜ ਸ਼ਾਮਲ ਹੈ।