TTS தரவரிசையில் Alibaba-வின் Qwen-Audio-3.0-TTS-Plus முதலிடத்தைப் பிடித்தது
Qwen-Audio-3.0-TTS-Plus என்ற புதிய மாடலை வெளியிட்டதன் மூலம் Alibaba, பேச்சுத் தொகுப்பு (speech synthesis) துறையில் பெரும் மாற்றத்தை ஏற்படுத்தியுள்ளது. இந்த மாடல் Artificial Analysis Speech Arena தரவரிசைப் பட்டியலில் அதிகாரப்பூர்வமாக முதலிடத்தைப் பிடித்துள்ளது. வெளிப்பாட்டு நுணுக்கங்கள் (expressive nuance) மற்றும் பன்மொழி ஆழத்திற்கு முன்னுரிமை அளிப்பதன் மூலம், Alibaba உயர்தர செயற்கை குரல்களுக்கான ஒரு புதிய தரநிலையை நிர்ணயித்து வருகிறது.
Elo மதிப்பெண்களில் தொழில் துறை ஜாம்பவான்களை மிஞ்சுகிறது
Artificial Analysis-ன் சமீபத்திய தரவரிசையின்படி, Text-to-Speech (TTS) தொழில்நுட்பத்தின் போட்டிச் சூழல் மாறியுள்ளது. Alibaba-வின் Qwen-Audio-3.0-TTS-Plus, 1,236 என்ற ஈர்க்கக்கூடிய Elo மதிப்பெண்ணுடன் வழங்குநர் குரல்களுக்கான (provider voices) முதலிடத்தைப் பிடித்துள்ளது. இந்தச் சிறிய வெற்றி, 1,234 மதிப்பெண் கொண்ட SpeechifyAI-ன் Simba 3.2-ஐ விட வெறும் இரண்டு புள்ளிகள் முன்னால் வைத்துள்ளது.
Google-ன் Gemini 3.1 Flash TTS (1,214) மற்றும் Sonic 3.5 (1,207) உள்ளிட்ட இத்துறையின் பிற முக்கிய நிறுவனங்கள் தற்போது பின் தங்கியுள்ளன. ஏற்கனவே நிலைபெற்றுள்ள தொழில் துறைத் தலைவர்களுடன் ஒப்பிடும்போது, Alibaba-வின் சமீபத்திய கட்டமைப்பில் பயனர்களும் மதிப்பீட்டாளர்களும் கணிசமான இயல்பான தன்மையையும் தரத்தையும் காண்கிறார்கள் என்பதை இந்தத் தரவரிசை காட்டுகிறது.
இரட்டை-மாடல் கட்டமைப்பு மற்றும் வெளிப்பாட்டுத் திறன் கட்டுப்பாடு
பல்வேறு டெவலப்பர்களின் தேவைகளைப் பூர்த்தி செய்ய, Alibaba இந்த மாடலை இரண்டு தனித்துவமான பதிப்புகளில் வெளியிட்டுள்ளது:
- Flash: சுமார் 300 மில்லி விநாடி தாமதத்துடன், குறைந்த தாமதத்துடன் (low-latency) நிகழ்நேரத் தொடர்புகளுக்காக மேம்படுத்தப்பட்டது.
- Plus: அதிகபட்ச உயர்தர பேச்சு வெளியீடு மற்றும் உயிரோட்டமான உச்சரிப்புத் திறனுக்காக (prosody) வடிவமைக்கப்பட்டது.
Qwen-Audio-3.0-ன் மிக முக்கியமான தொழில்நுட்ப முன்னேற்றங்களில் ஒன்று, பேச்சு பாணிகளைக் கட்டுப்படுத்த இயற்கை மொழி வழி அறிவுறுத்தல்களைப் புரிந்துகொள்ளும் அதன் திறன் ஆகும். டெவலப்பர்கள் [angry] அல்லது [giggles] போன்ற குறிப்பிட்ட டேக் (tags) மூலம் வாய்மொழி அல்லாத குறிப்புகளைப் பயன்படுத்தி, வெளியீட்டில் மனிதனைப் போன்ற உணர்ச்சிகளைச் சேர்க்க முடியும். மேலும், குரல் நகலெடுப்பில் (voice cloning) இந்த மாடல் சிறந்த வலிமையைக் காட்டுகிறது; இரைச்சல் அல்லது எதிரொலி நிறைந்த குறிப்புப் பதிவுகளை அதன் முந்தைய மாடல்களை விட மிகவும் திறம்பட இது கையாள்கிறது.
பன்மொழித் திறன்கள் மற்றும் செயல்திறன் சமநிலைகள்
பல TTS மாடல்கள் ஆங்கிலத்தில் மட்டுமே அதிக கவனம் செலுத்துகின்றன, ஆனால் Qwen-Audio-3.0-TTS-Plus 16 மொழிகளை ஆதரிப்பதன் மூலம் பரந்த மொழியியல் பயன்பாட்டை வழங்குகிறது. இதில் அதிகத் தேவைப்படும் மொழிகளுடன் சேர்த்து, டகாலாக் (Tagalog), மலாய், தாய் மற்றும் வியட்நாமிய மொழிகள் மற்றும் பல்வேறு சீன வட்டார மொழிகளும் அடங்கும்.
இருப்பினும், இந்த மாடலில் சில வரம்புகள் உள்ளன. வெறும் உருவாக்கும் வேகத்தைப் பொறுத்தவரை, இது போட்டியாளர்களை விட கணிசமாகப் பின்தங்கியுள்ளது. வினாடிக்கு 16 எழுத்துக்கள் என்ற வேகத்தில் இது இயங்குகிறது; இது வினாடிக்கு 120 எழுத்துக்கள் வேகமுள்ள Sonic 3.5 மற்றும் 30.2 எழுத்துக்கள் வேகமுள்ள Simba 3.2 ஆகியவற்றை விடப் பின்தங்கியுள்ளது. அதிகத் தரவுப் பரிமாற்றம் (high-throughput) தேவைப்படும் செயலிகளை உருவாக்கும் டெவலப்பர்கள், இந்த எழுத்து உருவாக்கத் தாமதத்தையும் மாடலின் சிறந்த வெளிப்பாட்டுத் தரத்தையும் ஒப்பிட்டுப் பார்த்து முடிவெடுக்க வேண்டும்.
தற்போது, இந்த மாடல் Alibaba Cloud Model Studio மூலம் அணுகக் கிடைக்கிறது, இதன் விலை ஒரு மில்லியன் எழுத்துக்களுக்கு $27.60 ஆகும்.
இது AI சூழலுக்கு ஏன் முக்கியமானது
Qwen-Audio-3.0-TTS-Plus-ன் எழுச்சி, TTS துறையில் வெறும் "பேச்சு உருவாக்கம்" என்பதிலிருந்து "உணர்ச்சி நுண்ணறிவு" (emotional intelligence) நோக்கிய மாற்றத்தைக் குறிக்கிறது. LLM-கள் அதிக உரையாடல் திறனைப் பெறும்போது, சவால் என்பது வெறும் உரை உருவாக்கத்தில் மட்டும் இல்லை; மாறாக, கொடுக்கப்பட்ட தூண்டுதலில் (prompt) உள்ள நுணுக்கம், நையாண்டி மற்றும் உணர்ச்சிகளை குரல் மூலம் வெளிப்படுத்தும் திறனில்தான் உள்ளது. வாய்மொழி அல்லாத டேக்குகளை ஒருங்கிணைக்கும் மற்றும் குரல் நகலெடுப்பிற்குத் தகுதியற்ற ஆடியோக்களைக் கையாளும் Alibaba-வின் திறன், அவர்களை அடுத்த தலைமுறை ஆழ்ந்த அனுபவமிக்க (immersive) AI ஏஜெண்டுகளின் முன்னணியில் வைக்கிறது.
முக்கியக் குறிப்புகள்
- தரவரிசையில் ஆதிக்கம்: Qwen-Audio-3.0-TTS-Plus, 1,236 Elo மதிப்பெண்ணுடன் Speech Arena-வில் முன்னிலையில் உள்ளது; இது Simba 3.2 மற்றும் Gemini 3.1 Flash TTS ஆகியவற்றை விடச் சிறந்தது.
- உணர்ச்சி நுணுக்கங்கள்: யதார்த்தத்தை அதிகரிக்க இந்த மாடல் இயற்கை மொழி பாணி கட்டுப்பாடு மற்றும்
[giggles]போன்ற வாய்மொழி அல்லாத குறிப்புகளை ஆதரிக்கிறது. - பன்மொழித் திறன்: தென்கிழக்கு ஆசிய மொழிகள் மற்றும் சீன வட்டார மொழிகளுக்கான சிறப்பு ஆதரவு உட்பட 16 மொழிகளுக்கு இது வலுவான ஆதரவை வழங்குகிறது.
