Qwen-Audio-3.0-TTS-Plus milik Alibaba Menduduki Tempat Teratas dalam Kedudukan TTS
Alibaba telah mengganggu landskap sintesis pertuturan dengan pelancaran Qwen-Audio-3.0-TTS-Plus, sebuah model baharu yang secara rasmi telah menduduki tempat teratas dalam papan pendahulu Artificial Analysis Speech Arena. Dengan mengutamakan nuansa ekspresif dan kedalaman multibahasa, Alibaba sedang menetapkan penanda aras baharu bagi suara buatan berketepatan tinggi.
Mengatasi Gergasi Industri dalam Skor Elo
Landskap kompetitif teknologi Text-to-Speech (TTS) telah berubah susulan kedudukan terbaharu daripada Artificial Analysis. Qwen-Audio-3.0-TTS-Plus milik Alibaba telah memperoleh kedudukan teratas bagi suara penyedia dengan skor Elo yang mengagumkan iaitu 1,236. Kemenangan tipis ini meletakkannya hanya dua mata di hadapan Simba 3.2 milik SpeechifyAI, yang memegang skor 1,234.
Nama-nama besar lain dalam sektor ini, termasuk Gemini 3.1 Flash TTS (1,214) dan Sonic 3.5 (1,207) milik Google, kini ketinggalan di belakang. Kedudukan ini menunjukkan bahawa pengguna dan penilai mendapati kualiti dan keaslian yang jauh lebih tinggi dalam seni bina terbaharu Alibaba berbanding peneraju industri yang sedia ada.
Seni Bina Model Dwi-Versi dan Kawalan Ekspresif
Untuk memenuhi keperluan pembangun yang berbeza, Alibaba telah mengeluarkan model ini dalam dua versi yang berbeza:
- Flash: Dioptimumkan untuk interaksi masa nyata dengan kependaman rendah dengan lengah masa kira-kira 300 milisaat.
- Plus: Direka untuk output pertuturan berkualiti tinggi yang maksimum dan prosodi yang menyerupai manusia.
Salah satu lonjakan teknikal paling ketara dalam Qwen-Audio-3.0 ialah keupayaannya untuk mentafsir arahan bahasa tabii bagi mengawal gaya pertuturan. Pembangun boleh menggunakan isyarat bukan lisan melalui tag khusus, seperti [angry] atau [giggles], untuk menyuntik emosi seperti manusia ke dalam output. Selain itu, model ini menunjukkan keteguhan yang unggul dalam pengklonan suara, mengendalikan rakaman rujukan yang bising atau bergema dengan jauh lebih berkesan berbanding model terdahulu.
Keupayaan Multibahasa dan Imbangan Prestasi
Walaupun banyak model TTS memberi tumpuan berat kepada bahasa Inggeris, Qwen-Audio-3.0-TTS-Plus menawarkan kegunaan linguistik yang luas dengan menyokong 16 bahasa. Ini termasuk bahasa yang mendapat permintaan tinggi serta bahasa yang kurang diliputi seperti Tagalog, Melayu, Thai, dan Vietnam, di samping pelbagai dialek Cina.
Walau bagaimanapun, model ini tidak terlepas daripada batasan. Dari segi kelajuan penjanaan mentah, ia ketinggalan jauh di belakang pesaingnya. Dengan 16 aksara sesaat, ia ketinggalan berbanding Sonic 3.5 yang mencecah 120 aksara sesaat, dan Simba 3.2 yang mencapai 30.2. Bagi pembangun yang membina aplikasi berkapasiti tinggi, kependaman dalam penjanaan aksara ini mesti dipertimbangkan berbanding kualiti ekspresif model yang unggul.
Pada masa ini, model tersebut boleh diakses melalui Alibaba Cloud Model Studio, dengan harga $27.60 bagi setiap satu juta aksara.
Mengapa Ini Penting bagi Landskap AI
Kebangkitan Qwen-Audio-3.0-TTS-Plus menandakan peralihan dalam industri TTS daripada sekadar "penjanaan pertuturan" kepada "kecerdasan emosi." Memandangkan LLM menjadi lebih bersifat perbualan, kekangan bukan lagi sekadar penjanaan teks, tetapi keupayaan suara untuk menyampaikan nuansa, sindiran, dan emosi yang terdapat dalam prom yang diberikan. Keupayaan Alibaba untuk menyepadukan tag bukan lisan dan mengendalikan audio yang tidak sempurna untuk pengklonan meletakkan mereka di barisan hadapan generasi ejen AI imersif yang seterusnya.
Ringkasan Utama
- Dominasi Papan Pendahulu: Qwen-Audio-3.0-TTS-Plus menerajui Speech Arena dengan skor Elo 1,236, mengatasi Simba 3.2 dan Gemini 3.1 Flash TTS.
- Nuansa Emosi: Model ini menyokong kawalan gaya bahasa tabii dan isyarat bukan lisan seperti
[giggles]untuk meningkatkan realisme. - Keluasan Multibahasa: Ia menawarkan sokongan teguh untuk 16 bahasa, termasuk liputan khusus untuk bahasa Asia Tenggara dan dialek Cina.
