Qwen-Audio-3.0-TTS-Plus milik Alibaba Raih Posisi Teratas dalam Peringkat TTS
Alibaba telah mendisrupsi lanskap sintesis ucapan dengan merilis Qwen-Audio-3.0-TTS-Plus, sebuah model baru yang secara resmi telah memimpin papan peringkat Artificial Analysis Speech Arena. Dengan memprioritaskan nuansa ekspresif dan kedalaman multibahasa, Alibaba menetapkan tolok ukur baru untuk suara buatan berkualitas tinggi.
Mengungguli Raksasa Industri dalam Skor Elo
Lanskap kompetitif teknologi Text-to-Speech (TTS) telah bergeser menyusul peringkat terbaru dari Artificial Analysis. Qwen-Audio-3.0-TTS-Plus milik Alibaba telah mengamankan posisi teratas untuk suara penyedia dengan skor Elo yang mengesankan sebesar 1.236. Kemenangan tipis ini menempatkannya hanya dua poin di depan Simba 3.2 milik SpeechifyAI, yang memegang skor 1.234.
Pemain besar lainnya di sektor ini, termasuk Gemini 3.1 Flash TTS milik Google (1.214) dan Sonic 3.5 (1.207), saat ini tertinggal di belakang. Peringkat ini menunjukkan bahwa pengguna dan evaluator menemukan kealamian dan kualitas yang jauh lebih tinggi pada arsitektur terbaru Alibaba dibandingkan dengan para pemimpin industri yang sudah mapan.
Arsitektur Model Ganda dan Kontrol Ekspresif
Untuk memenuhi berbagai kebutuhan pengembang, Alibaba telah merilis model ini dalam dua versi berbeda:
- Flash: Dioptimalkan untuk interaksi waktu nyata (real-time) dengan latensi rendah dengan penundaan sekitar 300 milidetik.
- Plus: Dirancang untuk output ucapan berkualitas tinggi maksimal dan prosodi yang menyerupai manusia.
Salah satu lompatan teknis paling signifikan dalam Qwen-Audio-3.0 adalah kemampuannya untuk menafsirkan instruksi bahasa alami guna mengarahkan gaya bicara. Pengembang dapat memanfaatkan isyarat nonverbal melalui tag khusus, seperti [angry] atau [giggles], untuk menyuntikkan emosi layaknya manusia ke dalam output. Selain itu, model ini menunjukkan ketangguhan yang unggul dalam kloning suara, menangani rekaman referensi yang berisik atau penuh gema dengan jauh lebih efektif dibandingkan pendahulunya.
Kemampuan Multibahasa dan Kompromi Performa
Meskipun banyak model TTS sangat berfokus pada bahasa Inggris, Qwen-Audio-3.0-TTS-Plus menawarkan kegunaan linguistik yang luas dengan mendukung 16 bahasa. Ini mencakup bahasa-bahasa dengan permintaan tinggi serta bahasa yang kurang umum dicakup seperti Tagalog, Melayu, Thai, dan Vietnam, di samping berbagai dialek Tionghoa.
Namun, model ini bukan tanpa keterbatasan. Dalam hal kecepatan generasi mentah, model ini tertinggal jauh dari kompetitornya. Dengan kecepatan 16 karakter per detik, ia tertinggal dari Sonic 3.5 yang mencapai 120 karakter per detik, dan Simba 3.2 yang mencapai 30,2. Bagi pengembang yang membangun aplikasi dengan throughput tinggi, latensi dalam pembuatan karakter ini harus dipertimbangkan terhadap kualitas ekspresif model yang unggul.
Saat ini, model tersebut dapat diakses melalui Alibaba Cloud Model Studio, dengan harga $27,60 per satu juta karakter.
Mengapa Ini Penting bagi Lanskap AI
Kebangkitan Qwen-Audio-3.0-TTS-Plus menandakan pergeseran dalam industri TTS dari sekadar "generasi ucapan" menjadi "kecerdasan emosional." Seiring LLM menjadi lebih percakapan, hambatan utamanya bukan lagi sekadar pembuatan teks, melainkan kemampuan suara untuk menyampaikan nuansa, sarkasme, dan emosi yang ada dalam prompt dasar. Kemampuan Alibaba untuk mengintegrasikan tag nonverbal dan menangani audio yang tidak sempurna untuk kloning menempatkan mereka di garis depan generasi agen AI imersif berikutnya.
Poin-Poin Penting
- Dominasi Papan Peringkat: Qwen-Audio-3.0-TTS-Plus memimpin Speech Arena dengan skor Elo 1.236, melampaui Simba 3.2 dan Gemini 3.1 Flash TTS.
- Nuansa Emosional: Model ini mendukung pengarahan gaya bahasa alami dan isyarat nonverbal seperti
[giggles]untuk meningkatkan realisme. - Cakupan Multibahasa: Menawarkan dukungan kuat untuk 16 bahasa, termasuk cakupan khusus untuk bahasa-bahasa Asia Tenggara dan dialek Tionghoa.
