Qwen-Audio-3.0-TTS-Plus ของ Alibaba คว้าอันดับหนึ่งในการจัดอันดับ TTS

Alibaba ได้สร้างความสั่นสะเทือนให้กับวงการสังเคราะห์เสียงด้วยการเปิดตัว Qwen-Audio-3.0-TTS-Plus ซึ่งเป็นโมเดลใหม่ที่ขึ้นครองอันดับหนึ่งบนตารางผู้นำ Artificial Analysis Speech Arena อย่างเป็นทางการ ด้วยการให้ความสำคัญกับความละเอียดอ่อนในการแสดงออกและความลึกซึ้งของหลายภาษา Alibaba กำลังสร้างมาตรฐานใหม่ให้กับเสียงสังเคราะห์ที่มีความสมจริงสูง

ทำคะแนน Elo แซงหน้ายักษ์ใหญ่ในอุตสาหกรรม

ภูมิทัศน์การแข่งขันของเทคโนโลยี Text-to-Speech (TTS) ได้เปลี่ยนไปหลังจากการจัดอันดับล่าสุดจาก Artificial Analysis โดย Qwen-Audio-3.0-TTS-Plus ของ Alibaba สามารถคว้าตำแหน่งสูงสุดสำหรับเสียงจากผู้ให้บริการด้วยคะแนน Elo ที่น่าประทับใจถึง 1,236 คะแนน ชัยชนะที่เฉือนกันเพียงเล็กน้อยนี้ทำให้มันนำหน้า Simba 3.2 ของ SpeechifyAI ซึ่งมีคะแนน 1,234 คะแนน ไปเพียงสองคะแนนเท่านั้น

ส่วนยักษ์ใหญ่รายอื่นในภาคส่วนนี้ รวมถึง Gemini 3.1 Flash TTS ของ Google (1,214) และ Sonic 3.5 (1,207) ยังคงตามหลังอยู่ในขณะนี้ การจัดอันดับนี้บ่งชี้ว่าผู้ใช้และผู้ประเมินพบความสมจริงและคุณภาพที่สูงกว่าอย่างมีนัยสำคัญในสถาปัตยกรรมล่าสุดของ Alibaba เมื่อเทียบกับผู้นำในอุตสาหกรรมที่ครองตลาดอยู่เดิม

สถาปัตยกรรมแบบสองโมเดลและการควบคุมการแสดงออก

เพื่อตอบสนองความต้องการที่แตกต่างกันของนักพัฒนา Alibaba จึงได้ปล่อยโมเดลออกมาในสองเวอร์ชันที่แตกต่างกัน:

  • Flash: ปรับแต่งมาเพื่อการโต้ตอบแบบเรียลไทม์ที่มีความหน่วงต่ำ โดยมีความล่าช้าประมาณ 300 มิลลิวินาที
  • Plus: ออกแบบมาเพื่อการสร้างเสียงที่มีคุณภาพสูงสุดและมีจังหวะจะโคน (prosody) ที่เหมือนมนุษย์

หนึ่งในการก้าวกระโดดทางเทคนิคที่สำคัญที่สุดของ Qwen-Audio-3.0 คือความสามารถในการตีความคำสั่งภาษาธรรมชาติเพื่อควบคุมสไตล์การพูด นักพัฒนาสามารถใช้สัญญาณอวัจนภาษาผ่านแท็กเฉพาะ เช่น [angry] หรือ [giggles] เพื่อใส่ความรู้สึกเหมือนมนุษย์ลงในผลลัพธ์ นอกจากนี้ โมเดลยังแสดงให้เห็นถึงความแข็งแกร่งที่เหนือกว่าในการทำ Voice Cloning โดยสามารถจัดการกับบันทึกเสียงอ้างอิงที่มีเสียงรบกวนหรือมีเสียงสะท้อนได้อย่างมีประสิทธิภาพมากกว่าโมเดลรุ่นก่อนๆ มาก

ความสามารถด้านหลายภาษาและข้อแลกเปลี่ยนด้านประสิทธิภาพ

ในขณะที่โมเดล TTS จำนวนมากมุ่งเน้นไปที่ภาษาอังกฤษเป็นหลัก แต่ Qwen-Audio-3.0-TTS-Plus มอบประโยชน์ทางภาษาที่กว้างขวางโดยรองรับถึง 16 ภาษา ซึ่งรวมถึงภาษาที่มีความต้องการสูงและภาษาที่มักไม่ค่อยได้รับการครอบคลุม เช่น ตากาล็อก, มลายู, ไทย และเวียดนาม ควบคู่ไปกับภาษาจีนสำเนียงต่างๆ

อย่างไรก็ตาม โมเดลนี้ก็ยังมีข้อจำกัด ในแง่ของความเร็วในการสร้างเสียงดิบ (raw generation speed) มันยังตามหลังคู่แข่งอย่างมาก ด้วยความเร็ว 16 ตัวอักษรต่อวินาที ซึ่งตามหลัง Sonic 3.5 ที่ทำได้ 120 ตัวอักษรต่อวินาที และ Simba 3.2 ที่ทำได้ 30.2 ตัวอักษรต่อวินาที สำหรับนักพัฒนาที่สร้างแอปพลิเคชันที่ต้องการปริมาณงานสูง (high-throughput) ความล่าช้าในการสร้างตัวอักษรนี้จะต้องถูกนำมาพิจารณาควบคู่ไปกับคุณภาพการแสดงออกที่เหนือกว่าของโมเดล

ปัจจุบัน สามารถเข้าถึงโมเดลได้ผ่าน Alibaba Cloud Model Studio โดยมีราคาอยู่ที่ 27.60 ดอลลาร์ต่อหนึ่งล้านตัวอักษร

ทำไมเรื่องนี้จึงสำคัญต่อภูมิทัศน์ของ AI

การก้าวขึ้นมาของ Qwen-Audio-3.0-TTS-Plus ส่งสัญญาณถึงการเปลี่ยนแปลงในอุตสาหกรรม TTS จากเพียงแค่ "การสร้างเสียงพูด" ไปสู่ "ความฉลาดทางอารมณ์" เมื่อ LLM มีความเป็นธรรมชาติในการสนทนามากขึ้น คอขวดจึงไม่ใช่แค่การสร้างข้อความอีกต่อไป แต่เป็นความสามารถของเสียงในการถ่ายทอดความละเอียดอ่อน การประชดประชัน และอารมณ์ที่ปรากฏอยู่ในพรอมต์ (prompt) ความสามารถของ Alibaba ในการรวมแท็กอวัจนภาษาและการจัดการกับเสียงที่ไม่มีคุณภาพสำหรับการทำ Cloning ทำให้พวกเขาอยู่แถวหน้าของเอเจนท์ AI ที่สร้างประสบการณ์เสมือนจริง (immersive AI agents) รุ่นต่อไป

สรุปประเด็นสำคัญ

  • ความเป็นผู้นำบนตารางอันดับ: Qwen-Audio-3.0-TTS-Plus นำโด่งใน Speech Arena ด้วยคะแนน Elo 1,236 แซงหน้า Simba 3.2 และ Gemini 3.1 Flash TTS
  • ความละเอียดอ่อนทางอารมณ์: โมเดลรองรับการควบคุมสไตล์ด้วยภาษาธรรมชาติและสัญญาณอวัจนภาษา เช่น [giggles] เพื่อเพิ่มความสมจริง
  • ความหลากหลายทางภาษา: รองรับ 16 ภาษาอย่างแข็งแกร่ง รวมถึงการครอบคลุมภาษาในเอเชียตะวันออกเฉียงใต้และภาษาจีนสำเนียงต่างๆ เป็นพิเศษ