Qwen-Audio-3.0-TTS-Plus của Alibaba chiếm lĩnh vị trí dẫn đầu trong bảng xếp hạng TTS

Alibaba đã tạo nên một bước ngoặt trong lĩnh vực tổng hợp giọng nói với việc phát hành Qwen-Audio-3.0-TTS-Plus, một mô hình mới đã chính thức giành vị trí dẫn đầu trên bảng xếp hạng Artificial Analysis Speech Arena. Bằng cách ưu tiên các sắc thái biểu cảm và chiều sâu đa ngôn ngữ, Alibaba đang thiết lập một tiêu chuẩn mới cho các giọng nói nhân tạo có độ trung thực cao.

Vượt mặt các ông lớn trong ngành về điểm Elo

Bối cảnh cạnh tranh của công nghệ Chuyển đổi văn bản thành giọng nói (TTS) đã thay đổi sau bảng xếp hạng mới nhất từ Artificial Analysis. Qwen-Audio-3.0-TTS-Plus của Alibaba đã giành được vị trí đầu bảng cho các giọng nói từ nhà cung cấp với điểm Elo ấn tượng là 1.236. Chiến thắng sít sao này giúp mô hình vượt qua Simba 3.2 của SpeechifyAI chỉ với hai điểm, khi đối thủ này đạt mức 1.234.

Các tên tuổi lớn khác trong lĩnh vực này, bao gồm Gemini 3.1 Flash TTS của Google (1.214) và Sonic 3.5 (1.207), hiện đang tụt lại phía sau. Bảng xếp hạng này cho thấy người dùng và các chuyên gia đánh giá đang tìm thấy sự tự nhiên và chất lượng vượt trội trong kiến trúc mới nhất của Alibaba so với các nhà lãnh đạo lâu đời trong ngành.

Kiến trúc mô hình kép và khả năng kiểm soát biểu cảm

Để đáp ứng các nhu cầu khác nhau của nhà phát triển, Alibaba đã phát hành mô hình này với hai phiên bản riêng biệt:

  • Flash: Được tối ưu hóa cho các tương tác thời gian thực với độ trễ thấp, khoảng 300 mili giây.
  • Plus: Được thiết kế để đạt chất lượng đầu ra giọng nói cao nhất và ngữ điệu sống động như thật.

Một trong những bước nhảy vọt về kỹ thuật đáng kể nhất trong Qwen-Audio-3.0 là khả năng diễn giải các hướng dẫn bằng ngôn ngữ tự nhiên để điều chỉnh phong cách nói. Các nhà phát triển có thể sử dụng các tín hiệu phi ngôn ngữ thông qua các thẻ cụ thể, chẳng hạn như [angry] hoặc [giggles], để đưa cảm xúc giống con người vào đầu ra. Hơn nữa, mô hình còn thể hiện khả năng mạnh mẽ vượt trội trong việc sao chép giọng nói (voice cloning), xử lý các bản ghi tham chiếu bị nhiễu hoặc nhiều tiếng vang hiệu quả hơn nhiều so với các phiên bản tiền nhiệm.

Khả năng đa ngôn ngữ và sự đánh đổi về hiệu suất

Trong khi nhiều mô hình TTS tập trung mạnh vào tiếng Anh, Qwen-Audio-3.0-TTS-Plus mang lại tiện ích ngôn ngữ rộng rãi khi hỗ trợ 16 ngôn ngữ. Điều này bao gồm các ngôn ngữ có nhu cầu cao cũng như các ngôn ngữ ít được hỗ trợ hơn như tiếng Tagalog, tiếng Mã Lai, tiếng Thái và tiếng Việt, cùng với nhiều phương ngữ tiếng Trung khác nhau.

Tuy nhiên, mô hình này không phải là không có những hạn chế. Về tốc độ tạo văn bản thuần túy, nó tụt hậu đáng kể so với các đối thủ cạnh tranh. Với tốc độ 16 ký tự mỗi giây, nó chậm hơn Sonic 3.5 (đạt 120 ký tự mỗi giây) và Simba 3.2 (đạt 30,2 ký tự mỗi giây). Đối với các nhà phát triển đang xây dựng các ứng dụng có thông lượng cao, độ trễ trong việc tạo ký tự này cần được cân nhắc kỹ lưỡng so với chất lượng biểu cảm vượt trội của mô hình.

Hiện tại, mô hình có thể được truy cập thông qua Alibaba Cloud Model Studio, với mức giá 27,60 USD cho mỗi triệu ký tự.

Tại sao điều này lại quan trọng đối với bối cảnh AI

Sự trỗi dậy của Qwen-Audio-3.0-TTS-Plus báo hiệu một sự chuyển dịch trong ngành công nghiệp TTS từ việc chỉ đơn thuần là "tạo ra giọng nói" sang "trí tuệ cảm xúc". Khi các mô hình ngôn ngữ lớn (LLM) trở nên có tính đối thoại hơn, nút thắt cổ chai không còn chỉ nằm ở việc tạo văn bản, mà là khả năng của giọng nói trong việc truyền tải các sắc thái, sự mỉa mai và cảm xúc có trong câu lệnh (prompt) gốc. Khả năng tích hợp các thẻ phi ngôn ngữ và xử lý âm thanh không hoàn hảo để sao chép giọng nói giúp Alibaba đứng ở vị trí tiên phong trong thế hệ các tác nhân AI mang tính nhập vai tiếp theo.

Những điểm chính cần lưu ý

  • Thống trị bảng xếp hạng: Qwen-Audio-3.0-TTS-Plus dẫn đầu Speech Arena với điểm Elo là 1.236, vượt qua Simba 3.2 và Gemini 3.1 Flash TTS.
  • Sắc thái cảm xúc: Mô hình hỗ trợ điều chỉnh phong cách bằng ngôn ngữ tự nhiên và các tín hiệu phi ngôn ngữ như [giggles] để tăng cường tính thực tế.
  • Khả năng đa ngôn ngữ rộng rãi: Mô hình cung cấp sự hỗ trợ mạnh mẽ cho 16 ngôn ngữ, bao gồm cả các ngôn ngữ Đông Nam Á và các phương ngữ tiếng Trung.