阿里巴巴 Qwen-Audio-3.0-TTS-Plus 登顶 TTS 排行榜

随着 Qwen-Audio-3.0-TTS-Plus 的发布,阿里巴巴打破了语音合成领域的格局。这款新模型已正式登顶 Artificial Analysis Speech Arena 排行榜。通过优先考虑表现力的细微差别和多语言深度,阿里巴巴正在为高保真人工智能语音树立新的基准。

Elo 分数超越行业巨头

随着 Artificial Analysis 最新排名的发布,文本转语音 (TTS) 技术的竞争格局发生了变化。阿里巴巴的 Qwen-Audio-3.0-TTS-Plus 以 1,236 的惊人 Elo 分数,夺得了供应商语音类别的榜首。这一微弱的优势使其仅领先 SpeechifyAI 的 Simba 3.2 两分(后者得分为 1,234)。

该领域的其他重量级选手,包括 Google 的 Gemini 3.1 Flash TTS (1,214) 和 Sonic 3.5 (1,207),目前均处于落后地位。这一排名表明,与成熟的行业领导者相比,用户和评估者在阿里巴巴最新的架构中发现了显著更高的自然度和质量。

双模型架构与表现力控制

为了满足不同开发者的需求,阿里巴巴发布了两个不同版本的模型:

  • Flash: 针对低延迟、实时交互进行了优化,延迟约为 300 毫秒。
  • Plus: 旨在实现最高质量的语音输出和栩栩如生的韵律。

Qwen-Audio-3.0 最显著的技术飞跃之一是其能够通过理解自然语言指令来引导说话风格。开发者可以通过特定的标签(如 [angry][giggles])利用非语言线索,为输出注入类似人类的情感。此外,该模型在声音克隆方面表现出卓越的鲁棒性,处理带有噪声或严重回声的参考录音的效果比以往的模型要好得多。

多语言能力与性能权衡

虽然许多 TTS 模型过度专注于英语,但 Qwen-Audio-3.0-TTS-Plus 通过支持 16 种语言提供了广泛的语言实用性。这包括高需求语言,以及像他加禄语、马来语、泰语和越南语等覆盖较少的语言,此外还包括各种汉语方言。

然而,该模型并非没有局限性。在原始生成速度方面,它明显落后于竞争对手。其生成速度为每秒 16 个字符,落后于每秒 120 个字符的 Sonic 3.5 和每秒 30.2 个字符的 Simba 3.2。对于构建高吞吐量应用的开发者来说,必须在字符生成的延迟与模型卓越的表现力质量之间进行权衡。

目前,该模型可通过阿里云 Model Studio 获取,价格为每百万字符 27.60 美元。

为什么这对 AI 格局至关重要

Qwen-Audio-3.0-TTS-Plus 的崛起标志着 TTS 行业正从单纯的“语音生成”转向“情感智能”。随着 LLM 变得越来越具有对话性,瓶颈不再仅仅是文本生成,而是语音传达底层提示词中所蕴含的细微差别、讽刺和情感的能力。阿里巴巴整合非语言标签以及处理不完美音频进行克隆的能力,使其处于下一代沉浸式 AI 智能体的前沿。

核心要点

  • 排行榜霸主地位: Qwen-Audio-3.0-TTS-Plus 以 1,236 的 Elo 分数领跑 Speech Arena,超越了 Simba 3.2 和 Gemini 3.1 Flash TTS。
  • 情感细微差别: 该模型支持自然语言风格引导和如 [giggles] 之类的非语言线索,以增强真实感。
  • 多语言广度: 它为 16 种语言提供强大的支持,包括对东南亚语言和汉语方言的专门覆盖。