Qwen-Audio-3.0-TTS-Plus от Alibaba занимает первое место в рейтингах TTS
Alibaba произвела революцию в сфере синтеза речи, выпустив Qwen-Audio-3.0-TTS-Plus — новую модель, которая официально возглавила таблицу лидеров Artificial Analysis Speech Arena. Делая ставку на экспрессивные нюансы и многоязычную глубину, Alibaba устанавливает новый стандарт для высококачественных искусственных голосов.
Превосходство над гигантами индустрии по рейтингу Elo
Конкурентная среда в области технологий Text-to-Speech (TTS) изменилась после публикации последних рейтингов Artificial Analysis. Модель Qwen-Audio-3.0-TTS-Plus от Alibaba заняла первую позицию среди голосов провайдеров с впечатляющим показателем Elo — 1236. Эта победа с минимальным отрывом ставит её всего на два пункта выше Simba 3.2 от SpeechifyAI, чей показатель составляет 1234.
Другие тяжеловесы сектора, включая Gemini 3.1 Flash TTS от Google (1214) и Sonic 3.5 (1207), на данный момент отстают. Этот рейтинг указывает на то, что пользователи и эксперты находят архитектуру Alibaba значительно более естественной и качественной по сравнению с признанными лидерами индустрии.
Двухмодельная архитектура и экспрессивное управление
Чтобы удовлетворить различные потребности разработчиков, Alibaba выпустила модель в двух версиях:
- Flash: оптимизирована для взаимодействия в реальном времени с низкой задержкой (около 300 миллисекунд).
- Plus: разработана для обеспечения максимально высокого качества речи и реалистичной просодии.
Одним из самых значимых технических достижений Qwen-Audio-3.0 является способность интерпретировать инструкции на естественном языке для управления стилем речи. Разработчики могут использовать невербальные сигналы с помощью специальных тегов, таких как [angry] или [giggles], чтобы придать результату человеческие эмоции. Кроме того, модель демонстрирует превосходную устойчивость при клонировании голоса, гораздо эффективнее справляясь с зашумленными или имеющими эхо референсными записями, чем её предшественники.
Мультиязычные возможности и компромиссы в производительности
В то время как многие модели TTS ориентированы преимущественно на английский язык, Qwen-Audio-3.0-TTS-Plus предлагает широкие лингвистические возможности, поддерживая 16 языков. Сюда входят как востребованные языки, так и менее распространенные, такие как тагальский, малайский, тайский и вьетнамский, наряду с различными диалектами китайского языка.
Однако у модели есть и свои ограничения. С точки зрения чистой скорости генерации она значительно отстает от конкурентов. При скорости 16 символов в секунду она уступает Sonic 3.5, которая выдает 120 символов в секунду, и Simba 3.2, достигающей 30,2. Разработчикам, создающим высокопроизводительные приложения, придется взвешивать эту задержку генерации символов относительно превосходного экспрессивного качества модели.
В настоящее время модель доступна через Alibaba Cloud Model Studio по цене 27,60 доллара за миллион символов.
Почему это важно для сферы ИИ
Появление Qwen-Audio-3.0-TTS-Plus сигнализирует о переходе в индустрии TTS от простого «создания речи» к «эмоциональному интеллекту». По мере того как LLM становятся всё более разговорными, узким местом становится не только генерация текста, но и способность голоса передавать нюансы, сарказм и эмоции, заложенные в исходном промпте. Способность Alibaba интегрировать невербальные теги и работать с несовершенным аудио для клонирования выводит компанию в авангард следующего поколения иммерсивных ИИ-агентов.
Основные выводы
- Доминирование в рейтинге: Qwen-Audio-3.0-TTS-Plus лидирует в Speech Arena с показателем Elo 1236, опережая Simba 3.2 и Gemini 3.1 Flash TTS.
- Эмоциональные нюансы: Модель поддерживает управление стилем на естественном языке и невербальные сигналы, такие как
[giggles], для повышения реалистичности. - Мультиязычность: Она обеспечивает надежную поддержку 16 языков, включая специализированный охват языков Юго-Восточной Азии и диалектов китайского языка.
