مدل Qwen-Audio-3.0-TTS-Plus از علیبابا در رتبهبندیهای TTS جایگاه نخست را از آن خود کرد
علیبابا با انتشار Qwen-Audio-3.0-TTS-Plus، چشمانداز سنتز گفتار را متحول کرده است؛ مدل جدیدی که رسماً در جدول ردهبندی Artificial Analysis Speech Arena پیشتاز شده است. علیبابا با اولویت دادن به ظرافتهای بیانی و عمق چندزبانه، معیار جدیدی را برای صداهای مصنوعی با کیفیت بسیار بالا (high-fidelity) تعیین میکند.
پیشی گرفتن از غولهای صنعت در امتیازات Elo
فضای رقابتی فناوری تبدیل متن به گفتار (TTS) پس از آخرین رتبهبندی Artificial Analysis تغییر کرده است. مدل Qwen-Audio-3.0-TTS-Plus از علیبابا با کسب امتیاز خیرهکننده ۱,۲۳۶ در سیستم Elo، جایگاه نخست را برای صداهای ارائهدهندگان به دست آورده است. این پیروزی نزدیک، آن را تنها دو امتیاز بالاتر از Simba 3.2 از SpeechifyAI قرار میدهد که امتیاز ۱,۲۳۴ را دارد.
سایر وزنههای سنگین این بخش، از جمله Gemini 3.1 Flash TTS گوگل (۱,۲۱۴) و Sonic 3.5 (۱,۲۰۷)، در حال حاضر در رتبههای پایینتر قرار دارند. این رتبهبندی نشان میدهد که کاربران و ارزیابها، در معماری جدید علیبابا در مقایسه با رهبران تثبیتشده صنعت، طبیعی بودن و کیفیت بسیار بیشتری را تجربه میکنند.
معماری دوگانه و کنترل بیانی
برای پاسخگویی به نیازهای مختلف توسعهدهندگان، علیبابا این مدل را در دو نسخه متمایز عرضه کرده است:
- Flash: بهینهسازی شده برای تعاملات بلادرنگ با تأخیر کم، با حدود ۳۰۰ میلیثانیه تأخیر.
- Plus: طراحی شده برای حداکثر خروجی گفتار با کیفیت بالا و آهنگ کلام (prosody) واقعگرایانه.
یکی از مهمترین جهشهای فنی در Qwen-Audio-3.0، توانایی آن در تفسیر دستورات زبان طبیعی برای هدایت سبکهای گفتاری است. توسعهدهندگان میتوانند از نشانههای غیرکلامی از طریق تگهای خاص، مانند [angry] یا [giggles]، برای تزریق احساسات انسانی به خروجی استفاده کنند. علاوه بر این، این مدل در شبیهسازی صدا (voice cloning) استحکام فوقالعادهای از خود نشان میدهد و ضبطهای مرجع نویزی یا دارای پژواک زیاد را بسیار مؤثرتر از مدلهای پیشین خود مدیریت میکند.
قابلیتهای چندزبانه و موازنه عملکرد
در حالی که بسیاری از مدلهای TTS تمرکز شدیدی بر زبان انگلیسی دارند، Qwen-Audio-3.0-TTS-Plus با پشتیبانی از ۱۶ زبان، کاربرد زبانی گستردهای را ارائه میدهد. این شامل زبانهای پرتقاضا و همچنین زبانهایی است که کمتر پوشش داده میشوند، مانند تاگالوگ، مالایی، تایلندی و ویتنامی، در کنار گویشهای مختلف چینی.
با این حال، این مدل بدون محدودیت نیست. از نظر سرعت تولید خام، این مدل به طور قابل توجهی از رقبا عقبتر است. با نرخ ۱۶ کاراکتر در ثانیه، این مدل از Sonic 3.5 که ۱۲۰ کاراکتر در ثانیه سرعت دارد و Simba 3.2 که به ۳۰.۲ کاراکتر در ثانیه میرسد، عقب مانده است. برای توسعهدهندگانی که اپلیکیشنهای با توان عملیاتی بالا (high-throughput) میسازند، این تأخیر در تولید کاراکتر باید در مقابل کیفیت بیانی برتر مدل سنجیده شود.
در حال حاضر، این مدل از طریق Alibaba Cloud Model Studio در دسترس است و قیمت آن ۲۷.۶۰ دلار به ازای هر میلیون کاراکتر میباشد.
چرا این موضوع برای چشمانداز هوش مصنوعی اهمیت دارد
ظهور Qwen-Audio-3.0-TTS-Plus نشاندهنده تغییری در صنعت TTS از صرفاً «تولید گفتار» به سمت «هوش هیجانی» است. با گفتگوییتر شدن مدلهای زبانی بزرگ (LLMs)، گلوگاه دیگر فقط تولید متن نیست، بلکه توانایی صدا در انتقال ظرافتها، کنایه و احساسات موجود در دستور (prompt) اصلی است. توانایی علیبابا در ادغام تگهای غیرکلامی و مدیریت صداهای ناقص برای شبیهسازی، آنها را در خط مقدم نسل بعدی عوامل هوش مصنوعی غوطهورکننده (immersive AI agents) قرار میدهد.
نکات کلیدی
- تسلط بر جدول ردهبندی: Qwen-Audio-3.0-TTS-Plus با امتیاز Elo برابر با ۱,۲۳۶، در Speech Arena پیشتاز است و از Simba 3.2 و Gemini 3.1 Flash TTS پیشی گرفته است.
- ظرافتهای هیجانی: این مدل از هدایت سبک با زبان طبیعی و نشانههای غیرکلامی مانند
[giggles]برای افزایش واقعگرایی پشتیبانی میکند. - گستره چندزبانه: این مدل پشتیبانی قدرتمندی از ۱۶ زبان، از جمله پوشش تخصصی برای زبانهای جنوب شرق آسیا و گویشهای چینی ارائه میدهد.
