مدل Qwen-Audio-3.0-TTS-Plus از علی‌بابا در رتبه‌بندی‌های TTS جایگاه نخست را از آن خود کرد

علی‌بابا با انتشار Qwen-Audio-3.0-TTS-Plus، چشم‌انداز سنتز گفتار را متحول کرده است؛ مدل جدیدی که رسماً در جدول رده‌بندی Artificial Analysis Speech Arena پیشتاز شده است. علی‌بابا با اولویت دادن به ظرافت‌های بیانی و عمق چندزبانه، معیار جدیدی را برای صداهای مصنوعی با کیفیت بسیار بالا (high-fidelity) تعیین می‌کند.

پیشی گرفتن از غول‌های صنعت در امتیازات Elo

فضای رقابتی فناوری تبدیل متن به گفتار (TTS) پس از آخرین رتبه‌بندی Artificial Analysis تغییر کرده است. مدل Qwen-Audio-3.0-TTS-Plus از علی‌بابا با کسب امتیاز خیره‌کننده ۱,۲۳۶ در سیستم Elo، جایگاه نخست را برای صداهای ارائه‌دهندگان به دست آورده است. این پیروزی نزدیک، آن را تنها دو امتیاز بالاتر از Simba 3.2 از SpeechifyAI قرار می‌دهد که امتیاز ۱,۲۳۴ را دارد.

سایر وزنه‌های سنگین این بخش، از جمله Gemini 3.1 Flash TTS گوگل (۱,۲۱۴) و Sonic 3.5 (۱,۲۰۷)، در حال حاضر در رتبه‌های پایین‌تر قرار دارند. این رتبه‌بندی نشان می‌دهد که کاربران و ارزیاب‌ها، در معماری جدید علی‌بابا در مقایسه با رهبران تثبیت‌شده صنعت، طبیعی بودن و کیفیت بسیار بیشتری را تجربه می‌کنند.

معماری دوگانه و کنترل بیانی

برای پاسخگویی به نیازهای مختلف توسعه‌دهندگان، علی‌بابا این مدل را در دو نسخه متمایز عرضه کرده است:

  • Flash: بهینه‌سازی شده برای تعاملات بلادرنگ با تأخیر کم، با حدود ۳۰۰ میلی‌ثانیه تأخیر.
  • Plus: طراحی شده برای حداکثر خروجی گفتار با کیفیت بالا و آهنگ کلام (prosody) واقع‌گرایانه.

یکی از مهم‌ترین جهش‌های فنی در Qwen-Audio-3.0، توانایی آن در تفسیر دستورات زبان طبیعی برای هدایت سبک‌های گفتاری است. توسعه‌دهندگان می‌توانند از نشانه‌های غیرکلامی از طریق تگ‌های خاص، مانند [angry] یا [giggles]، برای تزریق احساسات انسانی به خروجی استفاده کنند. علاوه بر این، این مدل در شبیه‌سازی صدا (voice cloning) استحکام فوق‌العاده‌ای از خود نشان می‌دهد و ضبط‌های مرجع نویزی یا دارای پژواک زیاد را بسیار مؤثرتر از مدل‌های پیشین خود مدیریت می‌کند.

قابلیت‌های چندزبانه و موازنه عملکرد

در حالی که بسیاری از مدل‌های TTS تمرکز شدیدی بر زبان انگلیسی دارند، Qwen-Audio-3.0-TTS-Plus با پشتیبانی از ۱۶ زبان، کاربرد زبانی گسترده‌ای را ارائه می‌دهد. این شامل زبان‌های پرتقاضا و همچنین زبان‌هایی است که کمتر پوشش داده می‌شوند، مانند تاگالوگ، مالایی، تایلندی و ویتنامی، در کنار گویش‌های مختلف چینی.

با این حال، این مدل بدون محدودیت نیست. از نظر سرعت تولید خام، این مدل به طور قابل توجهی از رقبا عقب‌تر است. با نرخ ۱۶ کاراکتر در ثانیه، این مدل از Sonic 3.5 که ۱۲۰ کاراکتر در ثانیه سرعت دارد و Simba 3.2 که به ۳۰.۲ کاراکتر در ثانیه می‌رسد، عقب مانده است. برای توسعه‌دهندگانی که اپلیکیشن‌های با توان عملیاتی بالا (high-throughput) می‌سازند، این تأخیر در تولید کاراکتر باید در مقابل کیفیت بیانی برتر مدل سنجیده شود.

در حال حاضر، این مدل از طریق Alibaba Cloud Model Studio در دسترس است و قیمت آن ۲۷.۶۰ دلار به ازای هر میلیون کاراکتر می‌باشد.

چرا این موضوع برای چشم‌انداز هوش مصنوعی اهمیت دارد

ظهور Qwen-Audio-3.0-TTS-Plus نشان‌دهنده تغییری در صنعت TTS از صرفاً «تولید گفتار» به سمت «هوش هیجانی» است. با گفتگویی‌تر شدن مدل‌های زبانی بزرگ (LLMs)، گلوگاه دیگر فقط تولید متن نیست، بلکه توانایی صدا در انتقال ظرافت‌ها، کنایه و احساسات موجود در دستور (prompt) اصلی است. توانایی علی‌بابا در ادغام تگ‌های غیرکلامی و مدیریت صداهای ناقص برای شبیه‌سازی، آن‌ها را در خط مقدم نسل بعدی عوامل هوش مصنوعی غوطه‌ورکننده (immersive AI agents) قرار می‌دهد.

نکات کلیدی

  • تسلط بر جدول رده‌بندی: Qwen-Audio-3.0-TTS-Plus با امتیاز Elo برابر با ۱,۲۳۶، در Speech Arena پیشتاز است و از Simba 3.2 و Gemini 3.1 Flash TTS پیشی گرفته است.
  • ظرافت‌های هیجانی: این مدل از هدایت سبک با زبان طبیعی و نشانه‌های غیرکلامی مانند [giggles] برای افزایش واقع‌گرایی پشتیبانی می‌کند.
  • گستره چندزبانه: این مدل پشتیبانی قدرتمندی از ۱۶ زبان، از جمله پوشش تخصصی برای زبان‌های جنوب شرق آسیا و گویش‌های چینی ارائه می‌دهد.