Qwen-Audio-3.0-TTS-Plus של Alibaba תופסת את המקום הראשון בדירוגי ה-TTS

Alibaba חוללה מהפכה בנוף סינתזת הדיבור עם השקת Qwen-Audio-3.0-TTS-Plus, מודל חדש שזכה רשמית במקום הראשון בלוח המובילים של Artificial Analysis Speech Arena. על ידי מתן עדיפות לניואנסים אקספרסיביים ולעומק רב-לשוני, Alibaba קובעת סטנדרט חדש עבור קולות מלאכותיים באיכות גבוהה (high-fidelity).

עוקפת את ענקיות התעשייה במדדי Elo

הנוף התחרותי של טכנולוגיית Text-to-Speech (TTS) השתנה בעקבות הדירוגים האחרונים של Artificial Analysis. המודל Qwen-Audio-3.0-TTS-Plus של Alibaba הבטיח לעצמו את המקום הראשון עבור קולות של ספקי שירות עם ציון Elo מרשים של 1,236. ניצחון צמוד זה מציב אותו במרחק של שתי נקודות בלבד לפני Simba 3.2 של SpeechifyAI, המחזיק בציון של 1,234.

כבדי משקל אחרים במגזר, כולל Gemini 3.1 Flash TTS של Google (1,214) ו-Sonic 3.5 (1,207), נמצאים כרגע מאחור. דירוג זה מעיד על כך שמשתמשים ומעריכים מוצאים טבעיות ואיכות גבוהות משמעותית בארכיטקטורה החדשה ביותר של Alibaba בהשוואה למובילות התעשייה המבוססות.

ארכיטקטורת מודל כפולה ושליטה אקספרסיבית

כדי לתת מענה לצרכים שונים של מפתחים, Alibaba שחררה את המודל בשתי גרסאות נפרדות:

  • Flash: מותאם לאינטראקציות בזמן אמת עם שיהוי (latency) נמוך של כ-300 מילישניות.
  • Plus: תוכנן עבור פלט דיבור באיכות גבוהה מקסימלית ופרוזודיה (prosody) חיה וטבעית.

אחת הקפיצות הטכנולוגיות המשמעותיות ביותר ב-Qwen-Audio-3.0 היא היכולת שלו לפרש הוראות בשפה טבעית כדי להכווין סגנונות דיבור. מפתחים יכולים להשתמש ברמזים לא-מילוליים באמצעות תגיות ספציפיות, כגון [angry] או [giggles], כדי להזריק רגש דמוי-אדם לפלט. יתרה מכך, המודל מפגין חוסן (robustness) עדיף בשכפול קול (voice cloning), כשהוא מטפל בהקלטות ייחוס רועשות או עתירות הד בצורה יעילה הרבה יותר מקודמיו.

יכולות רב-לשוניות ופשרות בביצועים

בעוד שמודלי TTS רבים מתמקדים רבות באנגלית, Qwen-Audio-3.0-TTS-Plus מציע תועלת לשונית רחבה על ידי תמיכה ב-16 שפות. זה כולל שפות מבוקשות לצד שפות שזוכות לכיסוי פחות נפוץ כמו טגלוג, מלזית, תאילנדית וויאטנעמית, לצד דיאלקטים סיניים שונים.

עם זאת, המודל אינו חף מחיסרונות. במונחים של מהירות יצירה גולמית, הוא מפגר משמעותית אחרי המתחרים. בקצב של 16 תווים לשנייה, הוא מפגר אחרי Sonic 3.5, שמגיע ל-120 תווים לשנייה, ו-Simba 3.2, שמגיע ל-30.2. עבור מפתחים שבונים אפליקציות בעלות תפוקה גבוהה (high-throughput), יש לשקול את השיהוי הזה ביצירת תווים אל מול האיכות האקספרסיבית העדיפה של המודל.

כיום, ניתן לגשת למודל דרך Alibaba Cloud Model Studio, במחיר של $27.60 למיליון תווים.

למה זה חשוב לנוף ה-AI

עלייתה של Qwen-Audio-3.0-TTS-Plus מסמנת שינוי בתעשיית ה-TTS מ"יצירת דיבור" גרידא ל"אינטליגנציה רגשית". ככל שמודלי שפה גדולים (LLMs) הופכים לשיחתיים יותר, צוואר הבקבוק אינו רק יצירת הטקסט, אלא היכולת של הקול להעביר את הניואנסים, הציניות והרגש הקיימים בהנחיה (prompt) הבסיסית. היכולת של Alibaba לשלב תגיות לא-מילוליות ולטפל באודיו לא מושלם לצורך שכפול מציבה אותה בחזית הדור הבא של סוכני AI סוחפים (immersive).

נקודות מפתח

  • דומיננטיות בדירוגים: Qwen-Audio-3.0-TTS-Plus מוביל את ה-Speech Arena עם ציון Elo של 1,236, ועוקף את Simba 3.2 ו-Gemini 3.1 Flash TTS.
  • ניואנסים רגשיים: המודל תומך בהכוונת סגנון בשפה טבעית וברמזים לא-מילוליים כמו [giggles] כדי להגביר את הריאליזם.
  • רוחב לשוני: הוא מציע תמיכה חזקה ב-16 שפות, כולל כיסוי ייעודי לשפות דרום-מזרח אסיאתיות ודיאלקטים סיניים.