Alibaba חשפה את Qwen3.8-Max, מודל Mixture-of-Experts (MoE) בעל 2.4 טריליון פרמטרים שרשם שיעור הצלחה של 86.1% במבחן ה-OSWorld-Verified — Alibaba טוענת שהציון עולה על זה של GPT-5.6, Sol Max ו-Fable 5. המבחן מודד את היכולת של בינה מלאכותית לתקשר עם מערכת הפעלה, להתקין תוכנה ולבצע דיבאגינג (debugging) לקוד, סט מיומנויות המהווה את הבסיס לסוכני הנדסת תוכנה אוטונומיים.
המרוץ לסוכנים אוטונומיים
מודלי שפה גדולים עברו מסגנון של עוזרים מבוססי צ'אט לכלים שיכולים לכתוב, לבדוק ואפילו לפרוס (deploy) קוד. חברות שיוכלו להעביר באופן אמין עבודת הנדסה שגרתית לבינה מלאכותית יוכלו לצמצם עלויות כוח אדם ולהאיץ את מחזורי הפיתוח של המוצרים שלהן. מבחן ה-OSWorld-Verified הפך למדד דה-פקטו ליכולת "סוכנותית" (agentic) מכיוון שהוא דורש יותר מאשר יצירת טקסט סטטי; הוא דורש אינטראקציה בעולם האמיתי עם מערכת.
מה Qwen3.8-Max מביא איתו
- ארכיטקטורת MoE עם 2.4T פרמטרים – ניתן להתייעץ עם עד 64 תת-רשתות מומחה עבור כל טוקן (token), עיצוב ש-Alibaba טוענת כי הוא מקצץ את עלויות המחשוב בכ-40%.
- טיפול ב-prompts מולטימודליים – המודל מקבל טקסט, תמונות ונתונים מובנים יחד, מה שמאפשר לבקשה אחת לתאר ממשק משתמש (UI), להציג צילום מסך ולספק קבצי הגדרה.
- חלון הקשר (context window) של 64k טוקנים – מספיק מקום עבור מאגרי קוד (codebases) מלאים, קבצי לוג או דוחות טכניים ארוכים מבלי לחתוך אותם לחלקים.
תכונות אלו מכוונות לתהליכי עבודה מסוג "end-to-end" שצוותי תוכנה משקיעים בהם שעות: משיכת תלויות (dependencies), סריקת לוגים, תיקון באגים ויצירת תיעוד.
המספרים תחת המיקרוסקופ
| משימה | מדד מדווח |
|---|---|
| OSWorld-Verified (אינטראקציה סוכנותית עם מערכת הפעלה) | 86.1% הצלחה |
| יצירת קוד (HumanEval-Plus) | 78.4% מעבר |
| הסקה מולטימודלית (MM-Bench) | 84.3% |
| סיכום הקשר ארוך (מבחן של 50k טוקנים) | 90.2% |
כל הנתונים מגיעים מהבדיקות הפנימיות של Alibaba. אם הם יתבררו כנכונים, המודל יעניק לארגונים API יחיד שיכול לטפל בקוד, בתמונות ובמסמכים גדולים, תוך שמירה על עלויות הסקה (inference) נמוכות יותר מרוב המתחרים המשתמשים במודלים צפופים (dense-models).
סיכונים והצורך באימות עצמאי
היעדר אימות מצד צד שלישי הוא האזהרה המיידית ביותר. ניתן לבצע כוונון (tuning) למבחני ביצועים, לייעל פרומפטים או לסנן סטים של בדיקות כדי להטות את התוצאות לטובת ארכיטקטורה מסוימת. ללא שכפול חיצוני, הטענה ש-Qwen3.8-Max "מנצח" את GPT-5.6 נותרת זמנית בלבד. יתרה מכך, מודלי MoE עלולים להפגין ביצועים לא אחידים: חלק מהטוקנים עשויים להיות מנותבים למומחים שלא עברו אימון מספק, מה שמוביל להזיות (hallucinations) מזדמנות או לפלטים לא עקביים — בעיות קריטיות כאשר מצפים מבינה מלאכותית לשנות מערכות ייצור (production systems).
מה כדאי לעקוב אחריו בהמשך
- שכפול עצמאי – חוקרים ולקוחות ענן יריצו ככל הנראה את אותה חבילת בדיקות OSWorld-Verified ואת מבחני HumanEval-Plus על חומרה הזמינה לציבור.
- תמחור ושיהוי (latency) – תמחור ה-API של Alibaba Cloud יחשוף האם חיסכון של 40% במחשוב מתרגם ליתרון עלויות מוחשי עבור מפתחים.
- כלים לבטיחות – ככל שסוכנים אוטונומיים ישיגו
