Alibaba חושפת את Qwen3.8-Max: ענק של 2.4 טריליון פרמטרים עבור סוכני AI
צוות Qwen של Alibaba הכריז על Qwen3.8-Max, מודל דגל עצום בעל 2.4 טריליון פרמטרים, שנועד להתקדם מעבר להנחיות צ'אט פשוטות לעבר חשיבה אוטונומית לטווח ארוך (long-horizon). על ידי התמקדות בתהליכי עבודה רב-יומיים וביצוע משימות מורכבות, מודל זה מסמן מעבר משמעותי מ-LLMs תגובתיים לסוכני AI פרואקטיביים.
הרחבת הפרמטרים עבור אינטליגנציה אוטונומית
Qwen3.8-Max הוא כוח טכנולוגי אדיר, המשתמש בסך כולל של 2.4 טריליון פרמטרים עם 95 מיליארד פרמטרים פעילים לכל שאילתה. בהתבסס על ארכיטקטורת Qwen3.5, המודל מותאם במיוחד למשימות "טווח ארוך" (long-horizon) — יעדים מורכבים הדורשים מה-AI לפעול באופן עצמאי לאורך ימים או אפילו שבועות.
בצעד משמעותי עבור קהילת הקוד הפתוח, Alibaba אישרה כי המשקולות (weights) עבור מחלקת Qwen-Max יהיו זמינות לציבור בשבוע הבא, מה שמהווה אתגר לשליטה של מודלי הקצה (frontier models) הסגורים כמו GPT ו-Claude.
הוכחת אוטונומיה באמצעות תכנות ומחקר
כדי להדגים את היכולות הסוכנותיות (agentic) שלו, Alibaba הציגה מספר מקרי בוחן בעלי חשיבות גבוהה שבהם המודל פעל ללא התערבות אנושית:
- הנדסת תוכנה: לאורך תקופה של 16 ימים, Qwen3.8-Max פיתח באופן אוטונומי את כלי שורת הפקודה
oh-my-cli. הוא ניהל בעצמו את ה-GitHub issues שלו, כתב קוד, הריץ בדיקות, וביצע 265 commits ו-127 pull requests. - שחזור מדעי: במשימה לשחזר את תוצאות המאמר "Unified Data Selection for LLM Reasoning", המודל השקיע 125 שעות זמן מחשוב בכתיבת 7,600 שורות קוד. הוא לא רק שחזר את המחקר המקורי, אלא גם שיפר את ציון מבחן המתמטיקה AIME24 ב-2.7 נקודות.
- מדעי הנתונים תחרותיים: באתגר ה-WWW2025 Multimodal Dialogue Intent Recognition, המודל עקף 458 מתוך 526 צוותים אנושיים, כשהוא משפר את הדיוק שלו מ-0.60 ל-0.853 תוך 24 שעות.
מעבר לתוכנה: עיצוב שבבים וסימולציה פיסקלית
יכולת החשיבה של Qwen3.8-Max משתרעת גם על חומרה וכלכלה. במשימת עיצוב מעגל קריפטוגרפי, המודל צמצם באופן איטרטיבי עיצוב "מנופח" מ-8,298 שערים לוגיים ל-678 שערים בלבד. באמצעות כלי ה-OpenROAD, הדבר הוביל לצמצום של 81% בשטח השבב הפיזי.
בסימולציית קמעונאות מורכבת בשם E-Commerce-Bench, המודל ניהל מספר חנויות מקוונות לאורך שנת כספים מדומה. החל מ-100,000 יואן, הוא ניווט במשא ומתן עם ספקים, זיהה 152 נוכלים, וניהל שיבושים בשרשרת האספקה כדי לסיים עם 416,252 יואן — פי ארבעה מההון הראשוני שלו, תוצאה שעקפה משמעותית את המקום השני, GLM 5.2.
חזיתות מולטי-מודאליות ודומיננטיות במבחני ביצועים
המודל גם פורץ את גבולות העיבוד המולטי-מודאלי, כשהוא מסוגל לטפל במסמכים בני 200 עמודים ובסרטונים העולים על 100 שעות. Alibaba מציגה גם את RecreationBench, מבחן ביצועים (benchmark) הבוחן את יכולתו של סוכן לשחזר אפליקציות פעילות (ב-Windows, macOS, Android וכו') אך ורק באמצעות אינטראקציה ויזואלית ושימוש במקלדת, ללא גישה לקוד המקור.
על פי מבחני ביצועים פנימיים, Qwen3.8-Max מתחרה ישירות במודלים מהשורה הראשונה, ומגיע לתוצאות קרובות או גבוהות יותר מ-Claude Opus 4.8 ו-GPT-5.6 Sol במספר קטגוריות, כולל ציון מוביל של 93 ב-PaperBench.
נקודות מפתח
- קנה מידה עצום: Qwen3.8-Max כולל 2.4 טריליון פרמטרים בסך הכל ו-95 מיליארד פרמטרים פעילים, מותאם לעבודה אוטונומית רב-יומית.
- מומחיות סוכנותית: המודל הוכיח יכולת לטפל בהנדסת תוכנה מורכבת, אופטימיזציה של עיצוב שבבים וניהול פיסקלי מלא באופן אוטונומי.
- השפעת המשקולות הפתוחות: בניגוד למודלי קצה רבים, Alibaba מתכננת לשחרר את המשקולות (weights) עבור מחלקת Qwen-Max, מה שיעניק למפתחים גישה חסרת תקדים לאינטליגנציה סוכנותית ברמה גבוהה.
