Qwen2.5-Max של Alibaba ו-V3-Flash של DeepSeek הגיעו לשוק השבוע, כשכל אחת מהן בוחרת בנתיב שונה להסקה (inference) זולה יותר של בינה מלאכותית. Alibaba מפעילה רק כ-95 מיליארד פרמטרים לכל שאילתה באמצעות עיצוב ה-mixture-of-experts (MoE) שלה הכולל 2.4 טריליון פרמטרים; DeepSeek מצמצמת את הארכיטקטורה כדי לחתוך את המחיר לכל טוקן. מרוץ החימוש של ה-AI נמדד כעת בדולרים לכל טוקן, ולא רק בגודל המודל.
מ-"יותר פרמטרים" ל-"פחות עלות"
במשך שנים, המדד המרכזי בפיתוח מודלי שפה גדולים (LLM) היה מספר הפרמטרים. OpenAI, Google ואחרים התרחשו על שבירת מחסום הטריליון פרמטרים, מתוך הנחה שגדול יותר פירושו חכם יותר. Alibaba ו-DeepSeek מראות שהחישוב השתנה.
Qwen2.5-Max של Alibaba עדיין נשען על קנה מידה גדול, אך הוא מוסיף טריק לחיסכון בעלויות. במודל צפוף (dense model), כל פרמטר פועל בכל פעולת הסקה, מה שהופך רשת של 2.4 טריליון פרמטרים למפלצת זוללת אנרגיה. מודל MoE מחלק את הרשת להרבה "מומחים" (experts) ומנתב כל בקשה לתת-קבוצה שלהם. הנתב (router) של Qwen2.5-Max בוחר בערך 95 מיליארד פרמטרים עבור כל פרומפט, מה שמספק את כוח החשיבה של מערכת של טריליון פרמטרים תוך שמירה על שיהוי (latency) וצריכת אנרגיה תחת שליטה.
DeepSeek מוותרת לחלוטין על השאיפה לטריליון פרמטרים. מודל ה-V3-Flash שלה בנוי לפעול בצורה זולה, מהירה ובקנה מידה רחב. החברה משווקת את המודל סביב "תמחור הסקה נמוך במיוחד", במטרה לפנות למפתחים המעבדים מיליוני טוקנים מדי יום מבלי להכביד על התקציב. המחיר המדויק לא פורסם, אך המסר ברור: אם סטארט-אפ לא יכול להרשות לעצמו את התעריפים המערביים לכל טוקן, V3-Flash הופך לחלופה ישימה.
מדוע עלות ההסקה הופכת ליתרון תחרותי
עלות ההסקה הופכת למשמעותית כאשר מודלים יוצאים מהמעבדה ונכנסים לייצור (production). ארגונים המטמיעים LLMs בצ'אטבוטים, בתהליכי ניתוח מסמכים או במנועי המלצות מגלים במהירות שתמחור ברמת הטוקן שולט בהוצאות התפעוליות. מודל שעולה מחצית ממחיר הטוקן של מודל אחר יכול להכפיל את התקציב ליוזמות אחרות — יותר נתונים, תעבורה גבוהה יותר או תכונות נוספות.
שתי החברות הסיניות פונות למקטעי שוק שונים. ה-MoE של Alibaba מבטיח ביצועים גבוהים למשימות מורכבות הדורשות יכולות חשיבה רבות, תוך שמירה על תקציב מחשוב מתון לכל בקשה. מנגד, המודל הרזה יותר של DeepSeek פונה לעומסי עבודה בנפח גבוה ורגישים לשיהוי, שבהם כוח מחשוב גולמי חשוב פחות מעלות צפויה.
שתי האסטרטגיות עשויות לשחוק את נתח השוק של הספקים המערביים, המאגדים מודלים גדולים עם תמחור פרימיום. אם מפתחים ישיגו תוצאות דומות במחיר טוקן זול יותר, התמריץ להישאר עם APIs יקרים ייחלש.
ההימורים עבור המערכת האקולוגית הגלובלית של ה-AI
- סטארט-אפים ועסקים קטנים ובינוניים (SMEs): עלויות הסקה נמוכות יותר מורידות את חסם הכניסה למוצרים מבוססי AI. צוותים שבעבר נזקקו להון נוסף עבור חשבוניות ה-API יכולים כעת לבנות אבות-טיפוס ולהשיק בתקציבים צפופים יותר.
- ארגונים: תאגידים גדולים המפעילים שירותי AI פנימיים יכולים לצמצם הוצאות תפעוליות, ובכך לשחרר כספים לרכישת נתונים, כוונון עדין (fine-tuning) של מודלים או מחשוב נוסף.
- ספקים מערביים: מודלי ההכנסה שלהם מסתמכים על חיוב לפי טוקן. מעבר לחלופות ממוקדות עלות מאלץ אותם להוריד מחירים או להבדיל את עצמם באמצעות יכולות שמודלים זולים יותר עדיין אינם יכולים להשתוות להן.
- רגולטורים וקובעי מדיניות: AI בר השגה יותר עשוי להאיץ את האימוץ במגזרים שונים, מה שיעלה שאלות לגבי פיקוח, פרטיות נתונים וקצב האוטומציה.
הפשרות והטיעונים הנגדיים
מודלי MoE כמו Qwen2.5-Max הם לא "ארוחה חינם". לוגיקת הניתוב מוסיפה מורכבות הנדסית, והפעלה דלילה (sparse activation) עלולה לייצר ביצועים לא אחידים בין סוגי שאילתות שונים. אם הנתב טועה, בקשה עשויה להפעיל מומחים לא אופטימליים, מה שיפגע באיכות הפלט. יתרה מכך, החומרה עדיין מעדיפה מחשוב צפוף; מאיצים ייעודיים להסקת MoE עדיין אינם נפוצים, מה שעלול להגביל את השיפורים ביעילות בעולם האמיתי.
גם הפילוסופיה של DeepSeek, המקדמת עלות תחילה, טומנת בחובה סיכונים. תמחור אגרסיבי פירושו לעיתים קרובות מגבלות הדוקות יותר על גודל המודל ונתוני האימון, מה שעלול להגביל את הביצועים. עבור יישומים הדורשים חשיבה מורכבת וניואנסית, המודל הזול יותר עלול לא לעמוד בציפיות, מה שידחוף משתמשים חזרה לעבר חלופות גדולות ויקרות יותר.
לבסוף, "אינטליגנציה לכל דולר" היא רק ציר אחד של תחרות. שיהוי (latency), אמינות, תמיכה באקו-סיסטם ועמידה ברגולציות אזוריות נותרים גורמים מכריעים. חברות שיספקו חבילה מאוזנת בכל הממדים הללו הן שכנראה ישלטו, ולא רק אלו שינצחו במלחמת המחירים.
מה כדאי לעקוב אחריו בהמשך
- פרסום תוצאות בנצ'מרק: הערכות עצמאיות של יעילות ניתוב ה-MoE של Qwen2.5-Max ועלות הטוקנים של V3-Flash יחשפו האם ההייפ מתרגם לחיסכון מדיד.
- התפתחויות בחומרה: אימוץ של מאיצים המותאמים להפעלה דלילה (sparse activation) עשוי להגביר את יתרונות ה-MoE, בעוד שמעבדים גרפיים (GPUs) לשימוש כללי עשויים לשמור על התחרותיות של מודלים דחוסים (dense models).
- תגובות תמחור: ספקים מערביים עשויים להתאים את מסלולי השירות שלהם או להוסיף תכונות לחיסכון בעלויות, כגון הנחות על הסקה במקבצים (batch inference) או רישוי מקומי (on-premise).
- צעדים רגולטוריים: ככל שבינה מלאכותית זולה יותר תתפשט, ממשלות עשויות להציג תקנים לשקיפות ובטיחות שעשויים להשפיע על האופן שבו מודלים אלו נפרסים בקנה מידה רחב.
שורה תחתונה
Qwen2.5-Max מבוסס ה-MoE של Alibaba ו-V3-Flash בעלות הנמוכה של DeepSeek מראים שמרוץ ה-AI מנוהל כעת באמצעות גיליון תקציב לא פחות מאשר באמצעות מספר פרמטרים. חברות שיספקו יכולות שפה מתוחכמות תוך שמירה על עלות נמוכה לכל טוקן, יפתחו את ה-AI למגוון רחב יותר של משתמשים ויעצבו מחדש את הדינמיקה התחרותית שמעדיפה מזה זמן רב את המודלים הגדולים והיקרים ביותר.
