מודל Mixture-of-Experts בעל 150 מיליארד פרמטרים יכול להפיק טקסט על מחשב נייד סטנדרטי של מפתח. הניסוי מראה שזיכרון ה-RAM, ולא מהירות ה-SSD, הוא מגבלת הביצועים האמיתית. זה חשוב מכיוון שזה מוכיח שניתן לבדוק מודלים בקנה מידה של חזית הטכנולוגיה (frontier-scale) באופן מקומי מבלי להוציא כסף על מחשוב ענן.

הניסוי

הרצנו את מודל DeepSeek V4 Flash — מודל MoE בעל 150 מיליארד פרמטרים שעבר REAP-pruning — דרך מנוע ההסקה (inference engine) בקוד פתוח Colibrì. החומרה הייתה מחשב נייד AMD Ryzen AI 9 365 עם 61 GB של RAM ו-1 TB NVMe SSD. תיזקנו ריצת יצירה (generation) בת שלוש דקות ורישמנו כל גישה לדיסק.

מה המספרים חושפים

  • פעילות הדיסק הייתה מינימלית. ה-SSD ביצע פחות מ-11 שניות של קריאות במהלך שלוש דקות היצירה. גם אם הכונן היה יכול לקרוא נתונים באופן מיידי, התפוקה (throughput) הכוללת הייתה משתפרת בכ-6 אחוזים בלבד.
  • גודל ה-RAM השפיע ישירות על המהירות. צמצום מטמון ה-RAM בחצי הפחית את התפוקה בכ-15 אחוזים בערך. ה-CPU בילה כמעט באותה כמות זמן בטיפול ב-cache misses — דה-קוונטיזציה (de-quantising), העתקה וניהול נתונים — כפי שבילה בהמתנה לדיסק.

נתונים אלו מפריכים את האמונה הרווחת שרוחב הפס של האחסון הוא צוואר הבקבוק העיקרי להסקה (inference) של מודלים גדולים על מחשב נייד.

למה RAM מנצח את ה-SSD

כאשר פרמטר של מודל אינו נמצא כבר ב-RAM, המערכת חייבת:

  1. למשוך את הנתונים מה-SSD.
  2. לפענח אותם ולהעביר אותם לרגיסטרים של ה-CPU לצורך חישוב.

שני השלבים צורכים מחזורי שעון (cycles). השלב הראשון מוגבל על ידי רוחב הפס של ה-SSD; השני מוסיף עיכוב דומה בערך מכיוון שה-CPU חייב לבצע דה-קוונטיזציה לנתונים ללא קשר למהירות ההגעה שלהם. לכן, SSD מהיר יותר מניב תשואה פוחתת, בעוד שזיכרון RAM גדול יותר מאפשר ליותר מהמודל להישאר בזיכרון ומבטל את ה"מסע הלוך ושוב" (round-trip) היקר.

השלכות למפתחים

  • השקיעו בזיכרון, לא באחסון.
  • בדיקה מקומית הופכת לישימה. מפתחים יכולים להריץ מודלי MoE בעלי משקלים פתוחים (open-weight) על מכשירים קיימים, ולבדוק סגנון, התנהגות קריאה לכלים (tool-calling) ואיכות פלט מבלי לשלם על קרדיטים בענן.
  • הערכה במקבצים (Batch evaluation) היא ריאלית. צ'אט בזמן אמת עשוי עדיין להרגיש איטי, אך משימות בתור — יצירת עשרות פרומפטים למחקר — רצות בנוחות על מחשב נייד.

טיעון נגד פוטנציאלי

יש הטוענים כי השהיית (latency) ה-SSD עדיין משמעותית עבור עומסי עבודה הטוענים שוב ושוב משקלים חדשים של מומחים (expert weights).

מה כדאי לעקוב אחריו בהמשך

  • וריאנטים של מודלים חסכוניים בזיכרון.
  • חומרה עם מטמונים (caches) גדולים יותר על השבב.
  • אסטרטגיות מטמון ברמת התוכנה.

השורה התחתונה ברורה: מפתחים שרוצים להתנסות במודלי MoE עצומים על מחשב נייד צריכים לקנות יותר RAM. שדרוגי SSD חוסכים רק אחוזים בודדים, בעוד שזיכרון נוסף יכול לקצר את זמן ההסקה (inference) באחוזים דו-ספרתיים. זה משנה את חישוב העלויות עבור אב-טיפוס של AI ופותח את הדלת לבדיקה מקומית וחינמית של מודלים שבעבר נחשבו ככאלו הדורשים אשכולות ענן ייעודיים.