מודל Mixture-of-Experts בעל 150 מיליארד פרמטרים יכול להפיק טקסט על מחשב נייד סטנדרטי של מפתח. הניסוי מראה שזיכרון ה-RAM, ולא מהירות ה-SSD, הוא מגבלת הביצועים האמיתית. זה חשוב מכיוון שזה מוכיח שניתן לבדוק מודלים בקנה מידה של חזית הטכנולוגיה (frontier-scale) באופן מקומי מבלי להוציא כסף על מחשוב ענן.
הניסוי
הרצנו את מודל DeepSeek V4 Flash — מודל MoE בעל 150 מיליארד פרמטרים שעבר REAP-pruning — דרך מנוע ההסקה (inference engine) בקוד פתוח Colibrì. החומרה הייתה מחשב נייד AMD Ryzen AI 9 365 עם 61 GB של RAM ו-1 TB NVMe SSD. תיזקנו ריצת יצירה (generation) בת שלוש דקות ורישמנו כל גישה לדיסק.
מה המספרים חושפים
- פעילות הדיסק הייתה מינימלית. ה-SSD ביצע פחות מ-11 שניות של קריאות במהלך שלוש דקות היצירה. גם אם הכונן היה יכול לקרוא נתונים באופן מיידי, התפוקה (throughput) הכוללת הייתה משתפרת בכ-6 אחוזים בלבד.
- גודל ה-RAM השפיע ישירות על המהירות. צמצום מטמון ה-RAM בחצי הפחית את התפוקה בכ-15 אחוזים בערך. ה-CPU בילה כמעט באותה כמות זמן בטיפול ב-cache misses — דה-קוונטיזציה (de-quantising), העתקה וניהול נתונים — כפי שבילה בהמתנה לדיסק.
נתונים אלו מפריכים את האמונה הרווחת שרוחב הפס של האחסון הוא צוואר הבקבוק העיקרי להסקה (inference) של מודלים גדולים על מחשב נייד.
למה RAM מנצח את ה-SSD
כאשר פרמטר של מודל אינו נמצא כבר ב-RAM, המערכת חייבת:
- למשוך את הנתונים מה-SSD.
- לפענח אותם ולהעביר אותם לרגיסטרים של ה-CPU לצורך חישוב.
שני השלבים צורכים מחזורי שעון (cycles). השלב הראשון מוגבל על ידי רוחב הפס של ה-SSD; השני מוסיף עיכוב דומה בערך מכיוון שה-CPU חייב לבצע דה-קוונטיזציה לנתונים ללא קשר למהירות ההגעה שלהם. לכן, SSD מהיר יותר מניב תשואה פוחתת, בעוד שזיכרון RAM גדול יותר מאפשר ליותר מהמודל להישאר בזיכרון ומבטל את ה"מסע הלוך ושוב" (round-trip) היקר.
השלכות למפתחים
- השקיעו בזיכרון, לא באחסון.
- בדיקה מקומית הופכת לישימה. מפתחים יכולים להריץ מודלי MoE בעלי משקלים פתוחים (open-weight) על מכשירים קיימים, ולבדוק סגנון, התנהגות קריאה לכלים (tool-calling) ואיכות פלט מבלי לשלם על קרדיטים בענן.
- הערכה במקבצים (Batch evaluation) היא ריאלית. צ'אט בזמן אמת עשוי עדיין להרגיש איטי, אך משימות בתור — יצירת עשרות פרומפטים למחקר — רצות בנוחות על מחשב נייד.
טיעון נגד פוטנציאלי
יש הטוענים כי השהיית (latency) ה-SSD עדיין משמעותית עבור עומסי עבודה הטוענים שוב ושוב משקלים חדשים של מומחים (expert weights).
מה כדאי לעקוב אחריו בהמשך
- וריאנטים של מודלים חסכוניים בזיכרון.
- חומרה עם מטמונים (caches) גדולים יותר על השבב.
- אסטרטגיות מטמון ברמת התוכנה.
השורה התחתונה ברורה: מפתחים שרוצים להתנסות במודלי MoE עצומים על מחשב נייד צריכים לקנות יותר RAM. שדרוגי SSD חוסכים רק אחוזים בודדים, בעוד שזיכרון נוסף יכול לקצר את זמן ההסקה (inference) באחוזים דו-ספרתיים. זה משנה את חישוב העלויות עבור אב-טיפוס של AI ופותח את הדלת לבדיקה מקומית וחינמית של מודלים שבעבר נחשבו ככאלו הדורשים אשכולות ענן ייעודיים.
