POCKET-35B, מודל שפה בעל 35 מיליארד פרמטרים ששוחרר על ידי VIDRAFT, יכול כעת לרוץ על מחשב נייד בעל CPU בלבד. המשקולות (weights) של המודל בפורמט GGUF נטענות ישירות לתוך llama.cpp או Ollama, כך שצוותים ללא תקציב ל-GPU יכולים להתחיל להתנסות באופן מיידי. תוך שבעה שבועות מהשקתו, המודל חצה את מיליון ההורדות ב-Hugging Face, והגיע למקום ה-13 מבין כל הורדות ה-GGUF ברחבי העולם.
למה LLM הפועל על CPU בלבד חשוב כעת
ארגונים שצריכים לשמור טקסטים קנייניים — אימיילים של לקוחות, כרטיסי תמיכה (tickets) פנימיים, קטעי קוד — בשרתים מקומיים (on-premises), לרוב חסרים את התקציב עבור כרטיסי מסך ייעודיים. עד לא מזמן, האפשרות המעשית היחידה הייתה לשלוח נתונים ל-API המאוחסן בענן, דבר שגבה מחיר בפרטיות וגרר עלויות חוזרות. POCKET-35B מבטיח פתרון ביניים: מודל גדול מספיק כדי להתמודד עם הנחיות (prompts) מורכבות, תוך שהוא נכנס למגבלות הזיכרון של מחשב נייד משרדי טיפוסי או mini-PC.
איך המודל נכנס למחשב נייד
- פורמט GGUF – קונטיינר בינארי המאחסן משקולות מקונטות (quantized weights).
- תאימות – גם llama.cpp וגם Ollama כוללים סביבות הרצה (runtimes) הקוראות בקובצי GGUF ומבצעות הסקה (inference) על CPUs. ניתן להשתמש ב-GPU מובנה כדי להעביר אליו מספר שכבות, אך זה אינו נדרש.
- בדיקת RAM – גודל קובץ ה-GGUF הוא כמות ה-RAM המינימלית שתצטרכו. אם גודל הקובץ הוא, למשל, כמה ג'יגה-בייט, נדרש מכשיר עם לפחות אותה כמות זיכרון פנוי עוד לפני שההורדה מתחילה.
שלבים להרצת POCKET-35B על המחשב הנייד שלך
- אמת את הזיכרון – פתח את מנהל המשימות (task manager) של המערכת, רשום את סך ה-RAM והשווה אותו לגודל קובץ ה-GGUF המופיע בדף Hugging Face.
- בחר את הקיטון (quantization) המתאים – התחל עם גרסת ה-Q4; היא מאזנת בין גודל למהירות עבור רוב המחשבים הניידים.
- הורד באמצעות llama.cpp או Ollama – שני הכלים יכולים למשוך את המודל ישירות מ-Hugging Face, תוך ביצוע אימות checksum באופן אוטומטי.
- בצע בדיקת תקינות מהירה – הפעל את סביבת ההרצה עם הנחיה (prompt) פשוטה של "Hello, world" כדי לוודא שהטעינה הצליחה.
- צור סדרת בדיקות ביצועים (benchmark) ריאלית – אסוף 30-50 משימות המשקפות את עומס העבודה בייצור (למשל, סיווג קטגוריות של כרטיסי תמיכה, ניסוח תשובות לאימיילים). הרץ אותן דרך המודל ותעד את השיהוי (latency) ואת איכות פלט הטוקנים (token-output).
- בדוק כיסוי שפות – התיעוד של POCKET-35B אינו כולל רשימת שפות. אם אתה זקוק לוייטנאמית או לכתבים אחרים שאינם באנגלית, הזן מספר משפטים עם סימני הטעמה וראה אם המודל מייצר פלט קוהרנטי.
- מדוד שיהוי (latency) בפועל – רשום את הזמנים לכל הנחיה (prompt) על החומרה הספציפית שלך; אל תסתמך על מספרי benchmark שפורסמו על ידי משתמשים אחרים עם CPUs או רוחב פס RAM שונים.
מה מספרי ההורדות לא מספרים לכם
מיליון הורדות מעידות על סקרנות רבה מצד הקהילה, אך לא על ביצועים מובטחים. יכולת ההסקה (reasoning), מיומנות יצירת הקוד והיכולת לעקוב אחר הנחיות של המודל טרם נבדקו באופן עצמאי. VIDRAFT לא חשפה את פרטי הארכיטקטורה של המודל או את מקורות נתוני האימון, מה שמותיר פער מידע שהופך את הפריסה לסביבת ייצור (production) למסוכנת.
סיכונים וטיעונים נגדיים
- איכות לא ברורה – ללא מדדי הערכה שפורסמו, לא ניתן להיות בטוחים ש-POCKET-35B תואם לרמת הדיוק של חלופות קוד פתוח אחרות.
- חוסר ודאות ברמת ייצור – היעדר שקיפות ארכיטקטונית מקשה על חיזוי התנהגות תחת הנחיות עוינות (adversarial prompts) או קלטים של מקרי קצה (edge-case).
שורה תחתונה
אם הצוות שלכם צריך להתנסות ב-LLM בעל 35 מיליארד פרמטרים כבר היום ואינו יכול להרשות לעצמו GPU, POCKET-35B מציע נקודת כניסה ישימה ובעלות נמוכה. המודל רץ על מחשב נייד סטנדרטי באמצעות פורמט GGUF, וסביבות ההרצה בקוד פתוח הופכות את ההגדרה לפשוטה. עם זאת, התייחסו למודל כניסיוני: ודאו את דרישות הזיכרון, בצעו benchmark עם משימות אמיתיות ואשרו את הטיפול בשפות לפני שאתם משלבים אותו בכל תהליך ייצור (production pipeline). ככל שנתוני הקהילה יצטברו ו-VIDRAFT תפרסם פרטים נוספים, פרופיל הסיכון יהפוך לברור יותר — אך לעת עתה, מחשב נייד בודד אכן יכול לארח LLM של 35 מיליארד פרמטרים, אם כי עם ציפיות מחושבות.
