המודל החדש של PrismML, Bonsai 27B 1-bit, נכנס לקובץ של 3.9 GB ורץ בקצב של כ-11 טוקנים (tokens) בשנייה ב-iPhone 17 Pro Max, מה שמהווה הוכחה לכך שמודל שפה בעל 27 מיליארד פרמטרים יכול להתקיים בסמארטפון צרכני. הטענה הזו חשובה מכיוון שהיא מרחיבה את הגבולות של בינה מלאכותית על המכשיר (on-device AI), ומבטיחה עוזרים אופליין עשירים יותר ללא שליחת נתונים לענן.
למה לצמצום הזה יש חשיבות
ה-Bonsai 27B בדיוק מלא (full-precision) שוקל 54.7 GB. באמצעות קוונטיזציה (quantising) של המודל לייצוג של ביט בודד, PrismML צמצמה אותו ל-3.9 GB — צמצום גודל פי 14. הדחיסה הזו הופכת את המודל לאפשרי מבחינה טכנית לאחסון ב-iPhones מתקדמים, רף שבעבר שלל כל דבר מעבר לכמה מאות מגה-בייט.
כיצד המודל מתפקד על חומרה של Apple
PrismML בנתה את המודל עבור ה-MLX stack של Apple, קבוצת ה-APIs המאפשרת למפתחים להריץ רשתות נוירונים ישירות על ה-neural engine. בבדיקות שלה, המודל הפיק כ-11 טוקנים בכל שנייה ב-iPhone 17 Pro Max. ב-15 מבחני ביצועים (benchmarks) סטנדרטיים של מודלי שפה, גרסת ה-1-bit שמרה על 89.5% מציון האיכות של המודל המקורי, מה שמרמז על כך שהדחיסה לא פגעה ביכולת השימוש שלו.
מגבלות מעשיות שתיתקלו בהן
- עומס זיכרון – הקובץ של 3.9 GB נכנס, אך המודל זקוק גם ל-key-value (KV) cache כדי לאחסן הקשר (context) אחרון. ה-cache הזה גדל עם אורך השיחה ויכול להעלות את צריכת ה-RAM של הטלפון, מה שעלול להאט את המהירות.
- חום וסוללה – הרצת רשת של 27 מיליארד פרמטרים מעמיסה על ה-neural engine. טלפונים נוטים להתחמם תחת עומס מתמשך, והניהול התרמי של Apple יגביל (throttle) את הביצועים כדי להגן על החומרה. PrismML לא פרסמה נתונים קונקרטיים על צריכת הסוללה, כך שהעלות בעולם האמיתי לדפוסי שימוש של יום שלם נותרה לא ידועה.
- ספציפיות למכשיר – טענת הביצועים תקפה ל-iPhone 17 Pro Max החדש ביותר. ל-iPhones ישנים יותר, מכשירי iOS ברמה נמוכה יותר או טלפונים מבוססי Android חסרות את יכולות ה-neural engine דומות, והם יחוו inference איטי יותר או שאולי המודל לא ייכנס בהם כלל.
מי עומד להרוויח, ומי עלול להישאר מאחור
מפתחים של אפליקציות המתמקדות בפרטיות יכולים כעת לארח מודל שפה גדול על המכשיר (on-device), תוך שמירה על נתוני המשתמש בטלפון. זה יכול להוות משמעות של עוזרים קוליים מגיבים יותר, תרגום אופליין או יצירת טקסט הקשרית ללא מנוי לענן.
יצרניות Android ומשתמשי טלפונים בטווח הביניים יפסידו. המודל מסתמך על ה-stack הקנייני של Apple, כך שהאותה דחיסה לא תעבוד באופן אוטומטי במערכות אקולוגיות (ecosystems) אחרות.
מה נותר לבדוק
הנתונים של PrismML מגיעים מ-benchmarks פנימיים. בודקים עצמאיים צריכים לאמת את קצבי הטוקנים לשנייה לאורך סשנים ממושכים, למדוד את צריכת הסוללה בפועל, ולהעריך באיזו מהירות הביצועים יורדים ככל שה-KV cache מתרחב. שימוש בעולם האמיתי — צ'אט במשך שעה, סטרימינג של תוכן, או הרצת המודל לצד אפליקציות אחרות — יחשוף האם נתון ה-11 טוקנים לשנייה מחזיק מעמד מחוץ למעבדה מבוקרת.
שורה תחתונה
Bonsai 27B מראה שמודלי שפה בעלי 27 מיליארד פרמטרים יכולים להיות דחוסים מספיק כדי להתקיים ב-iPhone דגל, תוך אספקת איכות קרובה למלאה במהירות מתונה. הפריצת דרך נשענת על ה-MLX stack של Apple ועדיין ניצבת בפני מכשולים מעשיים: עומס זיכרון, thermal throttling והשפעה לא ידועה על הסוללה. אם בדיקות המשך יאשרו את הטענות, בינה מלאכותית על המכשיר (on-device AI) עשויה לעבור מדמויות נישה לאפליקציות יומיומיות — בתנאי שפער החומרה בין מכשירי הדגל של iOS לשאר השוק יצטמצם.
