Prism ML השיקה את Bonsai 27B, גרסה של מודל השפה הגדול Qwen 3.6 שמתאימה לטלפון נייד. על ידי כיווץ המקור בגודל 54 GB לפחות מ-4 GB באמצעות קוונטיזציה של 1-bit, החברה משיגה הפחתה של פי 14 בגודל ומאפשרת למשתמשים להריץ את המודל באופן מקומי, ללא קריאות ל-cloud API.
למה הדחיסה חשובה
מודלי שפה גדולים (LLMs) זקוקים בדרך כלל לכרטיס מסך (GPU) ברמה של מחשב שולחני או ל-API בתשלום, מכיוון שהמשקולות (weights) שלהם תופסות עשרות ג'יגה-בייט. קוונטיזציה — שימוש בפחות ביטים לכל משקולת — מצמצמת את המודל אך עלולה גם לשחוק את הידע שלו. Bonsai מציעה שני קצוות: גרסה טרינארית (שלושה ערכי משקולת אפשריים, כ-7.2 GB) וגרסת 1-bit אגרסיבית (כ-3.9 GB). הפשרה בין גודל ליכולת היא המניע של הבדיקה.
כיצד המודלים מתפקדים בשליפת עובדות
מודל Qwen 3.6 המקורי ענה נכון על כל שאלה בנוגע לתאריכים היסטוריים במערך הבדיקות של הבוחן. גרסת ה-ternary של Bonsai פספסה חמש מתוך שש, וגרסת ה-1-bit נכשלה בכל שאילתת תאריך. כצפוי, דחיסה אגרסיבית משליכה תחילה על עובדות נדירות וספציפיות, ומשאירה רק את דפוסי השפה הרחבים המאפשרים שטף דיבור.
ביצועי כתיבת קוד מספרים סיפור אחר
כאשר הפרומפטים עברו למשימות תכנות, התוצאות התהפכו. שלושת המודלים פתרו באגים קלאסיים של concurrency ללא שגיאה. באתגר אנימציית React תובעני, ה-1-bit Bonsai סיים בשתי ניסיונות, בעוד שהמקור נזקק לארבעה כי הוא השקיע זמן נוסף בניתוח (parsing) הקוד. הגרסה הטרנארית נזקקה לעשרה ניסיונות ובסופו של דבר גרסה את שרת הבדיקות.
מכשולים מעשיים
Bonsai אינו פועל על סביבת ההרצה הפופולרית Ollama. מודל ה-1-bit זקוק לשכבת הרצה מותאמת אישית המסופקת על ידי Prism ML, כך שמשתמשים חייבים להתקין תוכנה לא סטנדרטית כדי להפעיל אותו. תלות זו מגבילה את המשיכה של המודל לאלו שמרגישים בנוח לבצע התאמות (tweaking) בסביבת העבודה שלהם.
מי כדאי לו לשקול את Bonsai, ומי כדאי לו להתרחק
- צ'אט לשימוש כללי – האובדן הדרסטי של פרטים עובדתיים הופך את Bonsai ללא מתאים כעוזר מבוסס ידע. לתשובות מדויקות בהיסטוריה, מדע או אירועים אקטואליים, היצמדו למודל המקורי או ל-cloud API.
- עוזר תכנות מקומי – מפתחים שרוצים כלי לא מקוון (offline) שיכול להציע קוד, לתפוס באגים ולרוץ על טלפון או מחשב נייד חלש, יגלו שגרסת ה-1-bit מספקת מהירות ועלות אחסון נמוכה. זהו אינו סוכן אוטונומי, אך הוא מטפל בלוגיקה ובסינטקס ביעילות.
שורה תחתונה
Bonsai 27B מראה שניתן לכווץ LLM של 54 GB ל-3.9 GB ידידותיים לטלפון ועדיין לקבל הצעות קוד מהירות ומוסמכות באופן מפתיע. המחיר הוא שחיקה כמעט מוחלטת של שליפת עובדות ספציפיות, ולכן המודל שייך לארגז הכלים של מפתחים שמעריכים מהירות לא מקוונת על פני ידע אנציקלופדי.
