Prism ML випустила Bonsai 27B — версію великої мовної моделі Qwen 3.6, яка вміщується на мобільному телефоні. Завдяки стисненню оригінальної моделі обсягом 54 ГБ до менш ніж 4 ГБ за допомогою 1-бітного квантування, компанія досягла 14-кратного зменшення розміру, що дозволяє користувачам запускати модель локально, без викликів хмарних API.
Чому стиснення має значення
LLM зазвичай потребують відеокарти настільного класу або платного API, оскільки їхні ваги займають десятки гігабайтів. Квантування — використання меншої кількості бітів на вагу — зменшує модель, але також може призвести до втрати знань. Bonsai пропонує два екстремальні варіанти: тернарну версію (три можливі значення ваги, 7,2 ГБ) та агресивну 1-бітну версію (3,9 ГБ). Тестування базується на компромісі між розміром і можливостями.
Як моделі справляються з відтворенням фактів
Оригінальна Qwen 3.6 правильно відповіла на кожне запитання щодо історичних дат у наборі тестів. Тернарна Bonsai помилилася у п'яти з шести випадків, а 1-бітна версія не змогла відповісти жодному запиту щодо дат. Як і очікувалося, агресивне стиснення спочатку відкидає рідкісні, специфічні факти, зберігаючи лише загальні мовні патерни, що забезпечують плавність мовлення.
Продуктивність у програмуванні свідчить про інше
Коли промпти змінили на завдання з програмування, результати змінилися на протилежні. Усі три моделі без помилок вирішили класичні баги паралелізму. У складному завданні з анімацією на React 1-бітна Bonsai впоралася за дві спроби, тоді як оригінальній знадобилося чотири, оскільки вона витрачала додатковий час на парсинг коду. Тернарній версії знадобилося десять спроб, і зрештою вона призвела до збою тестового сервера.
Практичні перешкоди
Bonsai не працює на популярному середовищі виконання Ollama. 1-бітна модель потребує спеціального рівня виконання, що надається Prism ML, тому користувачам доведеться встановлювати нестандартне програмне забезпечення для її роботи. Ця залежність обмежує привабливість моделі лише тими, хто звик налаштовувати своє середовище вручну.
Кому варто звернути увагу на Bonsai, а кому краще оминути його
- Універсальний чат — Через різку втрату фактичної деталізації Bonsai не підходить на роль асистента з базою знань. Для точних відповідей з історії, науки чи поточних подій краще використовувати оригінальну модель або хмарне API.
- Локальний помічник у програмуванні — Розробники, яким потрібен офлайн-інструмент для пропозицій коду, пошуку багів і роботи на телефоні чи слабкому ноутбуці, побачать, що 1-бітна версія забезпечує швидкість і низькі витрати пам'яті. Це не автономний агент, але вона ефективно працює з логікою та синтаксисом.
Підсумок
Bonsai 27B демонструє, що можна стиснути LLM обсягом 54 ГБ до зручних для телефону 3,9 ГБ і при цьому отримувати напрочуд швидкі та компетентні пропозиції коду. Ціною є майже повна втрата здатності відтворювати конкретні факти, тому ця модель підійде розробникам, які цінують швидкість офлайн-роботи вище за енциклопедичні знання.
