Нова 1-бітна модель Bonsai 27B від PrismML займає лише 3,9 ГБ і працює зі швидкістю близько 11 токенів на секунду на iPhone 17 Pro Max, що доводить: мовна модель із 27 мільярдами параметрів може працювати на споживчому смартфоні. Це твердження є важливим, оскільки воно розширює межі локального ШІ (on-device AI), обіцяючи складніші офлайн-асистенти без необхідності надсилати дані в хмару.
Чому це зменшення має значення
Повнопрецизійна модель Bonsai 27B важить 54,7 ГБ. Завдяки квантуванню моделі до однобітного представлення, PrismML зменшила її розмір до 3,9 ГБ — тобто у 14 разів. Така компресія дозволяє технічно зберігати модель на флагманських iPhone, що раніше було неможливо для об'єктів розміром понад кілька сотень мегабайтів.
Як модель працює на обладнанні Apple
PrismML розробила модель для стека MLX від Apple — набору API, які дозволяють розробникам запускати нейромережі безпосередньо на Neural Engine. Під час власних тестів модель генерувала приблизно 11 токенів на секунду на iPhone 17 Pro Max. У 15 стандартних бенчмарках для мовних моделей 1-бітна версія зберегла 89,5% показників якості оригінальної моделі, що свідчить про те, що стиснення не позбавило її корисності.
Практичні обмеження, з якими ви зіткнетеся
- Навантаження на пам'ять — файл розміром 3,9 ГБ вміщується, але моделі також потрібен кеш пар ключ-значення (KV cache) для зберігання нещодавнього контексту. Цей кеш зростає разом із довжиною розмови та може підвищити використання оперативної пам'яті (RAM) телефону, що потенційно сповільнюватиме швидкість.
- Нагрівання та акумулятор — запуск мережі з 27 мільярдами параметрів створює велике навантаження на Neural Engine. Телефони мають тенденцію нагріватися при тривалому навантаженні, а система терморегуляції Apple буде знижувати продуктивність (throttling) для захисту обладнання. PrismML не оприлюднила конкретних цифр щодо розряду батареї, тому реальна вартість використання при щоденному режимі залишається невідомою.
- Специфіка пристроїв — заявлена продуктивність стосується лише останнього iPhone 17 Pro Max. Старіші iPhone, пристрої на iOS нижчого класу або Android-смартфони не мають таких можливостей Neural Engine, тому вони матимуть повільніший вивід (inference) або модель на них взагалі не поміститься.
Хто отримає вигоду, а хто залишиться позаду
Розробники застосунків, орієнтованих на конфіденційність, тепер можуть розміщувати велику мовну модель безпосередньо на пристрої, зберігаючи дані користувача в телефоні. Це може означати більш чутливих голосових помічників, офлайн-переклад або контекстну генерацію тексту без хмарної підписки.
Виробники Android та користувачі смартфонів середнього класу залишаються поза увагою. Модель покладається на пропрієтарний стек Apple, тому таке ж стиснення не працюватиме автоматично в інших екосистемах.
Що ще належить протестувати
Показники PrismML отримані в результаті внутрішніх бенчмарків. Незалежним тестувальникам необхідно перевірити швидкість генерації токенів на секунду під час тривалих сесій, виміряти фактичне споживання заряду акумулятора та оцінити, як швидко знижується продуктивність у міру розширення KV cache. Реальне використання — наприклад, годинне спілкування в чаті, стрімінг контенту або запуск моделі паралельно з іншими застосунками — покаже, чи відповідає показник у 11 токенів на секунду умовам поза контрольованою лабораторією.
Підсумок
Bonsai 27B демонструє, що мовні моделі з 27 мільярдами параметрів можна стиснути настільки, щоб вони могли працювати на флагманському iPhone, забезпечуючи майже повну якість при помірній швидкості. Цей прорив тримається на стеку MLX від Apple і все ще стикається з практичними перешкодами: навантаженням на пам'ять, термічним тротлінгом та невідомим впливом на акумулятор. Якщо подальші тести підтвердять ці заяви, локальний ШІ може перейти від нішевих демо-версій до повсякденних застосунків — за умови, що апаратний розрив між флагманами iOS та рештою ринку скоротиться.
