Prism ML выпустила Bonsai 27B — версию большой языковой модели Qwen 3.6, которая помещается в мобильный телефон. Сжимая оригинальную модель объемом 54 ГБ до менее чем 4 ГБ с помощью 1-битного квантования, компания добивается уменьшения размера в 14 раз и позволяет пользователям запускать модель локально, без вызовов облачного API.

Почему сжатие имеет значение

LLM обычно требуют GPU настольного класса или платного API, так как их веса занимают десятки гигабайт. Квантование — использование меньшего количества бит на вес — уменьшает модель, но также может привести к потере знаний. Bonsai предлагает два экстремальных варианта: тернарный (три возможных значения веса, 7,2 ГБ) и агрессивный 1-битный (3,9 ГБ). Компромисс между размером и возможностями является основой данного теста.

Как модели справляются с воспроизведением фактов

Оригинальная Qwen 3.6 правильно ответила на каждый вопрос об исторических датах в тестовом наборе. Тернарная Bonsai пропустила пять из шести, а 1-битная версия не справилась ни с одним запросом о датах. Как и ожидалось, агрессивное сжатие в первую очередь отбрасывает редкие, специфические факты, сохраняя лишь широкие языковые паттерны, обеспечивающие беглость речи.

Производительность в кодинге говорит о другом

Когда промпты переключились на задачи по программированию, результаты изменились на противоположные. Все три модели без ошибок решили классические задачи на ошибки параллелизма. В сложной задаче по анимации в React 1-битная Bonsai справилась за две попытки, в то время как оригинальной потребовалось четыре, так как она тратила дополнительное время на парсинг кода. Тернарной версии потребовалось десять попыток, и в итоге она обрушила тестовый сервер.

Практические препятствия

Bonsai не работает в популярной среде выполнения Ollama. 1-битной модели требуется кастомный слой исполнения, предоставляемый Prism ML, поэтому пользователям необходимо устанавливать нестандартное программное обеспечение для ее работы. Эта зависимость ограничивает привлекательность модели для тех, кто не готов заниматься настройкой своего окружения.

Кому стоит рассмотреть Bonsai, а кому лучше держаться подальше

  • Универсальный чат — Из-за резкой потери фактических деталей Bonsai не подходит на роль ассистента базы знаний. Для точных ответов по истории, науке или текущим событиям лучше использовать оригинальную модель или облачное API.
  • Локальный помощник по кодингу — Разработчики, которым нужен офлайн-инструмент, способный предлагать код, находить ошибки и работать на телефоне или бюджетном ноутбуке, обнаружат, что 1-битная версия обеспечивает скорость и низкие требования к памяти. Это не автономный агент, но она эффективно справляется с логикой и синтаксисом.

Итог

Bonsai 27B показывает, что можно сжать LLM объемом 54 ГБ до удобных для смартфона 3,9 ГБ и при этом получать удивительно быстрые и компетентные предложения по коду. Ценой становится почти полная утрата способности воспроизводить конкретные факты, поэтому модель предназначена для инструментария разработчиков, которые ценят офлайн-скорость выше энциклопедических знаний.