A Prism ML lançou o Bonsai 27B, uma versão do modelo de linguagem de grande escala Qwen 3.6 que cabe em um celular. Ao comprimir o original de 54 GB para menos de 4 GB com quantização de 1 bit, a empresa entrega uma redução de tamanho de 14x e permite que os usuários executem o modelo localmente, sem chamadas de API na nuvem.
Por que a compressão é importante
LLMs geralmente precisam de uma GPU de classe desktop ou de uma API paga porque seus pesos ocupam dezenas de gigabytes. A quantização — o uso de menos bits por peso — reduz o modelo, mas também pode remover conhecimento. O Bonsai oferece dois extremos: uma variante ternária (três valores de peso possíveis, 7,2 GB) e uma variante agressiva de 1 bit (3,9 GB). O equilíbrio entre tamanho e capacidade é o que move este teste.
Como os modelos se saem na recuperação de fatos
O Qwen 3.6 original respondeu corretamente a todas as perguntas sobre datas históricas no conjunto de testes. O Bonsai ternário errou cinco de seis, e a versão de 1 bit falhou em todas as consultas de datas. Como esperado, a compressão agressiva descarta primeiro fatos raros e específicos, preservando apenas os padrões de linguagem amplos que impulsionam a fluência.
O desempenho em codificação conta uma história diferente
Quando os prompts mudaram para tarefas de codificação, os resultados se inverteram. Todos os três modelos resolveram bugs clássicos de concorrência sem erro. Em um desafio exigente de animação React, o Bonsai de 1 bit terminou em duas tentativas, enquanto o original precisou de quatro porque gastou tempo extra analisando o código. A versão ternária exigiu dez tentativas e acabou travando o servidor de testes.
Obstáculos práticos
O Bonsai não roda no popular runtime Ollama. O modelo de 1 bit precisa de uma camada de execução personalizada fornecida pela Prism ML, portanto, os usuários devem instalar softwares não padronizados para fazê-lo funcionar. Essa dependência limita o apelo do modelo àqueles que se sentem confortáveis em ajustar seu próprio ambiente.
Quem deve considerar o Bonsai e quem deve ficar longe
- Chat de uso geral – A perda drástica de detalhes factuais torna o Bonsai inadequado como um assistente de base de conhecimento. Para respostas precisas sobre história, ciência ou eventos atuais, atenha-se ao modelo original ou a uma API na nuvem.
- Auxiliar de codificação local – Desenvolvedores que desejam uma ferramenta offline capaz de sugerir código, detectar bugs e rodar em um celular ou notebook de baixo desempenho descobrirão que a versão de 1 bit oferece velocidade e baixo custo de armazenamento. Não é um agente autônomo, mas lida com lógica e sintaxe de forma eficiente.
Resumo final
O Bonsai 27B mostra que é possível comprimir um LLM de 54 GB para 3,9 GB compatíveis com celulares e ainda obter sugestões de código surpreendentemente rápidas e competentes. O preço é uma erosão quase total da recuperação de fatos específicos, portanto, o modelo pertence à caixa de ferramentas de desenvolvedores que valorizam a velocidade offline em vez do conhecimento enciclopédico.
