Prism ML ha rilasciato Bonsai 27B, una versione del modello linguistico di grandi dimensioni Qwen 3.6 che può essere eseguita su uno smartphone. Riducendo l'originale da 54 GB a meno di 4 GB tramite la quantizzazione a 1 bit, l'azienda ottiene una riduzione dimensionale di 14 volte e consente agli utenti di eseguire il modello localmente, senza chiamate API al cloud.
Perché la compressione è importante
Gli LLM solitamente richiedono una GPU di classe desktop o un'API a pagamento perché i loro pesi occupano decine di gigabyte. La quantizzazione — l'uso di meno bit per ogni peso — riduce le dimensioni del modello, ma può anche compromettere la conoscenza. Bonsai offre due estremi: una variante ternaria (tre possibili valori di peso, 7,2 GB) e una variante aggressiva a 1 bit (3,9 GB). Il compromesso tra dimensioni e capacità è il fulcro del test.
Come si comportano i modelli nel richiamo dei fatti
L'originale Qwen 3.6 ha risposto correttamente a ogni domanda sulle date storiche nella suite del tester. Il Bonsai ternario ne ha sbagliate cinque su sei, e la versione a 1 bit ha fallito ogni singola interrogazione sulle date. Come previsto, la compressione aggressiva scarta per prima le informazioni rare e specifiche, preservando solo i modelli linguistici generali che garantiscono la fluidità.
Le prestazioni di coding raccontano una storia diversa
Quando i prompt sono passati a compiti di coding, i risultati si sono invertiti. Tutti e tre i modelli hanno risolto bug di concorrenza classici senza errori. In una impegnativa sfida di animazione React, il Bonsai a 1 bit ha terminato in due tentativi, mentre l'originale ne ha richiesti quattro perché ha impiegato tempo extra per analizzare il codice. La versione ternaria ha richiesto dieci tentativi e alla fine ha causato il crash del server di test.
Ostacoli pratici
Bonsai non funziona sul popolare runtime Ollama. Il modello a 1 bit necessita di uno strato di esecuzione personalizzato fornito da Prism ML, quindi gli utenti devono installare software non standard per farlo funzionare. Questa dipendenza limita l'attrattiva del modello a chi ha dimestichezza con la configurazione del proprio ambiente.
Chi dovrebbe considerare Bonsai e chi dovrebbe evitarlo
- Chat generica – La drastica perdita di dettagli fattuali rende Bonsai inadatto come assistente basato su una base di conoscenza. Per risposte accurate su storia, scienza o attualità, è meglio affidarsi al modello originale o a un'API cloud.
- Aiuto alla programmazione locale – Gli sviluppatori che desiderano uno strumento offline in grado di suggerire codice, individuare bug e funzionare su uno smartphone o un laptop di fascia bassa troveranno che la versione a 1 bit offre velocità e bassi costi di archiviazione. Non è un agente autonomo, ma gestisce logica e sintassi in modo efficiente.
In sintesi
Bonsai 27B dimostra che è possibile comprimere un LLM da 54 GB in soli 3,9 GB adatti a uno smartphone, ottenendo comunque suggerimenti di codice sorprendentemente veloci e competenti. Il prezzo da pagare è una quasi totale erosione del richiamo fattuale specifico, quindi il modello è destinato alla cassetta degli attrezzi di quegli sviluppatori che danno priorità alla velocità offline rispetto alla conoscenza enciclopedica.
