Il nuovo modello a 1 bit Bonsai 27B di PrismML occupa un file da 3,9 GB e gira a circa 11 token al secondo su un iPhone 17 Pro Max, a dimostrazione del fatto che un modello linguistico da 27 miliardi di parametri può risiedere su uno smartphone di consumo. Questa affermazione è importante perché spinge i confini dell'IA on-device, promettendo assistenti offline più ricchi senza dover inviare dati al cloud.

Perché la riduzione è importante

Il modello Bonsai 27B a piena precisione pesa 54,7 GB. Quantizzando il modello in una rappresentazione a bit singolo, PrismML lo ha ridotto a 3,9 GB, ovvero una riduzione dimensionale di 14 volte. Tale compressione rende il modello tecnicamente memorizzabile sugli iPhone di fascia alta, una soglia che in precedenza escludeva qualsiasi cosa superiore a poche centinaia di megabyte.

Prestazioni del modello sull'hardware Apple

PrismML ha sviluppato il modello per lo stack MLX di Apple, l'insieme di API che consente agli sviluppatori di eseguire reti neurali direttamente sul neural engine. Nei propri test, il modello ha generato circa 11 token al secondo su un iPhone 17 Pro Max. In 15 benchmark standard per modelli linguistici, la versione a 1 bit ha mantenuto l'89,5% dei punteggi di qualità del modello originale, suggerendo che la compressione non ne ha compromesso l'utilità.

Limiti pratici che incontrerai

  • Pressione sulla memoria – Il file da 3,9 GB ci sta, ma il modello necessita anche di una cache key-value (KV) per memorizzare il contesto recente. Tale cache cresce con la lunghezza della conversazione e può aumentare l'uso della RAM del telefono, rischiando di rallentare la velocità.
  • Calore e batteria – L'esecuzione di una rete da 27 miliardi di parametri mette sotto sforzo il neural engine. I telefoni tendono a surriscaldarsi sotto carico prolungato e la gestione termica di Apple ridurrà le prestazioni per proteggere l'hardware. PrismML non ha rilasciato dati concreti sul consumo della batteria, quindi il costo reale in termini di utilizzo quotidiano rimane sconosciuto.
  • Specificità del dispositivo – L'affermazione sulle prestazioni si riferisce all'ultimo iPhone 17 Pro Max. Gli iPhone più vecchi, i dispositivi iOS di fascia inferiore o i telefoni Android non dispongono delle stesse capacità del neural engine e subiranno un'inferenza più lenta o potrebbero non essere in grado di ospitare affatto il modello.

Chi ne trarrà vantaggio e chi potrebbe restare escluso

Gli sviluppatori di app orientate alla privacy possono ora ospitare un modello linguistico di grandi dimensioni direttamente sul dispositivo, mantenendo i dati dell'utente sul telefono. Ciò potrebbe significare assistenti vocali più reattivi, traduzione offline o generazione di testo contestuale senza un abbonamento al cloud.

I produttori Android e gli utenti di telefoni di fascia media rimarranno esclusi. Il modello si basa sullo stack proprietario di Apple, quindi la stessa compressione non funzionerà automaticamente su altri ecosistemi.

Cosa resta da testare

I numeri di PrismML derivano da benchmark interni. Testatori indipendenti dovranno verificare i tassi di token al secondo durante sessioni prolungate, misurare il consumo effettivo della batteria e valutare la rapidità con cui le prestazioni degradano man mano che la cache KV si espande. L'uso nel mondo reale — chattare per un'ora, trasmettere contenuti o eseguire il modello insieme ad altre app — rivelerà se la cifra di 11 token al secondo regge al di fuori di un laboratorio controllato.

In sintesi

Bonsai 27B dimostra che i modelli linguistici da 27 miliardi di parametri possono essere compressi a sufficienza per risiedere su un iPhone di punta, offrendo una qualità quasi totale a una velocità modesta. La svolta dipende dallo stack MLX di Apple e deve ancora affrontare ostacoli pratici: sovraccarico di memoria, throttling termico e impatto scon