Prism ML heeft Bonsai 27B uitgebracht, een versie van het Qwen 3.6 large-language model die op een mobiele telefoon past. Door het origineel van 54 GB te verkleinen tot minder dan 4 GB met 1-bit kwantisatie, levert het bedrijf een 14× groottevermindering en stelt het gebruikers in staat het model lokaal te draaien, zonder cloud API-aanroepen.
Waarom compressie belangrijk is
LLM's hebben meestal een GPU van desktopklasse of een betaalde API nodig omdat hun gewichten tientallen gigabytes in beslag nemen. Kwantisatie — het gebruik van minder bits per gewicht — verkleint het model, maar kan ook kennis wegnemen. Bonsai biedt twee extremen: een ternaire variant (drie mogelijke gewichtswaarden, 7,2 GB) en een agressieve 1-bit variant (3,9 GB). De afweging tussen grootte en capaciteit vormt de basis van de test.
Hoe de modellen presteren op het gebied van feitelijke kennis
Het originele Qwen 3.6 beantwoordde elke vraag over historische data correct in de testsuite van de tester. De ternaire Bonsai miste er vijf van de zes, en de 1-bit versie faalde bij elke enkele datumvraag. Zoals verwacht, gooit agressieve compressie eerst zeldzame, specifieke feiten weg, waarbij alleen de brede taalpatronen die de vloeiendheid bepalen, behouden blijven.
Programmeerprestaties vertellen een ander verhaal
Toen de prompts overgingen op programmeertaken, draaiden de resultaten om. Alle drie de modellen losten klassieke concurrency-bugs zonder fouten op. Bij een veeleisende React-animatie-uitdaging voltooide de 1-bit Bonsai de taak in twee pogingen, terwijl het origineel er vier nodig had omdat het extra tijd besteedde aan het parsen van de code. De ternaire versie had tien pogingen nodig en liet uiteindelijk de testserver crashen.
Praktische hindernissen
Bonsai draait niet op de populaire Ollama-runtime. Het 1-bit model heeft een aangepaste executielaag nodig die door Prism ML wordt geleverd, dus gebruikers moeten niet-standaard software installeren om het werkend te krijgen. Deze afhankelijkheid beperkt de aantrekkingskracht van het model tot gebruikers die het prettig vinden om hun omgeving aan te passen.
Wie moet Bonsai overwegen, en wie moet het beter laten
- Algemene chat – Het drastische verlies aan feitelijke details maakt Bonsai ongeschikt als kennisbank-assistent. Voor nauwkeurige antwoorden over geschiedenis, wetenschap of actuele gebeurtenissen kun je beter het originele model of een cloud API gebruiken.
- Lokale programmeerhulp – Ontwikkelaars die een offline tool willen die code kan suggereren, bugs kan opsporen en kan draaien op een telefoon of een laptop met lage specificaties, zullen merken dat de 1-bit versie snelheid en lage opslagkosten biedt. Het is geen autonome agent, maar het verwerkt logica en syntaxis efficiënt.
Conclusie
Bonsai 27B laat zien dat je een LLM van 54 GB kunt comprimeren tot een telefoonvriendelijke 3,9 GB en nog steeds verrassend snelle, competente codesuggesties krijgt. De prijs is een bijna totale erosie van specifieke feitelijke kennis, dus het model is vooral geschikt voor de gereedschapskist van ontwikkelaars die offline snelheid belangrijker vinden dan encyclopedische kennis.
