Prism ML hat Bonsai 27B veröffentlicht, eine Version des Large Language Models Qwen 3.6, die auf ein Mobiltelefon passt. Durch die Komprimierung des 54 GB großen Originals auf unter 4 GB mittels 1-Bit-Quantisierung erreicht das Unternehmen eine 14-fache Größenreduzierung und ermöglicht es den Nutzern, das Modell lokal und ohne Cloud-API-Aufrufe auszuführen.

Warum die Komprimierung wichtig ist

LLMs benötigen normalerweise eine GPU der Desktop-Klasse oder eine kostenpflichtige API, da ihre Gewichte Dutzende von Gigabyte einnehmen. Quantisierung – die Verwendung weniger Bits pro Gewicht – verkleinert das Modell, kann aber auch Wissen entfernen. Bonsai bietet zwei Extreme: eine ternäre Variante (drei mögliche Gewichtswerte, 7,2 GB) und eine aggressive 1-Bit-Variante (3,9 GB). Der Kompromiss zwischen Größe und Leistungsfähigkeit ist der Kern dieses Tests.

Wie die Modelle beim Abruf von Fakten abschneiden

Das Original Qwen 3.6 beantwortete im Testpaket jede Frage zu historischen Daten korrekt. Die ternäre Bonsai-Version verfehlte fünf von sechs Fragen, und die 1-Bit-Version scheiterte an jeder einzelnen Datumsabfrage. Wie erwartet, verwirft eine aggressive Komprimierung zuerst seltene, spezifische Fakten und bewahrt nur die breiten Sprachmuster, die für die Flüssigkeit der Sprache sorgen.

Die Coding-Performance erzählt eine andere Geschichte

Als die Prompts zu Coding-Aufgaben wechselten, kehrte sich das Ergebnis um. Alle drei Modelle lösten klassische Concurrency-Bugs fehlerfrei. Bei einer anspruchsvollen React-Animationsaufgabe benötigte die 1-Bit-Bonsai-Version nur zwei Versuche, während das Original vier benötigte, da es zusätzliche Zeit für das Parsen des Codes aufwandte. Die ternäre Version brauchte zehn Versuche und brachte schließlich den Testserver zum Absturz.

Praktische Hürden

Bonsai läuft nicht auf der populären Ollama-Runtime. Das 1-Bit-Modell benötigt eine benutzerdefinierte Ausführungsschicht, die von Prism ML bereitgestellt wird, sodass Nutzer nicht-standardisierte Software installieren müssen, um es zum Laufen zu bringen. Diese Abhängigkeit schränkt die Attraktivität des Modells auf diejenigen ein, die gerne ihre Umgebung anpassen.

Wer Bonsai in Betracht ziehen sollte und wer lieber die Finger davon lässt

  • Allzweck-Chat – Der drastische Verlust an faktischer Detailtiefe macht Bonsai als Wissensdatenbank-Assistenten ungeeignet. Für präzise Antworten zu Geschichte, Wissenschaft oder aktuellen Ereignissen sollten Sie beim Originalmodell oder einer Cloud-API bleiben.
  • Lokaler Coding-Assistent – Entwickler, die ein Offline-Tool suchen, das Code vorschlagen, Bugs finden und auf einem Smartphone oder einem Low-End-Laptop laufen kann, werden feststellen, dass die 1-Bit-Version Geschwindigkeit und geringe Speicherkosten bietet. Es ist kein autonomer Agent, aber es bewältigt Logik und Syntax effizient.

Fazit

Bonsai 27B zeigt, dass man ein 54 GB großes LLM auf smartphone-freundliche 3,9 GB komprimieren kann und dennoch überraschend schnelle, kompetente Code-Vorschläge erhält. Der Preis dafür ist eine nahezu vollständige Erosion des spezifischen Faktenwissens, weshalb das Modell eher in den Werkzeugkasten von Entwicklern gehört, die Offline-Geschwindigkeit über enzyklopädisches Wissen stellen.