PrismMLs neues Bonsai 27B 1-Bit-Modell passt in eine 3,9 GB große Datei und läuft auf einem iPhone 17 Pro Max mit etwa 11 Token pro Sekunde – ein Beweis dafür, dass ein Sprachmodell mit 27 Milliarden Parametern auf einem Consumer-Smartphone laufen kann. Diese Behauptung ist wichtig, da sie die Grenzen der On-Device-KI verschiebt und reichhaltigere Offline-Assistenten verspricht, ohne Daten in die Cloud senden zu müssen.

Warum die Reduzierung wichtig ist

Das Modell Bonsai 27B in voller Präzision wiegt 54,7 GB. Durch die Quantisierung des Modells auf eine 1-Bit-Darstellung schrumpfte PrismML es auf 3,9 GB – eine 14-fache Verkleinerung der Größe. Diese Kompression macht das Modell technisch auf High-End-iPhones speicherbar, eine Schwelle, die zuvor alles über ein paar hundert Megabyte ausschloss.

Wie das Modell auf Apple-Hardware performt

PrismML hat das Modell für Apples MLX-Stack entwickelt, eine Sammlung von APIs, die es Entwicklern ermöglichen, neuronale Netze direkt auf der Neural Engine auszuführen. In eigenen Tests generierte das Modell auf einem iPhone 17 Pro Max etwa 11 Token pro Sekunde. In 15 Standard-Benchmarks für Sprachmodelle behielt die 1-Bit-Version 89,5 % der Qualitätswerte des Originalmodells bei, was darauf hindeutet, dass die Kompression die Nützlichkeit nicht beeinträchtigt hat.

Praktische Grenzen, auf die Sie stoßen werden

  • Speicherbelastung – Die 3,9 GB große Datei passt zwar, aber das Modell benötigt auch einen Key-Value (KV)-Cache, um den aktuellen Kontext zu speichern. Dieser Cache wächst mit der Länge einer Konversation und kann die RAM-Auslastung des Telefons erhöhen, was potenziell die Geschwindigkeit drosselt.
  • Hitze und Akku – Das Ausführen eines Netzwerks mit 27 Milliarden Parametern beansprucht die Neural Engine stark. Smartphones neigen unter dauerhafter Last dazu, heiß zu werden, und das Thermal Management von Apple wird die Leistung drosseln, um die Hardware zu schützen. PrismML hat keine konkreten Zahlen zum Akkuverbrauch veröffentlicht, sodass die realen Auswirkungen auf ein ganztägiges Nutzungsmuster noch unbekannt sind.
  • Gerätespezifität – Die Leistungsangaben beziehen sich auf das neueste iPhone 17 Pro Max. Ältere iPhones, iOS-Geräte der unteren Leistungsklassen oder Android-Smartphones verfügen nicht über die gleichen Fähigkeiten der Neural Engine und werden eine langsamere Inferenz erleben oder das Modell möglicherweise gar nicht erst ausführen können.

Wer profitiert und wer könnte auf der Strecke bleiben

Entwickler von datenschutzorientierten Apps können nun ein großes Sprachmodell direkt auf dem Gerät hosten und so die Nutzerdaten auf dem Telefon belassen. Das könnte reaktionsschnellere Sprachassistenten, Offline-Übersetzungen oder kontextbezogene Texterstellung ohne Cloud-Abonnement bedeuten.

Android-Hersteller und Nutzer von Mittelklasse-Smartphones gehen leer aus. Das Modell basiert auf Apples proprietärem Stack, sodass dieselbe Kompression nicht automatisch in anderen Ökosystemen funktioniert.

Was noch getestet werden muss

Die Zahlen von PrismML stammen aus internen Benchmarks. Unabhängige Tester müssen die Token-pro-Sekunde-Raten über längere Sitzungen hinweg verifizieren, den tatsächlichen Akkuverbrauch messen und bewerten, wie schnell die Leistung abnimmt, wenn der KV-Cache expandiert. Die Nutzung in der Praxis – etwa eine Stunde lang chatten, Inhalte streamen oder das Modell neben anderen Apps ausführen – wird zeigen, ob der Wert von 11 Token pro Sekunde außerhalb eines kontrollierten Labors standhält.

Fazit

Bonsai 27B zeigt, dass Sprachmodelle mit 27 Milliarden Parametern so stark komprimiert werden können, dass sie auf einem Flaggschiff-iPhone laufen und dabei nahezu volle Qualität bei moderater Geschwindigkeit liefern. Der Durchbruch hängt vom MLX-Stack von Apple ab und steht noch vor praktischen Hürden: Speicherbedarf, thermische Drosselung und unbekannte Auswirkungen auf den Akku. Wenn Folgetests die Behauptungen bestätigen, könnte On-Device-KI von Nischen-Demos zu Alltags-Apps übergehen – vorausgesetzt, die Hardware-Lücke zwischen iOS-Flaggschiffen und dem Rest des Marktes verringert sich.