Nowy, 1-bitowy model Bonsai 27B od PrismML mieści się w pliku o rozmiarze 3,9 GB i działa z prędkością około 11 tokenów na sekundę na iPhonie 17 Pro Max, co stanowi dowód na to, że model językowy o 27 miliardach parametrów może działać na konsumenckim smartfonie. To twierdzenie jest istotne, ponieważ przesuwa granice sztucznej inteligencji działającej bezpośrednio na urządzeniu (on-device AI), obiecując bardziej zaawansowanych asystentów offline bez konieczności przesyłania danych do chmury.
Dlaczego ta redukcja ma znaczenie
Pełnoprzecinkowy model Bonsai 27B waży 54,7 GB. Dzięki kwantyzacji modelu do 1-bitowej reprezentacji, PrismML zmniejszyło jego rozmiar do 3,9 GB – co oznacza 14-krotne ograniczenie wielkości. Taka kompresja sprawia, że model można technicznie przechowywać na wysokiej klasy iPhone'ach, co stanowi próg, który wcześniej wykluczał wszystko większe niż kilkaset megabajtów.
Jak model radzi sobie na sprzęcie Apple
PrismML zbudowało model z myślą o stosie MLX od Apple – zestawie API, które pozwalają programistom uruchamiać sieci neuronowe bezpośrednio na silniku neural engine. W przeprowadzonych testach model generował około 11 tokenów na sekundę na iPhonie 17 Pro Max. W 15 standardowych benchmarkach modeli językowych wersja 1-bitowa zachowała 89,5% wyników jakości oryginalnego modelu, co sugeruje, że kompresja nie pozbawiła go użyteczności.
Praktyczne ograniczenia, na które natrafisz
- Obciążenie pamięci – Plik o rozmiarze 3,9 GB mieści się w pamięci, ale model potrzebuje również pamięci podręcznej klucz-wartość (KV cache) do przechowywania niedawnego kontekstu. Pamięć ta rośnie wraz z długością rozmowy i może zwiększyć zużycie pamięci RAM telefonu, co potencjalnie spowolni działanie.
- Nagrzewanie i bateria – Uruchamianie sieci o 27 miliardach parametrów obciąża silnik neural engine. Telefony mają tendencję do nagrzewania się pod stałym obciążeniem, a system zarządzania temperaturą Apple będzie ograniczał wydajność (throttling), aby chronić sprzęt. PrismML nie opublikowało konkretnych danych dotyczących zużycia baterii, więc rzeczywisty koszt przy całodniowym użytkowaniu pozostaje nieznany.
- Specyfika urządzenia – Twierdzenie o wydajności dotyczy najnowszego iPhone'a 17 Pro Max. Starsze iPhone'y, urządzenia z niższych serii iOS lub telefony z Androidem nie posiadają takich samych możliwości silnika neural engine, co będzie skutkować wolniejszą inferencją lub brakiem możliwości uruchomienia modelu.
Kto zyska, a kto może zostać w tyle
Twórcy aplikacji stawiających na prywatność mogą teraz hostować duży model językowy bezpośrednio na urządzeniu, przechowując dane użytkownika w telefonie. Może to oznaczać bardziej responsywnych asystentów głosowych, tłumaczenie offline lub generowanie tekstu kontekstowego bez subskrypcji chmurowej.
Producenci Androida i użytkownicy telefonów ze średniej półki tracą na tym. Model opiera się na zastrzeżonym stosie technologicznym Apple, więc ta sama kompresja nie będzie automatycznie działać w innych ekosystemach.
Co wymaga jeszcze przetestowania
Dane PrismML pochodzą z wewnętrznych benchmarków. Niezależni testerzy muszą zweryfikować liczbę tokenów na sekundę podczas długich sesji, zmierzyć rzeczywiste zużycie baterii i ocenić, jak szybko spada wydajność wraz z rozszerzaniem się pamięci KV cache. Użytkowanie w rzeczywistych warunkach – godzina czatowania, strumieniowanie treści czy uruchamianie modelu obok innych aplikacji – pokaże, czy wartość 11 tokenów na sekundę utrzymuje się poza kontrolowanym laboratorium.
Podsumowanie
Bonsai 27B pokazuje, że modele językowe o 27 miliardach parametrów można skompresować na tyle, aby działały na flagowym iPhonie, oferując niemal pełną jakość przy umiarkowanej prędkości. Przełom ten zależy od stosu MLX od Apple i wciąż napotyka praktyczne przeszkody: narzut pamięci, throttling termiczny oraz nieznany wpływ na baterię. Jeśli kolejne testy potwierdzą te twierdzenia, AI działająca na urządzeniu może przejść z fazy niszowych demonstracji do codziennych aplikacji – pod warunkiem, że luka sprzętowa między flagowcami iOS a resztą rynku ulegnie zmniejszeniu.
