Prism ML wprowadziło Bonsai 27B, wersję dużego modelu językowego Qwen 3.6, która mieści się w telefonie komórkowym. Dzięki zmniejszeniu oryginalnego modelu o rozmiarze 54 GB do niespełna 4 GB za pomocą kwantyzacji 1-bitowej, firma osiągnęła 14-krotną redukcję rozmiaru, umożliwiając użytkownikom lokalne uruchamianie modelu bez konieczności korzystania z chmurowych zapytań API.

Dlaczego kompresja ma znaczenie

Modele LLM zazwyczaj wymagają procesora graficznego klasy desktopowej lub płatnego API, ponieważ ich wagi zajmują dziesiątki gigabajtów. Kwantyzacja – polegająca na użyciu mniejszej liczby bitów na wagę – zmniejsza model, ale może również prowadzić do utraty wiedzy. Bonsai oferuje dwa skrajne rozwiązania: wariant trójstanowy (trzy możliwe wartości wag, ok. 7,2 GB) oraz agresywny wariant 1-bitowy (ok. 3,9 GB). Test ma na celu sprawdzenie kompromisu między rozmiarem a możliwościami modelu.

Jak modele radzą sobie z przywoływaniem faktów

Oryginalny model Qwen 3.6 poprawnie odpowiedział na każde pytanie dotyczące dat historycznych w zestawie testowym. Trójstanowy Bonsai pomylił się w pięciu na sześć pytań, a wersja 1-bitowa nie odpowiedziała poprawnie na żadne zapytanie dotyczące dat. Zgodnie z oczekiwaniami, agresywna kompresja w pierwszej kolejności odrzuca rzadkie, specyficzne fakty, zachowując jedynie ogólne wzorce językowe, które odpowiadają za płynność wypowiedzi.

Wydajność w programowaniu pokazuje coś innego

Gdy prompty zmieniły się na zadania programistyczne, wyniki uległy odwróceniu. Wszystkie trzy modele bezbłędnie rozwiązały klasyczne błędy współbieżności. W wymagającym zadaniu dotyczącym animacji w React, 1-bitowy Bonsai poradził sobie w dwóch próbach, podczas gdy oryginał potrzebował czterech, ponieważ poświęcił dodatkowy czas na parsowanie kodu. Wersja trójstanowa wymagała dziesięciu prób i ostatecznie doprowadziła do awarii serwera testowego.

Praktyczne przeszkody

Bonsai nie działa na popularnym środowisku uruchomieniowym Ollama. Model 1-bitowy wymaga dedykowanej warstwy wykonawczej dostarczanej przez Prism ML, co oznacza, że użytkownicy muszą zainstalować niestandardowe oprogramowanie, aby go uruchomić. Ta zależność ogranicza atrakcyjność modelu do osób, które nie mają problemu z samodzielną konfiguracją środowiska.

Dla kogo Bonsai jest rozwiązaniem, a kto powinien go unikać

  • Czat ogólnego przeznaczenia – Drastyczna utrata szczegółów faktograficznych sprawia, że Bonsai nie nadaje się na asystenta bazy wiedzy. W celu uzyskania dokładnych odpowiedzi z zakresu historii, nauki czy bieżących wydarzeń, lepiej pozostać przy oryginalnym modelu lub API w chmurze.
  • Lokalny pomocnik programowania – Programiści szukający narzędzia offline, które może sugerować kod, wyłapywać błędy i działać na telefonie lub słabym laptopie, uznają, że wersja 1-bitowa zapewnia szybkość i niskie wymagania co do miejsca na dysku. Nie jest to autonomiczny agent, ale sprawnie radzi sobie z logiką i składnią.

Podsumowanie

Bonsai 27B pokazuje, że można skompresować model LLM o rozmiarze 54 GB do przyjaznych dla telefonu 3,9 GB i wciąż otrzymywać zaskakująco szybkie, kompetentne sugestie kodu. Ceną jest niemal całkowita utrata zdolności przywoływania konkretnych faktów, więc model ten znajdzie zastosowanie w narzędziowni programistów, którzy cenią szybkość działania offline bardziej niż wiedzę encyklopedyczną.