POCKET-35B, model językowy o 35 miliardach parametrów wydany przez VIDRAFT, może teraz działać na laptopie posiadającym jedynie procesor CPU. Wagi modelu w formacie GGUF ładują się bezpośrednio do llama.cpp lub Ollama, dzięki czemu zespoły bez budżetu na GPU mogą natychmiast rozpocząć eksperymenty. W ciągu siedmiu tygodni od premiery model przekroczył milion pobrań na Hugging Face, zajmując 13. miejsce wśród wszystkich pobrań GGUF na świecie.

Dlaczego model LLM działający wyłącznie na CPU jest teraz istotny

Przedsiębiorstwa, które muszą przechowywać poufne teksty — e-maile klientów, wewnętrzne zgłoszenia, fragmenty kodu — lokalnie (on-premises), często nie dysponują funduszami na dedykowane karty graficzne. Do niedawna jedyną praktyczną opcją było przesyłanie danych do API hostowanego w chmurze, co wiązało się z poświęceniem prywatności i ponoszeniem powtarzalnych kosztów. POCKET-35B obiecuje rozwiązanie pośrednie: model na tyle duży, by radzić sobie ze złożonymi promptami, a jednocześnie mieszczący się w limitach pamięci typowego biurowego laptopa lub mini-PC.

Jak model mieści się na laptopie

  • Format GGUF – binarny kontener przechowujący skwantyzowane wagi.
  • Kompatybilność – zarówno llama.cpp, jak i Ollama zawierają środowiska uruchomieniowe (runtimes), które odczytują pliki GGUF i wykonują wnioskowanie (inference) na procesorach CPU. Zintegrowany układ GPU może zostać użyty do odciążenia kilku warstw, ale nie jest to wymagane.
  • Weryfikacja RAM – rozmiar pliku GGUF to minimalna ilość pamięci RAM, której potrzebujesz. Jeśli rozmiar pliku wynosi np. kilka gigabajtów, maszyna musi posiadać co najmniej tyle wolnej pamięci jeszcze przed rozpoczęciem pobierania.

Kroki, aby uruchomić POCKET-35B na swoim laptopie

  1. Zweryfikuj pamięć – otwórz menedżer zadań systemu, sprawdź całkowitą ilość pamięci RAM i porównaj ją z rozmiarem pliku GGUF podanym na stronie Hugging Face.
  2. Wybierz odpowiednią kwantyzację – zacznij od wersji Q4; zapewnia ona najlepszy balans między rozmiarem a prędkością działania na większości laptopów.
  3. Pobierz przez llama.cpp lub Ollama – oba narzędzia mogą pobrać model bezpośrednio z Hugging Face, automatycznie obsługując weryfikację sum kontrolnych.
  4. Przeprowadź szybki test poprawności – uruchom środowisko za pomocą prostego promptu „Hello, world”, aby potwierdzić, czy ładowanie przebiegło pomyślnie.
  5. Stwórz realistyczny zestaw benchmarków – przygotuj 30–50 zadań odzwierciedlających Twoje rzeczywiste obciążenie produkcyjne (np. klasyfikowanie kategorii zgłoszeń, tworzenie szkiców odpowiedzi e-mail). Przepuść je przez model i zarejestruj opóźnienia (latency) oraz jakość generowanych tokenów.
  6. Przetestuj obsługę języków – dokumentacja POCKET-35B nie zawiera listy obsługiwanych języków. Jeśli potrzebujesz języka wietnamskiego lub innych skryptów nieangielskich, wprowadź kilka zdań z akcentami i sprawdź, czy model generuje spójne odpowiedzi.
  7. Zmierz rzeczywiste opóźnienia – zarejestruj czas odpowiedzi na pojedynczy prompt na swoim konkretnym sprzęcie; nie polegaj na wynikach benchmarków publikowanych przez innych użytkowników posiadających inne procesory lub inną przepustowość pamięci RAM.

Czego nie mówią liczby pobrań

Milion pobrań świadczy o dużym zainteresowaniu społeczności, a nie o gwarantowanej wydajności. Zdolność rozumowania modelu, umiejętność generowania kodu oraz podążanie za instrukcjami nie zostały poddane niezależnemu audytowi. VIDRAFT nie ujawnił szczegółów architektury modelu ani źródeł danych treningowych, co tworzy lukę informacyjną sprawiającą, że wdrożenie produkcyjne jest ryzykowne.

Ryzyka i kontrargumenty

  • Niepewna jakość – bez opublikowanych metryk ewaluacyjnych nie można mieć pewności, czy POCKET-35B dorównuje dokładnością innym alternatywom open-source.
  • Niepewność w zastosowaniach produkcyjnych – brak przejrzystości architektury utrudnia przewidzenie zachowania modelu w przypadku złośliwych promptów (adversarial prompts) lub nietypowych danych wejściowych (edge cases).

Podsumowanie

Jeśli Twój zespół chce dziś eksperymentować z modelem LLM o 35 mld parametrów, a nie może pozwolić sobie na GPU, POCKET-35B oferuje realną, niskokosztową drogę wejścia. Model działa na standardowym laptopie przy użyciu formatu GGUF, a środowiska open-source sprawiają, że konfiguracja jest prosta. Należy jednak traktować ten model jako eksperymentalny: zweryfikuj wymagania pamięciowe, przeprowadź benchmarki na realnych zadaniach i potwierdź obsługę języków przed zintegrowaniem go z jakimkolwiek procesem produkcyjnym. W miarę gromadzenia danych przez społeczność i udostępniania przez VIDRAFT kolejnych szczegółów, profil ryzyka stanie się jaśniejszy — ale na razie pojedynczy laptop rzeczywiście może obsłużyć model LLM o 35 mld parametrów, choć z zachowaniem rozsądnych oczekiwań.