Model Mixture-of-Experts o 150 miliardach parametrów może generować tekst na standardowym laptopie programisty. Eksperyment pokazuje, że to pamięć RAM, a nie prędkość dysku SSD, jest rzeczywistym ograniczeniem wydajności. Ma to znaczenie, ponieważ dowodzi, że modele klasy frontier można testować lokalnie, nie wydając pieniędzy na moc obliczeniową w chmurze.

Test

Uruchomiliśmy model DeepSeek V4 Flash — model MoE o 150 miliardach parametrów poddany przycinaniu (pruning) metodą REAP — za pomocą otwartoźródłowego silnika wnioskowania Colibrì. Sprzętem był laptop AMD Ryzen AI 9 365 z 61 GB pamięci RAM i dyskiem NVMe SSD o pojemności 1 TB. Odmierzyliśmy czas trzyminutowego procesu generowania i zarejestrowaliśmy każdy dostęp do dysku.

Co mówią liczby

  • Aktywność dysku była minimalna. Podczas trzyminutowego generowania dysk SSD wykonywał odczyty przez mniej niż 11 sekund. Nawet gdyby napęd mógł odczytywać dane natychmiast, całkowita przepustowość wzrosłaby jedynie o około 6 procent.
  • Rozmiar pamięci RAM bezpośrednio wpływał na prędkość. Zmniejszenie pamięci cache RAM o połowę obniżyło przepustowość o około 15 procent. Procesor spędzał prawie tyle samo czasu na obsłudze błędów pamięci podręcznej (cache misses) — dekwantyzacji, kopiowaniu i zarządzaniu danymi — co na oczekiwaniu na dysk.

Te dane obalają powszechne przekonanie, że przepustowość pamięci masowej jest głównym wąskim gardłem podczas wnioskowania dużych modeli na laptopie.

Dlaczego RAM wygrywa z SSD

Gdy parametr modelu nie znajduje się już w pamięci RAM, system musi:

  1. Pobrać dane z dysku SSD.
  2. Zdekodować je i przenieść do rejestrów procesora w celu wykonania obliczeń.

Oba kroki zużywają cykle procesora. Pierwszy krok jest ograniczony przepustowością dysku SSD; drugi dodaje mniej więcej tyle samo opóźnienia, ponieważ procesor musi dokonać dekwantyzacji danych niezależnie od tego, jak szybko do niego dotrą. Szybszy dysk SSD przynosi zatem malejące korzyści, podczas gdy większa ilość pamięci RAM pozwala na pozostawienie większej części modelu w pamięci i eliminuje kosztowny cykl przesyłu danych.

Implikacje dla programistów

  • Inwestuj w pamięć, a nie w pamięć masową.
  • Lokalne testowanie staje się możliwe. Programiści mogą uruchamiać modele MoE o otwartych wagach na istniejącym sprzęcie, sprawdzając styl, zachowanie przy wywoływaniu narzędzi (tool-calling) oraz jakość wyjścia bez konieczności płacenia za kredyty w chmurze.
  • Ewaluacja wsadowa jest realistyczna. Czat w czasie rzeczywistym może wciąż sprawiać wrażenie powolnego, ale zadania kolejkowane — takie jak generowanie dziesiątek promptów do celów badawczych — działają komfortowo na laptopie.

Potencjalny kontrargument

Niektórzy mogą argumentować, że opóźnienia dysku SSD wciąż mają znaczenie w przypadku obciążeń, które wielokrotnie ładują nowe wagi ekspertów.

Na co warto zwrócić uwagę w przyszłości

  • Warianty modeli zoptymalizowane pod kątem zużycia pamięci.
  • Sprzęt z większymi pamięciami cache wewnątrz układów.
  • Strategie buforowania na poziomie oprogramowania.

Wniosek jest jasny: programiści, którzy chcą eksperymentować z ogromnymi modelami MoE na laptopie, powinni dokupić więcej pamięci RAM. Modernizacja dysku SSD skraca czas pracy jedynie o kilka procent, podczas gdy dodatkowa pamięć może skrócić czas wnioskowania o kilkanaście procent. Zmienia to kalkulację kosztów prototypowania AI i otwiera drzwi do lokalnego, bezpłatnego testowania modeli, które wcześniej uważano za wymagające dedykowanych klastrów w chmurze.