Een Mixture-of-Experts-model met 150 miljard parameters kan tekst genereren op een standaard laptop voor ontwikkelaars. Het experiment laat zien dat RAM, en niet de SSD-snelheid, de werkelijke beperkende factor voor de prestaties is. Dit is belangrijk omdat het bewijst dat frontier-scale modellen lokaal getest kunnen worden zonder uit te geven aan cloud-computing.

De Test

We hebben het DeepSeek V4 Flash-model — een met REAP geprunede 150 B-parameter MoE — door de open-source Colibrì inference engine gehaald. De hardware was een AMD Ryzen AI 9 365 laptop met 61 GB RAM en een 1 TB NVMe SSD. We hebben een generatieproces van drie minuten getimed en elke schijftoegang gelogd.

Wat de cijfers onthullen

  • Schijfactiviteit was minimaal. De SSD voerde tijdens de drieminuten durende generatie minder dan 11 seconden aan leesacties uit. Zelfs als de schijf gegevens onmiddellijk zou kunnen lezen, zou de totale doorvoersnelheid slechts met ongeveer 6 procent verbeteren.
  • De grootte van het RAM-geheugen had directe impact op de snelheid. Het halveren van de RAM-cache verlaagde de doorvoersnelheid met ongeveer 15 procent. De CPU besteedde bijna evenveel tijd aan het afhandelen van cache misses — de-quantiseren, kopiëren en beheren van gegevens — als aan het wachten op de schijf.

Deze cijfers weerleggen de algemene overtuiging dat de bandbreedte van de opslag de belangrijkste flessenhals is voor de inferentie van grote modellen op een laptop.

Waarom RAM beter is dan SSD

Wanneer een modelparameter nog niet in het RAM-geheugen aanwezig is, moet het systeem:

  1. Gegevens van de SSD ophalen.
  2. Deze decoderen en