POCKET-35B, een taalmodel met 35 miljard parameters uitgebracht door VIDRAFT, kan nu worden uitgevoerd op een laptop die alleen een CPU heeft. De in GGUF-formaat opgeslagen gewichten van het model worden direct geladen in llama.cpp of Ollama, waardoor teams met een nulbudget voor GPU's direct kunnen beginnen met experimenteren. Binnen zeven weken na de lancering bereikte het model een miljoen downloads op Hugging Face en staat het op de 13e plaats van alle GGUF-downloads wereldwijd.

Waarom een LLM die alleen op een CPU draait nu belangrijk is

Bedrijven die eigen tekstbestanden — zoals klant-e-mails, interne tickets en codefragmenten — on-premises moeten houden, hebben vaak niet de middelen voor dedicated grafische kaarten. Tot voor kort was de enige praktische optie om gegevens naar een in de cloud gehoste API te sturen, waarbij privacy werd opgeofferd en er terugkerende kosten ontstonden. POCKET-35B biedt een middenweg: een model dat groot genoeg is om complexe prompts te verwerken, terwijl het binnen de geheugenlimieten van een typische kantoorlaptop of mini-PC past.

Hoe het model op een laptop past

  • GGUF-formaat – een binaire container die gekwantiseerde gewichten opslaat.
  • Compatibiliteit – zowel llama.cpp als Ollama bevatten runtimes die GGUF-bestanden kunnen lezen en inferentie op CPU's kunnen uitvoeren. Een geïntegreerde GPU kan worden gebruikt om enkele lagen te verplaatsen (offload), maar dit is niet verplicht.
  • RAM-controle – de grootte van het GGUF-bestand is de minimale hoeveelheid RAM die je nodig hebt. Als het bestand bijvoorbeeld enkele gigabytes groot is, is een machine met minstens die hoeveelheid vrij geheugen vereist nog voordat de download begint.

Stappen om POCKET-35B op je laptop te laten draaien

  1. Controleer het geheugen – open de taakbeheer van je systeem, noteer het totale RAM-geheugen en vergelijk dit met de grootte van het GGUF-bestand op de Hugging Face-pagina.
  2. Kies de juiste kwantisatie – begin met de Q4-versie; deze biedt voor de meeste laptops een goede balans tussen grootte en snelheid.
  3. Download via llama.cpp of Ollama – beide tools kunnen het model rechtstreeks van Hugging Face ophalen en verzorgen automatisch de controle van de checksum.
  4. Voer een snelle controle uit – start de runtime met een eenvoudige "Hello, world"-prompt om te bevestigen dat het laden is geslaagd.
  5. Maak een realistische benchmark-suite – verzamel 30-50 taken die je productie-werkbelasting weerspiegelen (bijv. het classificeren van ticketcategorieën of het opstellen van e-mailantwoorden). Draai deze door het model en noteer de latentie en de kwaliteit van de token-output.
  6. Test de taaldekking – de documentatie van POCKET-35B bevat geen lijst met ondersteunde talen. Als je Vietnamees of andere niet-Engelse schriften nodig hebt, voer dan een paar zinnen met accenten in en kijk of het model coherente output genereert.
  7. Meet de werkelijke latentie – noteer de tijden per prompt op jouw specifieke hardware; vertrouw niet op benchmark-cijfers van andere gebruikers met andere CPU's of RAM-bandbreedte.

Wat de downloadcijfers je niet vertellen

Een miljoen downloads duidt op grote nieuwsgierigheid binnen de community, maar is geen garantie voor prestaties. Het redeneervermogen, de vaardigheid in het genereren van code en het opvolgen van instructies van het model zijn niet onafhankelijk gecontroleerd. VIDRAFT heeft de details van de architectuur of de bronnen van de trainingsdata niet vrijgegeven, wat een informatiegat achterlaat dat productie-implementatie riskant maakt.

Risico's en tegenargumenten

  • Onduidelijke kwaliteit – zonder gepubliceerde evaluatiemetrieken kun je er niet zeker van zijn of POCKET-35B de nauwkeurigheid van andere open-source alternatieven evenaart.
  • Onzekerheden voor productiegebruik – het gebrek aan architecturale transparantie maakt het moeilijker om het gedrag te voorspellen bij kwaadaardige (adversarial) prompts of randgevallen (edge-case inputs).

Conclusie

Als je team vandaag nog wil experimenteren met een LLM met 35 miljard parameters en geen GPU kan betalen, dan biedt POCKET-35B een haalbaar en goedkoop instappunt. Het model draait op een standaard laptop met behulp van het GGUF-formaat, en de open-source runtimes maken de installatie eenvoudig. Behandel het model echter als experimenteel: controleer de geheugenvereisten, voer benchmarks uit met echte taken en bevestig de taalondersteuning voordat je het integreert in een productieomgeving. Naarmate er meer gegevens van de community beschikbaar komen en VIDRAFT meer details vrijgeeft, zal het risicoprofiel duidelijker worden — maar voorlopig kan een enkele laptop inderdaad een 35B LLM hosten, zij het met gematigde verwachtingen.