Het meest gedownloade model op Hugging Face is helemaal geen chatbot – het is een sentence-embedding model met 22 miljoen parameters uit 2021 dat 256 miljoen keer is gedownload. Die cijfers vertellen een eenvoudig verhaal: de meeste AI-workloads in de echte wereld draaien op kleine, CPU-vriendelijke modellen, niet op de sensationele large language models (LLMs).

De drie modellen die de productie domineren

all-MiniLM-L6-v2 – 256 miljoen downloads

Dit model met 22 miljoen parameters zet een stuk tekst om in een dense vector. De vector kan met andere worden vergeleken om gelijkenis te meten, wat de basis vormt voor semantische zoekopdrachten, aanbevelingsmotoren en pipelines voor het detecteren van duplicaten.

Waarom het overal is:

  • Draait op een CPU – geen dure GPU nodig.
  • Snel voor batchverwerking – kan miljoenen zinnen in enkele minuten embedden.
  • Gratis lokaal te hosten – elimineert kosten voor cloudservices en zorgen over gegevensprivacy.

cross-encoder/ms-marco-MiniLM-L6-v2 – 87 miljoen downloads

Dit model fungeert als een reranker. Het neemt een zoekopdracht en een kandidaat-document samen en geeft een relevantiescore terug. In een typische RAG-stack ziet de workflow er als volgt uit:

  1. Snelle fase – MiniLM haalt de top-50 kandidaten op.
  2. Nauwkeurige fase – het opnieuw scoren van die 50 items door de cross-encoder verbetert de kwaliteit van het antwoord.

Het lagere aantal "likes" op de modelpagina laat zien dat de meeste gebruikers het programmatisch aanroepen in plaats van de hub te doorzoeken, maar het downloadvolume bevestigt dat het de de-facto tool is voor het verhogen van de precisie in productie-pipelines.

amazon/chronos-2 – 35 miljoen downloads

Chronos-2 behandelt tijdreeksgegevens als tekst, waardoor een enkel foundation model verkoopcijfers, serverbelasting of elk ander numeriek signaal kan voorspellen zonder taakspecifieke training. Een aantal downloads in de tientallen miljoenen voor een gespecialiseerde voorspeller duidt op een grote behoefte aan "train once, run