Найпопулярніша модель на Hugging Face — це зовсім не чат-бот, а модель sentence-embedding із 22 мільйонами параметрів, випущена у 2021 році, яку завантажили 256 мільйонів разів. Ці цифри свідчать про просту річ: більшість реальних робочих навантажень ШІ виконуються на крихітних, придатних для CPU моделях, а не на великих мовних моделях (LLM), які привертають увагу заголовків.

Три моделі, що домінують у продакшені

all-MiniLM-L6-v2 – 256 мільйонів завантажень

Ця модель із 22 млн параметрів перетворює фрагмент тексту на щільний вектор. Вектор можна порівнювати з іншими для вимірювання схожості, що є основою для семантичного пошуку, рекомендаційних систем та конвеєрів виявлення дублікатів.

Чому вона всюди:

  • Працює на CPU — дорогий GPU не потрібен.
  • Швидка для пакетної обробки — може створювати ембедінги для мільйонів речень за лічені хвилини.
  • Безкоштовне локальне розміщення — усуває витрати на хмарні сервіси та проблеми з конфіденційністю даних.

cross-encoder/ms-marco-MiniLM-L6-v2 – 87 мільйонів завантажень

Ця модель діє як реранкер. Вона приймає запит і потенційний документ разом і повертає оцінку релевантності. У типовому RAG-стеку робочий процес виглядає так:

  1. Швидкий етап — MiniLM відбирає 50 найкращих кандидатів.
  2. Точний етап — перерахунок оцінок (rescoring) цих 50 елементів за допомогою cross-encoder покращує якість відповіді.

Менша кількість «лайків» на сторінці моделі свідчить про те, що більшість користувачів викликають її програмно, а не переглядають хаб, проте обсяг завантажень підтверджує її статус фактичного інструменту для підвищення точності в робочих конвеєрах.

amazon/chronos-2 – 35 мільйонів завантажень

Chronos-2 сприймає дані часових рядів як текст, дозволяючи єдиній базовій моделі прогнозувати продажі, навантаження на сервер або будь-який числовий сигнал без спеціального навчання під конкретне завдання. Кількість завантажень у десятки мільйонів для спеціалізованого прогнозатора свідчить про великий попит на рішення за принципом «навчіть один раз, запускайте будь-де», особливо в організаціях, які інакше змушені були б підтримувати цілий «зоопарк» індивідуальних моделей для кожного показника.

Що ці цифри означають для ШІ-команд

Графіки завантажень виявляють розрив між медійним хайпом та операційною реальністю. LLM домінують у пресрелізах, але справжніми «робочими конячками», які підтримують роботу сервісів, є:

  • Embedding-моделі, які перетворюють сирий текст у вектори для пошуку.
  • Cross-encoders, які уточнюють ці вектори для отримання точних рейтингів.
  • Базові прогнозатори, які застосовують одну модель до багатьох числових рядів.

Висновок очевидний: якщо ви створюєте ШІ, який має масштабуватися, дивіться глибше хайпу. Моделі, що домінують у графіках завантажень Hugging Face, забезпечують безперебійну роботу систем у продакшені, і саме вони й надалі визначатимуть напрямки реальних витрат на ШІ.