POCKET-35B, мовна модель із 35 мільярдами параметрів, випущена VIDRAFT, тепер може працювати на ноутбуці, що має лише CPU. Ваги моделі у форматі GGUF завантажуються безпосередньо в llama.cpp або Ollama, тому команди з нульовим бюджетом на GPU можуть розпочати експерименти негайно. Протягом семи тижнів після запуску модель перетнула позначку в один мільйон завантажень на Hugging Face, посівши 13-те місце серед усіх завантажень GGUF у світі.

Чому LLM лише на CPU є важливою саме зараз

Підприємства, яким потрібно зберігати конфіденційні тексти — електронні листи клієнтів, внутрішні тікети, фрагменти коду — на власних серверах (on-premises), часто не мають коштів на виділені відеокарти. Донедавна єдиним практичним варіантом було надсилання даних до хмарного API, що означало жертвування приватністю та несеними регулярними витратами. POCKET-35B пропонує компромісний варіант: модель, достатньо велику для обробки складних промптів, але таку, що вписується в межі пам'яті типового офісного ноутбука або міні-ПК.

Як модель вміщується на ноутбуці

  • Формат GGUF – бінарний контейнер, що зберігає квантовані ваги.
  • Сумісність – як llama.cpp, так і Ollama містять середовища виконання (runtimes), які зчитують GGUF-файли та виконують інференс на CPU. Можна використовувати інтегровану GPU для перенесення кількох шарів, але це не обов'язково.
  • Перевірка RAM – розмір GGUF-файлу є мінімальним обсягом RAM, який вам знадобиться. Якщо розмір файлу, наприклад, кілька гігабайтів, то ще до початку завантаження потрібна машина з принаймні такою кількістю вільної пам'яті.

Кроки, щоб запустити POCKET-35B на вашому ноутбуці

  1. Перевірте пам'ять – відкрийте диспетчер завдань вашої системи, занотуйте загальний обсяг RAM і порівняйте його з розміром GGUF-файлу, зазначеним на сторінці Hugging Face.
  2. Оберіть правильне квантування – почніть із версії Q4; вона забезпечує баланс між розміром і швидкістю для більшості ноутбуків.
  3. Завантажте через llama.cpp або Ollama – обидва інструменти можуть завантажувати модель безпосередньо з Hugging Face, автоматично виконуючи перевірку контрольних сум.
  4. Проведіть швидку перевірку – запустіть середовище виконання з простим промптом «Hello, world», щоб підтвердити успішне завантаження.
  5. Створіть реалістичний набір тестів (benchmark suite) – зберіть 30–50 завдань, що відображають ваше робоче навантаження (наприклад, класифікація категорій тікетів, написання чернеток відповідей на електронні листи). Пропустіть їх через модель і зафіксуйте затримку (latency) та якість вихідних токенів.
  6. Перевірте підтримку мов – у документації POCKET-35B відсутній список мов. Якщо вам потрібна в'єтнамська або інші неанглійські скрипти, введіть кілька речень із діакритичними знаками та подивіться, чи видає модель зв'язну відповідь.
  7. Виміряйте фактичну затримку – записуйте час виконання кожного промпту на вашому конкретному обладнанні; не покладайтеся на результати тестів, опубліковані іншими користувачами з іншими CPU або пропускною здатністю RAM.

Про що не говорять цифри завантажень

Мільйон завантажень свідчить про велику цікавість спільноти, а не про гарантовану продуктивність. Здатність моделі до міркування, навички генерації коду та виконання інструкцій не проходили незалежного аудиту. VIDRAFT не розкрила деталей архітектури моделі або джерел навчальних даних, що створює інформаційний провал, який робить розгортання в робочому середовищі (production) ризикованим.

Ризики та контраргументи

  • Невизначена якість – без опублікованих метрик оцінки ви не можете бути впевнені, що POCKET-35B відповідає точності інших альтернатив із відкритим кодом.
  • Невизначеність для промислового використання – відсутність архітектурної прозорості ускладнює прогнозування поведінки моделі під час отримання зловмисних промптів або граничних випадків (edge cases).

Підсумок

Якщо вашій команді потрібно сьогодні експериментувати з LLM на 35 мільярдів параметрів, а бюджет на GPU відсутній, POCKET-35B пропонує життєздатний і недорогий варіант для старту. Модель працює на стандартному ноутбуці за допомогою формату GGUF, а середовища виконання з відкритим кодом роблять налаштування простим. Однак ставтеся до моделі як до експериментальної: перевірте вимоги до пам'яті, проведіть тестування на реальних завданнях і підтвердьте підтримку мов, перш ніж інтегрувати її в будь-який робочий процес. У міру накопичення даних спільноти та розкриття VIDRAFT нових деталей профіль ризиків стане зрозумілішим, але наразі один ноутбук дійсно може вмістити 35-мільярдну LLM, хоча й із певними застереженнями щодо очікувань.