Модель Mixture-of-Experts із 150 мільярдами параметрів може генерувати текст на звичайному ноутбуці розробника. Експеримент показує, що справжнім обмеженням продуктивності є RAM, а не швидкість SSD. Це важливо, оскільки доводить, що моделі передового рівня можна тестувати локально, не витрачаючи кошти на хмарні обчислення.

Тест

Ми запустили модель DeepSeek V4 Flash — MoE із 150 мільярдами параметрів, що пройшла прунінг за допомогою REAP — через open-source inference engine Colibrì. Апаратним забезпеченням був ноутбук AMD Ryzen AI 9 365 із 61 ГБ RAM та NVMe SSD на 1 ТБ. Ми виміряли трихвилинний цикл генерації та зафіксували кожен доступ до диска.

Що показують цифри

  • Активність диска була мінімальною. Протягом трихвилинної генерації SSD виконував читання менш ніж 11 секунд. Навіть якби накопичувач міг зчитувати дані миттєво, загальна пропускна здатність зросла б лише приблизно на 6 відсотків.
  • Обсяг RAM безпосередньо впливав на швидкість. Скорочення кешу RAM вдвічі знизило пропускну здатність приблизно на 15 відсотків. Процесор витрачав майже стільки ж часу на обробку пропуску кешу — деквантування, копіювання та керування даними, — скільки й на очікування диска.

Ці показники спростовують поширену думку про те, що пропускна здатність сховища є основним вузьким місцем для виведення великих моделей на ноутбуці.

Чому RAM краща за SSD

Коли параметр моделі ще не знаходиться в RAM, система повинна:

  1. Зчитати дані з SSD.
  2. Декодувати їх і перемістити в регістри процесора для обчислень.

Обидва кроки споживають цикли. Перший крок обмежений пропускною здатністю SSD; другий додає приблизно таку ж затримку, оскільки процесор має деквантувати дані незалежно від того, наскільки швидко вони надходять. Таким чином, швидший SSD дає дедалі менший ефект, тоді як більший обсяг RAM дозволяє більшій частині моделі залишатися в пам'яті та усуває витратне «коло» запитів.

Наслідки для розробників

  • Інвестуйте в пам'ять, а не в сховище.
  • Локальне тестування стає реальним. Розробники можуть запускати MoE-моделі з відкритими вагами на наявних машинах, перевіряючи стиль, поведінку при виклику інструментів (tool-calling) та якість виводу, не сплачуючи за хмарні кредити.
  • Пакетна оцінка є цілком реальною. Чат у реальному часі все ще може здаватися повільним, але чергові завдання — наприклад, генерація десятків промптів для досліджень — комфортно виконуються на ноутбуці.

Потенційний контраргумент

Дехто може стверджувати, що затримка SSD все ще має значення для робочих навантажень, які повторно завантажують нові ваги експертів.

На що звернути увагу далі

  • Варіанти моделей, ефективні щодо використання пам'яті.
  • Апаратне забезпечення з більшими вбудованими кешами.
  • Стратегії кешування на програмному рівні.

Висновок очевидний: розробникам, які хочуть експериментувати з масивними MoE-моделями на ноутбуці, слід купувати більше RAM. Оновлення SSD економить лише кілька відсотків часу, тоді як додаткова пам'ять може скоротити час виведення на десятки відсотків. Це змінює економіку прототипування ШІ та відкриває двері для локального, безкоштовного тестування моделей, які раніше вважалися такими, що потребують виділених хмарних кластерів.