Модель Mixture-of-Experts (MoE) со 150 миллиардами параметров способна генерировать текст на обычном ноутбуке разработчика. Эксперимент показывает, что реальным ограничителем производительности является объем ОЗУ, а не скорость SSD. Это важно, так как доказывает возможность локального тестирования моделей передового уровня без затрат на облачные вычисления.
Тестирование
Мы запустили модель DeepSeek V4 Flash — REAP-pruned MoE на 150 млрд параметров — через open-source движок инференса Colibrì. В качестве оборудования использовался ноутбук на базе AMD Ryzen AI 9 365 с 61 ГБ ОЗУ и NVMe SSD объемом 1 ТБ. Мы замерили время трехминутного цикла генерации и зафиксировали каждое обращение к диску.
Что говорят цифры
- Активность диска была минимальной. За три минуты генерации SSD выполнял чтение менее 11 секунд. Даже если бы накопитель мог считывать данные мгновенно, общая пропускная способность увеличилась бы всего на 6 процентов.
- Объем ОЗУ напрямую влиял на скорость. Уменьшение кэша ОЗУ вдвое снизило пропускную способность примерно на 15 процентов. Процессор тратил почти столько же времени на обработку промахов кэша (деквантование, копирование и управление данными), сколько и на ожидание данных с диска.
Эти данные опровергают распространенное мнение о том, что пропускная способность накопителя является основным узким местом при инференсе больших моделей на ноутбуке.
Почему ОЗУ важнее SSD
Когда параметр модели еще не находится в ОЗУ, системе необходимо:
- Извлечь данные с SSD.
- Декодировать их и переместить в регистры процессора для вычислений.
Оба этапа потребляют такты процессора. Первый этап ограничен пропускной способностью SSD; второй добавляет примерно такую же задержку, так как процессору в любом случае приходится выполнять деквантование данных, независимо от скорости их поступления. Таким образом, использование более быстрого SSD дает все меньший эффект, в то время как увеличение объема ОЗУ позволяет удерживать в памяти бóльшую часть модели и исключает дорогостоящий цикл «запрос-ответ» с диском.
Значение для разработчиков
- Инвестируйте в память, а не в накопитель.
- Локальное тестирование становится реальным. Разработчики могут запускать MoE-модели с открытыми весами на имеющихся машинах, проверяя стиль, поведение при вызове инструментов (tool-calling) и качество ответов, не тратясь на облачные кредиты.
- Пакетная оценка становится выполнимой. Чат в реальном времени все еще может казаться медленным, но очереди задач — например, генерация десятков промптов для исследований — вполне комфортно выполняются на ноутбуке.
Возможный контраргумент
Some may argue that SSD latency still matters for workloads that repeatedly load new expert weights.
На что обратить внимание в будущем
- Эффективные с точки зрения памяти варианты моделей.
- Аппаратное обеспечение с увеличенным объемом кэша на кристалле.
- Стратегии кэширования на программном уровне.
Вывод очевиден: разработчикам, которые хотят экспериментировать с массивными MoE-моделями на ноутбуке, следует покупать больше ОЗУ. Апгрейд SSD сэкономит лишь несколько процентов времени, тогда как дополнительная память может сократить время инференса на двузначные проценты. Это меняет экономику прототипирования ИИ и открывает путь к локальному и бесплатному тестированию моделей, которые раньше считались требующими выделенных облачных кластеров.
