SkewAdam скорочує обсяг пам'яті для навчання Mixture-of-Experts більш ніж на 60% і забезпечує помітне зростання точності, дозволяючи розробникам розмістити MoE-модель із 6,78 мільярда параметрів на одному 40 ГБ GPU.
Чому навчання MoE впирається в «стіну пам'яті»
Архітектури Mixture-of-Experts спрямовують кожен вхід через невелику підмножину «експертних» підмереж, зберігаючи при цьому щільну основу (dense backbone). Перевага полягає в тому, що модель може масштабуватися до мільярдів параметрів без пропорційного зростання обчислювальної потужності. На практиці оптимізатор — зокрема варіант AdamW, який використовує більшість команд — споживає основну частину відеопам'яті (GPU RAM). Для моделі з 6,78 млрд параметрів лише тензори моментуму (momentum) та дисперсії (variance) оптимізатора потребують близько 50 ГБ. Додайте активації та ваги моделі, і піковий обсяг пам'яті перевищить 81,4 ГБ, що змушує використовувати конфігурації з кількома GPU або сповільнювати графік навчання.
Чим SkewAdam відрізняється від інших
SkewAdam не вигадує нове правило навчання. Він перерозподіляє місце зберігання моментів Adam:
- Щільна основа зберігає моментум із повною точністю, забезпечуючи плавні оновлення, необхідні щільним шарам.
- Банк експертів зберігає факторизоване наближення дисперсії, що зменшує обсяг даних для кожного експерта.
- Роутер (router), який вирішує, яких експертів активувати, зберігає точну оцінку другого моменту.
Розглядаючи ці три компоненти як окремі «рівні» (tiers), оптимізатор відмовляється від надлишкової точності там, де вона менш важлива, і зберігає її там, де вона найбільш критична.
Вимірюваний ефект
Запуск тієї самої MoE-моделі з 6,78 млрд параметрів за допомогою SkewAdam дає такі результати:
- Пікова пам'ять GPU: 31,3 ГБ (замість 81,4 ГБ)
- Обсяг стану оптимізатора: 1,29 ГБ (замість 50 ГБ)
Зменшений стан легко вміщується в одному 40 ГБ прискорювачі.
Зростання точності, а не лише економія
Скорочення обсягу пам'яті часто шкодить якості моделі, але SkewAdam покращує перплексію (perplexity) — стандартну метрику мовних моделей — з 126,8 (AdamW) до 108,4. Він також перевершує Muon (120,2) та Lion (393,7) у тому самому завданні. Автори стверджують, що такий стрибок досягається завдяки збереженню моментуму на всіх трьох рівнях; методи, які повністю відмовляються від моментуму, як-от Adafactor, відстають.
Відкриті питання
Результати SkewAdam продемонстровані на моделі з 6,78 млрд параметрів. Поки що незрозуміло, чи зберігаються такі ж співвідношення стану пам'яті для моделей на порядок більшого розміру або для завдань, що виходять за межі моделювання мови.
На що звернути увагу
- Бенчмарки на більших конфігураціях MoE (десятки мільярдів параметрів).
- Впровадження у фреймворки з відкритим кодом та включення у популярні скрипти навчання.
- Відгуки спільноти про приховані компроміси, такі як швидкість збіжності або стабільність за різних графіків швидкості навчання (learning-rate schedules).
Джерело: пост розробника з детальним описом архітектури оптимізатора та емпіричних результатів.
