SkewAdam скорочує обсяг пам'яті для навчання Mixture-of-Experts більш ніж на 60% і забезпечує помітне зростання точності, дозволяючи розробникам розмістити MoE-модель із 6,78 мільярда параметрів на одному 40 ГБ GPU.

Чому навчання MoE впирається в «стіну пам'яті»

Архітектури Mixture-of-Experts спрямовують кожен вхід через невелику підмножину «експертних» підмереж, зберігаючи при цьому щільну основу (dense backbone). Перевага полягає в тому, що модель може масштабуватися до мільярдів параметрів без пропорційного зростання обчислювальної потужності. На практиці оптимізатор — зокрема варіант AdamW, який використовує більшість команд — споживає основну частину відеопам'яті (GPU RAM). Для моделі з 6,78 млрд параметрів лише тензори моментуму (momentum) та дисперсії (variance) оптимізатора потребують близько 50 ГБ. Додайте активації та ваги моделі, і піковий обсяг пам'яті перевищить 81,4 ГБ, що змушує використовувати конфігурації з кількома GPU або сповільнювати графік навчання.

Чим SkewAdam відрізняється від інших

SkewAdam не вигадує нове правило навчання. Він перерозподіляє місце зберігання моментів Adam:

  • Щільна основа зберігає моментум із повною точністю, забезпечуючи плавні оновлення, необхідні щільним шарам.
  • Банк експертів зберігає факторизоване наближення дисперсії, що зменшує обсяг даних для кожного експерта.
  • Роутер (router), який вирішує, яких експертів активувати, зберігає точну оцінку другого моменту.

Розглядаючи ці три компоненти як окремі «рівні» (tiers), оптимізатор відмовляється від надлишкової точності там, де вона менш важлива, і зберігає її там, де вона найбільш критична.

Вимірюваний ефект

Запуск тієї самої MoE-моделі з 6,78 млрд параметрів за допомогою SkewAdam дає такі результати:

  • Пікова пам'ять GPU: 31,3 ГБ (замість 81,4 ГБ)
  • Обсяг стану оптимізатора: 1,29 ГБ (замість 50 ГБ)

Зменшений стан легко вміщується в одному 40 ГБ прискорювачі.

Зростання точності, а не лише економія

Скорочення обсягу пам'яті часто шкодить якості моделі, але SkewAdam покращує перплексію (perplexity) — стандартну метрику мовних моделей — з 126,8 (AdamW) до 108,4. Він також перевершує Muon (120,2) та Lion (393,7) у тому самому завданні. Автори стверджують, що такий стрибок досягається завдяки збереженню моментуму на всіх трьох рівнях; методи, які повністю відмовляються від моментуму, як-от Adafactor, відстають.

Відкриті питання

Результати SkewAdam продемонстровані на моделі з 6,78 млрд параметрів. Поки що незрозуміло, чи зберігаються такі ж співвідношення стану пам'яті для моделей на порядок більшого розміру або для завдань, що виходять за межі моделювання мови.

На що звернути увагу

  • Бенчмарки на більших конфігураціях MoE (десятки мільярдів параметрів).
  • Впровадження у фреймворки з відкритим кодом та включення у популярні скрипти навчання.
  • Відгуки спільноти про приховані компроміси, такі як швидкість збіжності або стабільність за різних графіків швидкості навчання (learning-rate schedules).

Джерело: пост розробника з детальним описом архітектури оптимізатора та емпіричних результатів.