يقلل SkewAdam من ذاكرة تدريب Mixture-of-Experts بنسبة تزيد عن 60% ويحقق قفزة ملحوظة في الدقة، مما يسمح للمطورين بتشغيل نموذج MoE يحتوي على 6.78 مليار معلمة (parameter) على وحدة معالجة رسومات (GPU) واحدة بسعة 40 جيجابايت.

لماذا يصطدم تدريب MoE بجدار الذاكرة

تقوم بنيات Mixture-of-Experts بتوجيه كل مدخل عبر مجموعة فرعية صغيرة من الشبكات الفرعية "الخبيرة" (expert) مع الحفاظ على هيكل أساسي كثيف (dense backbone). وتتمثل الفائدة في الحصول على نموذج يمكنه التوسع إلى مليارات المعلمات دون زيادة متناسبة في العمليات الحسابية. ومن الناحية العملية، يستهلك المُحسِّن (optimizer) — وتحديداً إصدار AdamW الذي تستخدمه معظم الفرق — الجزء الأكبر من ذاكرة الوصول العشوائي (RAM) الخاصة بوحدة معالجة الرسومات. فبالنسبة لنموذج يحتوي على 6.78 مليار معلمة، تتطلب موترات (tensors) الزخم (momentum) والتباين (variance) الخاصة بالمُحسِّن وحدها حوالي 50 جيجابايت. ومع إضافة التنشيطات (activations) وأوزان النموذج، يصل ذروة استهلاك الذاكرة إلى 81.4 جيجابايت، مما يفرض استخدام إعدادات متعددة لوحدات معالجة الرسومات أو جداول تدريب أبطأ.

ما الذي يفعله SkewAdam بشكل مختلف

لا يبتكر SkewAdam قاعدة تعلم جديدة، بل يعيد تنظيم أماكن تخزين "لحظات" (moments) Adam:

  • يحافظ الهيكل الأساسي الكثيف (dense backbone) على زخم كامل الدقة، مما يحافظ على التحديثات السلسة التي تحتاجها الطبقات الكثيفة.
  • يخزن بنك الخبراء (expert bank) تقريباً مُحللاً (factored approximation) للتباين، مما يقلل من البيانات المحفوظة لكل خبير.
  • يحتفظ الموجه (router)، الذي يقرر أي الخبراء سيتم تفعيلهم، بتقدير دقيق للحظة الثانية (second-moment estimate).

من خلال التعامل مع هذه المكونات الثلاثة كـ "طبقات" (tiers) منفصلة، يتخلص المُحسِّن من الدقة الزائدة في الأماكن الأقل أهمية ويحتفظ بها حيث تبرز أهميتها القصوى.

تأثير ملموس

يؤدي تشغيل نفس نموذج MoE الذي يحتوي على 6.78 مليار معلمة باستخدام SkewAdam إلى النتائج التالية:

  • ذروة ذاكرة وحدة معالجة الرسومات: 31.3 جيجابايت (انخفاضاً من 81.4 جيجابايت)
  • حجم حالة المُحسِّن (optimizer-state footprint): 1.29 جيجابايت (انخفاضاً من 50 جيجابايت)

تتسع الحالة المختصرة بسهولة داخل مسرع واحد بسعة 40 جيجابايت.

مكاسب في الدقة، وليس مجرد توفير

غالباً ما تؤدي تقليصات الذاكرة إلى الإضرار بجودة النموذج، لكن SkewAdam يحسن الـ perplexity — وهو مقياس قياسي لنماذج اللغة — من 126.8 (في AdamW) إلى 108.4. كما يتفوق أيضاً على Muon (120.2) و Lion (393.7) في المهمة نفسها. ويقول المؤلفون إن هذا التحسن يأتي من الحفاظ على الزخم عبر الطبقات الثلاث؛ بينما تتخلف الأساليب التي تتخلص من الزخم تماماً، مثل Adafactor، عن الركب.

أسئلة مفتوحة

تم عرض نتائج SkewAdam على نموذج يحتوي على 6.78 مليار معلمة. ولا يزال من غير الواضح ما إذا كانت نسب حالة الذاكرة نفسها ستصمد مع نماذج أكبر بمراحل أو لمهام تتجاوز نمذجة اللغة.

ما يجب مراقبته

  • الاختبارات المرجعية (Benchmarks) على تكوينات MoE أكبر (عشرات المليارات من المعلمات).
  • الاعتماد من قبل أطر العمل مفتوحة المصدر وإدراجها في نصوص التدريب (training scripts) الشائعة.
  • ملاحظات المجتمع حول المقايضات الخفية، مثل سرعة التقارب (convergence speed) أو الاستقرار تحت جداول معدلات تعلم (learning-rate schedules) مختلفة.

المصدر: منشور للمطور يفصل تصميم المُحسِّن والنتائج التجريبية.