SkewAdam Mixture-of-Experts ટ્રેનિંગ મેમરીમાં 60% થી વધુનો ઘટાડો કરે છે અને ચોકસાઈમાં નોંધપાત્ર વધારો લાવે છે, જેનાથી ડેવલપર્સ 6.78 બિલિયન-પેરામીટર ધરાવતા MoE મોડેલને સિંગલ 40 GB GPU પર ચલાવી શકે છે.

MoE ટ્રેનિંગ શા માટે મેમરીની મર્યાદા (memory wall) ને પહોંચી જાય છે

Mixture-of-Experts આર્કિટેક્ચર એક ડેન્સ બેકબોન (dense backbone) જાળવી રાખીને દરેક ઇનપુટને "એક્સપર્ટ" સબ-નેટવર્ક્સના નાના સબસેટ દ્વારા રૂટ કરે છે. તેનો ફાયદો એ છે કે મોડેલ કમ્પ્યુટિંગ ક્ષમતામાં પ્રમાણસર વધારો કર્યા વિના અબજો પેરામીટર્સ સુધી સ્કેલ થઈ શકે છે. વ્યવહારમાં, ઓપ્ટિમાઇઝર—ખાસ કરીને AdamW વેરિઅન્ટ જેનો મોટાભાગની ટીમો ઉપયોગ કરે છે—GPU RAM નો મોટો હિસ્સો વાપરી નાખે છે. 6.78 B-પેરામીટર મોડેલ માટે, માત્ર ઓપ્ટિમાઇઝરના મોમેન્ટમ (momentum) અને વેરિઅન્સ (variance) ટેન્સર જ લગભગ 50 GB જગ્યા રોકે છે. તેમાં એક્ટિવેશન્સ (activations) અને મોડેલ વેટ્સ (weights) ઉમેરતા, પીક મેમરી 81.4 GB સુધી પહોંચી જાય છે, જેના કારણે મલ્ટી-GPU સેટઅપ અથવા ધીમા ટ્રેનિંગ શેડ્યૂલનો ઉપયોગ કરવો પડે છે.

SkewAdam શું અલગ રીતે કરે છે

SkewAdam કોઈ નવો લર્નિંગ રૂલ (learning rule) શોધતું નથી. તે Adam ના મોમેન્ટ્સ (moments) ક્યાં રહેશે તેનું પુનઃવિતરણ કરે છે:

  • ડેન્સ બેકબોન ફૂલ-પ્રિસિઝન મોમેન્ટમ (full-precision momentum) જાળવી રાખે છે, જે ડેન્સ લેયર્સને જરૂરી સ્મૂધ અપડેટ્સને સુરક્ષિત રાખે છે.
  • એક્સપર્ટ બેંક વેરિઅન્સનું ફેક્ટર્ડ એપ્રોક્સિમેશન (factored approximation) સ્ટોર કરે છે, જેનાથી દરેક એક્સપર્ટ માટે રાખવામાં આવતા ડેટામાં ઘટાડો થાય છે.
  • રાઉટર, જે નક્કી કરે છે કે કયા એક્સપર્ટ્સને એક્ટિવેટ કરવા, તે ચોક્કસ સેકન્ડ-મોમેન્ટ એસ્ટીમેટ (second-moment estimate) જાળવી રાખે છે.

આ ત્રણ ઘટકોને અલગ "ટાયર્સ" (tiers) તરીકે ગણીને, ઓપ્ટિમાઇઝર જ્યાં ઓછી જરૂર હોય ત્યાં બિનજરૂરી પ્રિસિઝન ઘટાડે છે અને જ્યાં સૌથી વધુ જરૂર હોય ત્યાં તેને જાળવી રાખે છે.

માપી શકાય તેવો પ્રભાવ

SkewAdam સાથે સમાન 6.78 B-પેરામીટર MoE મોડેલ ચલાવવાથી નીચે મુજબના પરિણામો મળે છે:

  • પીક GPU મેમરી: 31.3 GB (81.4 GB થી ઘટાડો)
  • ઓપ્ટિમાઇઝર-સ્ટેટ ફૂટપ્રિન્ટ: 1.29 GB (50 GB થી ઘટાડો)

આ ઘટાડેલી સ્ટેટ સિંગલ 40 GB એક્સિલરેટરની અંદર આરામથી સમાઈ જાય છે.

માત્ર બચત જ નહીં, ચોકસાઈમાં પણ વધારો

મેમરીમાં ઘટાડો કરવાથી ઘણીવાર મોડેલની ગુણવત્તા પર અસર પડે છે, પરંતુ SkewAdam પર્પ્લેક્સિટી (perplexity)—જે લેંગ્વેજ-મોડેલ માટેનું એક પ્રમાણભૂત મેટ્રિક છે—તેને 126.8 (AdamW) થી વધારીને 108.4 કરે છે. તે સમાન કાર્ય પર Muon (120.2) અને Lion (393.7) કરતા પણ વધુ સારું પ્રદર્શન કરે છે. લેખકોનું કહેવું છે કે આ વધારો ત્રણેય ટાયર્સમાં મોમેન્ટમ જાળવી રાખવાથી થાય છે; Adafactor જેવી પદ્ધતિઓ જે મોમેન્ટમને સંપૂર્ણપણે દૂર કરે છે, તે પાછળ રહી જાય છે.

ખુલ્લા પ્રશ્નો

SkewAdam ના પરિણામો 6.78 B-પેરામીટર મોડેલ પર દર્શાવવામાં આવ્યા છે. તે હજુ અસ્પષ્ટ છે કે શું સમાન મેમરી-સ્ટેટ રેશિયો (memory-state ratios) તેના કરતા અનેક ગણા મોટા મોડેલો માટે અથવા લેંગ્વેજ મોડેલિંગ સિવાયના કાર્યો માટે પણ કામ કરશે.

શું જોવા જેવું છે

  • મોટા MoE કોન્ફિગરેશન્સ (દસ-દસ અબજો પેરામીટર્સ) પર બેન્ચમાર્ક.
  • ઓપન-સોર્સ ફ્રેમવર્ક દ્વારા સ્વીકૃતિ અને લોકપ્રિય ટ્રેનિંગ સ્ક્રિપ્ટ્સમાં તેનો સમાવેશ.
  • છુપા ટ્રેડ-ઓફ્સ (trade-offs) પર કોમ્યુનિટી ફીડબેક, જેમ કે કન્વર્જન્સ સ્પીડ (convergence speed) અથવા વિવિધ લર્નિંગ-રેટ શેડ્યૂલ હેઠળ સ્થિરતા.

સ્ત્રોત: ઓપ્ટિમાઇઝરની ડિઝાઇન અને પ્રાયોગિક પરિણામોની વિગતો આપતી ડેવલપર પોસ્ટ.