SkewAdam, Mixture-of-Experts பயிற்சியின் நினைவகத் தேவையை (memory) 60%-க்கும் அதிகமாகக் குறைப்பதோடு, துல்லியத்திலும் (accuracy) குறிப்பிடத்தக்க முன்னேற்றத்தை வழங்குகிறது; இதன் மூலம் டெவலப்பர்கள் 6.78 பில்லியன் அளவுருக்கள் (parameters) கொண்ட ஒரு MoE மாடலை ஒரே ஒரு 40 GB GPU-வில் இயக்க முடியும்.
MoE பயிற்சி ஏன் நினைவகத் தடையைச் (memory wall) சந்திக்கிறது
Mixture-of-Experts கட்டமைப்புகள், ஒரு அடர்த்தியான (dense) backbone-ஐத் தக்கவைத்துக் கொண்டு, ஒவ்வொரு உள்ளீட்டையும் (input) "expert" துணை-நெட்வொர்க்குகளின் ஒரு சிறிய தொகுப்பின் வழியாக வழிநடத்துகின்றன. இதன் பயன் என்னவென்றால், கணக்கீட்டுத் திறன் (compute) விகிதாசாரப்படி அதிகரிக்காமலேயே, பில்லியன் கணக்கான அளவுருக்களுக்கு இந்த மாடலை விரிவாக்க முடியும். நடைமுறையில், optimizer—குறிப்பாக பெரும்பாலான குழுக்கள் பயன்படுத்தும் AdamW வகை—GPU RAM-ன் பெரும்பகுதியை எடுத்துக்கொள்கிறது. 6.78 B-parameter மாடலுக்கு, optimizer-ன் momentum மற்றும் variance tensors மட்டுமே சுமார் 50 GB நினைவகத்தைக் கோருகின்றன. இதனுடன் activations மற்றும் model weights-ஐச் சேர்த்தால், உச்சக்கட்ட நினைவகம் (peak memory) 81.4 GB வரை செல்கிறது, இது பல GPU அமைப்புகளைப் பயன்படுத்தவோ அல்லது மெதுவான பயிற்சி முறைகளைக் கையாளவோ கட்டாயப்படுத்துகிறது.
SkewAdam என்ன வித்தியாசமாகச் செய்கிறது
SkewAdam ஒரு புதிய கற்றல் விதியைக் (learning rule) கண்டறியவில்லை. மாறாக, Adam-ன் moments எங்கு இருக்க வேண்டும் என்பதை அது மறுசீரமைக்கிறது:
- அடர்த்தியான backbone, முழுத் துல்லியமான (full-precision) momentum-ஐத் தக்கவைத்துக் கொள்கிறது, இது dense layers-க்குத் தேவையான சீரான மாற்றங்களை (smooth updates) உறுதி செய்கிறது.
- expert bank, variance-ன் ஒரு பகுதியளவு தோராய மதிப்பினை (factored approximation) சேமிக்கிறது, இதன் மூலம் ஒவ்வொரு expert-க்கும் சேமிக்கப்படும் தரவின் அளவு குறைகிறது.
- எந்தெந்த experts-களைச் செயல்படுத்த வேண்டும் என்று தீர்மானிக்கும் router, துல்லியமான second-moment மதிப்பீட்டைத் தக்கவைத்துக் கொள்கிறது.
இந்த மூன்று கூறுகளையும் தனித்தனி "tiers" ஆகக் கருதுவதன் மூலம், இந்த optimizer முக்கியத்துவம் குறைவான இடங்களில் தேவையற்ற துல்லியத்தைக் குறைத்து, மிக முக்கியமான இடங்களில் அதைத் தக்கவைத்துக் கொள்கிறது.
அளவிடக்கூடிய தாக்கம்
அதே 6.78 B-parameter MoE மாடலை SkewAdam கொண்டு இயக்கும்போது கிடைக்கும் முடிவுகள்:
- உச்சக்கட்ட GPU நினைவகம்: 31.3 GB (81.4 GB-லிருந்து குறைக்கப்பட்டது)
- Optimizer-state footprint: 1.29 GB (50 GB-லிருந்து குறைக்கப்பட்டது)
இந்தச் சுருக்கப்பட்ட நிலை (reduced state), ஒரே ஒரு 40 GB accelerator-க்குள் எளிதாகப் பொருந்துகிறது.
சேமிப்பு மட்டுமல்ல, துல்லியத்திலும் முன்னேற்றம்
நினைவகத்தைக் குறைப்பது பெரும்பாலும் மாடலின் தரத்தைப் பாதிக்கும், ஆனால் SkewAdam, ஒரு நிலையான மொழி மாதிரி அளவீடான (standard language-model metric) perplexity-யை 126.8 (AdamW) என்பதிலிருந்து 108.4 ஆக மேம்படுத்துகிறது. இது அதே பணியில் Muon (120.2) மற்றும் Lion (393.7) ஆகியவற்றையும் விடச் சிறப்பாகச் செயல்படுகிறது. மூன்று tiers முழுவதிலும் momentum-ஐத் தக்கவைப்பதன் மூலம் இந்த முன்னேற்றம் கிடைப்பதாக ஆசிரியர்கள் கூறுகின்றனர்; Adafactor போன்ற momentum-ஐ முழுமையாகத் தவிர்க்கும் முறைகள் இதில் பின்தங்கியே உள்ளன.
திறந்த கேள்விகள்
SkewAdam-ன் முடிவுகள் 6.78 B-parameter மாடலில் நிரூபிக்கப்பட்டுள்ளன. இதே போன்ற நினைவக-நிலை விகிதங்கள் (memory-state ratios), இதைவிடப் பல மடங்கு பெரிய மாடல்களுக்கோ அல்லது மொழி மாதிரியாக்கத்தைத் (language modelling) தாண்டிய பணிகளுக்கோ பொருந்துமா என்பது இன்னும் தெளிவாகத் தெரியவில்லை.
கவனிக்க வேண்டியவை
- பெரிய MoE கட்டமைப்புகளில் (பத்து பில்லியன் அளவுருக்கள் கொண்டவை) மேற்கொள்ளப்படும் ஒப்பீட்டுச் சோதனைகள் (Benchmarks).
- திறந்த மூல (open-source) கட்டமைப்புகளால் ஏற்றுக்கொள்ளப்படுதல் மற்றும் பிரபலமான பயிற்சி ஸ்கிரிப்ட்களில் (training scripts) சேர்க்கப்படுதல்.
- மாறுபட்ட learning-rate அட்டவணைகளின் கீழ், अभिसरण வேகம் (convergence speed) அல்லது நிலைத்தன்மை (stability) போன்ற மறைமுகமான சமரசங்கள் (trade-offs) குறித்த சமூகத்தின் கருத்துக்கள்.
மூலம்: optimizer-ன் வடிவமைப்பு மற்றும் அனுபவ ரீதியான முடிவுகளை விவரிக்கும் டெவலப்பர் பதிவு.
