SkewAdam ಎಂಬುದು Mixture-of-Experts ತರಬೇತಿಯ ಮೆಮೊರಿಯನ್ನು 60% ಕ್ಕಿಂತ ಹೆಚ್ಚು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ನಿಖರತೆಯಲ್ಲಿ ಗಮನಾರ್ಹ ಏರಿಕೆಯನ್ನು ನೀಡುತ್ತದೆ, ಇದು 6.78 ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ MoE ಮಾಡೆಲ್ ಅನ್ನು ಒಂದೇ 40 GB GPU ನಲ್ಲಿ ಅಳವಡಿಸಲು ಡೆವಲಪರ್‌ಗಳಿಗೆ ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.

MoE ತರಬೇತಿಯು ಮೆಮೊರಿ ಮಿತಿಯನ್ನು (memory wall) ಏಕೆ ಎದುರಿಸುತ್ತದೆ

Mixture-of-Experts ಆರ್ಕಿಟೆಕ್ಚರ್‌ಗಳು ಒಂದು 'ಡೆನ್ಸ್ ಬ್ಯಾಕ್‌ಬೋನ್' (dense backbone) ಅನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತಾ, ಪ್ರತಿಯೊಂದು ಇನ್‌ಪುಟ್ ಅನ್ನು "ಎಕ್ಸ್‌ಪರ್ಟ್" (expert) ಸಬ್-ನೆಟ್‌ವರ್ಕ್‌ಗಳ ಸಣ್ಣ ಉಪಸಮೂಹದ ಮೂಲಕ ಕಳುಹಿಸುತ್ತವೆ. ಇದರ ಪ್ರಯೋಜನವೆಂದರೆ, ಕಂಪ್ಯೂಟ್ ಸಾಮರ್ಥ್ಯದಲ್ಲಿ ಸಮಾನुಪಾತಿಕ ಬೆಳವಣಿಗೆಯಿಲ್ಲದೆ ಬಿಲಿಯನ್‌ಗಟ್ಟಲೆ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳಿಗೆ ವಿಸ್ತರಿಸಬಹುದಾದ ಮಾಡೆಲ್ ಸಿಗುತ್ತದೆ. ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಆಪ್ಟಿಮೈಸರ್—ವಿಶೇಷವಾಗಿ ಹೆಚ್ಚಿನ ತಂಡಗಳು ಬಳಸುವ AdamW ವಿಧವು—GPU RAM ನ ಬಹುಪಾಲು ಭಾಗವನ್ನು ಬಳಸಿಕೊಳ್ಳುತ್ತದೆ. 6.78 B-ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್‌ಗಾಗಿ, ಆಪ್ಟಿಮೈಸರ್‌ನ ಮೊಮೆಂಟಮ್ (momentum) ಮತ್ತು ವೇರಿಯನ್ಸ್ (variance) ಟೆನ್ಸರ್‌ಗಳು ಮಾತ್ರ ಸುಮಾರು 50 GB ಅನ್ನು ಬಯಸುತ್ತವೆ. ಇದಕ್ಕೆ ಆಕ್ಟಿವೇಶನ್‌ಗಳು ಮತ್ತು ಮಾಡೆಲ್ ತೂಕಗಳನ್ನು (weights) ಸೇರಿಸಿದರೆ, ಪೀಕ್ ಮೆಮೊರಿ 81.4 GB ತಲುಪುತ್ತದೆ, ಇದು ಮಲ್ಟಿ-GPU ಸೆಟಪ್‌ಗಳು ಅಥವಾ ನಿಧಾನಗತಿಯ ತರಬೇತಿ ವೇಳಾಪಟ್ಟಿಗಳಿಗೆ ಒತ್ತಾಯಿಸುತ್ತದೆ.

SkewAdam ಏನನ್ನು ವಿಭಿನ್ನವಾಗಿ ಮಾಡುತ್ತದೆ

SkewAdam ಹೊಸ ಕಲಿಕೆಯ ನಿಯಮವನ್ನು (learning rule) ಕಂಡುಹಿಡಿಯುವುದಿಲ್ಲ. ಇದು Adam ನ ಮೊಮೆಂಟ್ಸ್ (moments) ಎಲ್ಲಿ ಇರಬೇಕು ಎಂಬುದನ್ನು ಮರುಹೊಂದಿಸುತ್ತದೆ:

  • ಡೆನ್ಸ್ ಬ್ಯಾಕ್‌ಬೋನ್ ಪೂರ್ಣ-ನಿಖರತೆಯ ಮೊಮೆಂಟಮ್ ಅನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುತ್ತದೆ, ಇದು ಡೆನ್ಸ್ ಲೇಯರ್‌ಗಳಿಗೆ ಅಗತ್ಯವಿರುವ ಸುಗಮ ಅಪ್‌ಡೇಟ್‌ಗಳನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತದೆ.
  • ಎಕ್ಸ್‌ಪರ್ಟ್ ಬ್ಯಾಂಕ್ ವೇರಿಯನ್ಸ್‌ನ ಫ್ಯಾಕ್ಟರ್ಡ್ ಅಪ್ರೊಕ್ಸಿಮೇಶನ್ ಅನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ, ಇದು ಪ್ರತಿ ಎಕ್ಸ್‌ಪರ್ಟ್‌ಗಾಗಿ ಇರಿಸಲಾದ ಡೇಟಾವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
  • ಯಾವ ಎಕ್ಸ್‌ಪರ್ಟ್‌ಗಳನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಬೇಕು ಎಂದು ನಿರ್ಧರಿಸುವ ರೂಟರ್ (router), ನಿಖರವಾದ ಸೆಕೆಂಡ್-ಮೊಮೆಂಟ್ ಅಂದಾಜನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುತ್ತದೆ.

ಈ ಮೂರು ಘಟಕಗಳನ್ನು ಪ್ರತ್ಯೇಕ "ಟಿಯರ್‌ಗಳಾಗಿ" (tiers) ಪರಿಗಣಿಸುವ ಮೂಲಕ, ಆಪ್ಟಿಮೈಸರ್ ಕಡಿಮೆ ಮುಖ್ಯವಾದ ಕಡೆ ಅನಗತ್ಯ ನಿಖರತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಹೆಚ್ಚು ಮುಖ್ಯವಾದ ಕಡೆ ಅದನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತದೆ.

ಅಳೆಯಬಹುದಾದ ಪ್ರಭಾವ

ಅದೇ 6.78 B-ಪ್ಯಾರಾಮೀಟರ್ MoE ಮಾಡೆಲ್ ಅನ್ನು SkewAdam ನೊಂದಿಗೆ ಚಲಾಯಿಸುವುದರಿಂದ ಈ ಕೆಳಗಿನ ಫಲಿತಾಂಶಗಳು ಸಿಗುತ್ತವೆ:

  • ಪೀಕ್ GPU ಮೆಮೊರಿ: 31.3 GB (81.4 GB ನಿಂದ ಇಳಿಕೆಯಾಗಿದೆ)
  • ಆಪ್ಟಿಮೈಸರ್-ಸ್ಟೇಟ್ ಫುಟ್‌ಪ್ರಿಂಟ್: 1.29 GB (50 GB ನಿಂದ ಇಳಿಕೆಯಾಗಿದೆ)

ಕಡಿಮೆ ಮಾಡಲಾದ ಸ್ಟೇಟ್ ಒಂದೇ 40 GB ಆಕ್ಸಿಲರೇಟರ್‌ನೊಳಗೆ ಸುಲಭವಾಗಿ ಹೊಂದುತ್ತದೆ.

ಕೇವಲ ಉಳಿತಾಯವಲ್ಲ, ನಿಖರತೆಯಲ್ಲೂ ಲಾಭ

ಮೆಮೊರಿ ಕಡಿತವು ಹೆಚ್ಚಾಗಿ ಮಾಡೆಲ್ ಗುಣಮಟ್ಟವನ್ನು ಹಾನಿಗೊಳಿಸುತ್ತದೆ, ಆದರೆ SkewAdam ಪರ್ಪ್ಲೆಕ್ಸಿಟಿ (perplexity)—ಇದು ಒಂದು ಪ್ರಮಾಣಿತ ಭಾಷಾ-ಮಾಡೆಲ್ ಮೆಟ್ರಿಕ್—ಅನ್ನು 126.8 (AdamW) ನಿಂದ 108.4 ಕ್ಕೆ ಸುಧಾರಿಸುತ್ತದೆ. ಇದು ಅದೇ ಕಾರ್ಯದಲ್ಲಿ Muon (120.2) ಮತ್ತು Lion (393.7) ಅನ್ನು ಮೀರಿಸುತ್ತದೆ. ಮೂರೂ ಟಿಯರ್‌ಗಳಲ್ಲಿ ಮೊಮೆಂಟಮ್ ಅನ್ನು ಉಳಿಸಿಕೊಳ್ಳುವುದರಿಂದ ಈ ಏರಿಕೆ ಕಂಡುಬರುತ್ತದೆ ಎಂದು ಲೇಖಕರು ಹೇಳುತ್ತಾರೆ; Adafactor ನಂತಹ ಮೊಮೆಂಟಮ್ ಅನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಬಿಟ್ಟುಬಿಡುವ ವಿಧಾನಗಳು ಹಿಂದೆ ಉಳಿಯುತ್ತವೆ.

ಮುಕ್ತ ಪ್ರಶ್ನೆಗಳು

SkewAdam ನ ಫಲಿತಾಂಶಗಳನ್ನು 6.78 B-ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್ ಮೇಲೆ ಪ್ರದರ್ಶಿಸಲಾಗಿದೆ. ಇದೇ ರೀತಿಯ ಮೆಮೊರಿ-ಸ್ಟೇಟ್ ಅನುಪಾತಗಳು ಇನ್ನೂ ದೊಡ್ಡದಾದ ಮಾಡೆಲ್‌ಗಳಿಗೆ ಅಥವಾ ಭಾಷಾ ಮಾಡೆಲಿಂಗ್ ಹೊರತಾದ ಕಾರ್ಯಗಳಿಗೆ ಅನ್ವಯಿಸುತ್ತವೆಯೇ ಎಂಬುದು ಇನ್ನೂ ಅಸ್ಪಷ್ಟವಾಗಿದೆ.

ಗಮನಿಸಬೇಕಾದ ಅಂಶಗಳು

  • ದೊಡ್ಡ MoE ಕಾನ್ಫಿಗರೇಶನ್‌ಗಳ ಮೇಲಿನ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು (ಹತ್ತಾರು ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್‌ಗಳು).
  • ಓಪನ್-ಸೋರ್ಸ್ ಫ್ರೇಮ್‌ವರ್ಕ್‌ಗಳ ಅಳವಡಿಕೆ ಮತ್ತು ಜನಪ್ರಿಯ ತರಬೇತಿ ಸ್ಕ್ರಿಪ್ಟ್‌ಗಳಲ್ಲಿ ಸೇರ್ಪಡೆ.
  • ಕನ್ವರ್ಜೆನ್ಸ್ ವೇಗ (convergence speed) ಅಥವಾ ವಿಭಿನ್ನ ಲರ್ನಿಂಗ್-ರೇಟ್ ವೇಳಾಪಟ್ಟಿಗಳ ಅಡಿಯಲ್ಲಿ ಸ್ಥಿರತೆಯಂತಹ ಗುಪ್ತ ವಹಿವಾಟುಗಳ (trade-offs) ಬಗ್ಗೆ ಸಮುದಾಯದ ಪ್ರತಿಕ್ರಿಯೆ.

ಮೂಲ: ಆಪ್ಟಿಮೈಸರ್‌ನ ವಿನ್ಯಾಸ ಮತ್ತು ಪ್ರಾಯೋಗಿಕ ಫಲಿತಾಂಶಗಳನ್ನು ವಿವರಿಸುವ ಡೆವಲಪರ್ ಪೋಸ್ಟ್.