Meta ನ ಹೊಸ 30-ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ Muse Glimmer ಮಾಡೆಲ್, MacBook Pro M2 Pro ನಲ್ಲಿ 3-ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ Llama 3.2 ಗಿಂತ 56 ಪಟ್ಟು ನಿಧಾನವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ, ಇದು ಹೆಚ್ಚಿನ ಸ್ಥಳೀಯ-ಏಜೆಂಟ್ (local-agent) ವರ್ಕ್ಫ್ಲೋಗಳನ್ನು ಚಲಾಯಿಸುವ ವೇಗದ ಮತ್ತು ಪುನರಾವರ್ತಿತ ಕರೆಗಳಿಗೆ (calls) ಈ ಮಾಡೆಲ್ ಅನ್ನು ಅಪ್ರಾಯೋಗಿಕವಾಗಿಸುತ್ತದೆ.
ಸ್ಥಳೀಯ ಏಜೆಂಟ್ಗಳಿಗೆ ವೇಗ ಏಕೆ ಮುಖ್ಯ
ಸ್ಥಳೀಯ-ಏಜೆಂಟ್ ಲೂಪ್ಗಳು ಪ್ರತಿ ನಿಮಿಷಕ್ಕೆ ಡಜನ್ಗಟ್ಟಲೆ, ಕೆಲವೊಮ್ಮೆ ನೂರಾರು ಮಾಡೆಲ್ ಕರೆಗಳನ್ನು ಮಾಡಬಹುದು. ಪ್ರತಿ ಕರೆಯು ವಿಳಂಬವನ್ನು (latency) ಹೆಚ್ಚಿಸುತ್ತದೆ; ಈ ಒಟ್ಟು ವಿಳಂಬವು ಪ್ರತಿಕ್ರಿಯಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಕುಂಠಿತಗೊಳಿಸಬಹುದು. ಆದ್ದರಿಂದ, ಡೆವಲಪರ್ಗಳು ನಿಖರತೆಯನ್ನು ನೀಡುವ ಅತ್ಯಂತ ಚಿಕ್ಕ ಮಾಡೆಲ್ಗಳನ್ನೇ ಬಳಸುತ್ತಾರೆ, ಕೇವಲ ಸಮಸ್ಯೆಗಳಿಗೆ ಆಳವಾದ ತರ್ಕದ (reasoning) ಅಗತ್ಯವಿದ್ದಾಗ ಮಾತ್ರ ದೊಡ್ಡ ಮಾಡೆಲ್ಗಳನ್ನು ಬದಲಾಯಿಸುತ್ತಾರೆ. Meta ತನ್ನ Muse Glimmer ಅನ್ನು ಈ ಲೂಪ್ಗಳಿಗಾಗಿಯೇ ನಿರ್ಮಿಸಲಾದ "thinking" ಮಾಡೆಲ್ ಎಂದು ಮಾರುಕಟ್ಟೆ ಮಾಡಿದೆ, ಇದು ಸಾಧನದ ಅನುಕೂಲವನ್ನು (on-device advantage) ಕಳೆದುಕೊಳ್ಳದೆ ಹೆಚ್ಚು ಸಮೃದ್ಧವಾದ ಇನ್ಫರೆನ್ಸ್ (inference) ನೀಡುವ ಭರವಸೆ ನೀಡಿದೆ.
ಬೆಂಚ್ಮಾರ್ಕ್ ಸೆಟಪ್
ನಾವು 32 GB RAM ಹೊಂದಿರುವ MacBook Pro M2 Pro ನಲ್ಲಿ ಈ ಪರೀಕ್ಷೆಯನ್ನು ನಡೆಸಿದೆವು ಮತ್ತು ಮೂರು ಪ್ರಮುಖ ಕಾರ್ಯಗಳನ್ನು ಅಳೆಯಿದೆವು:
- Context re-read speed – ಮಾಡೆಲ್ ಈಗಾಗಲೇ ನೋಡಿದ ಪ್ರಾಂಪ್ಟ್ ಅನ್ನು ಎಷ್ಟು ವೇಗವಾಗಿ ಪ್ರೊಸೆಸ್ ಮಾಡುತ್ತದೆ ಎಂಬುದು.
- Constrained JSON extraction – ಮುಕ್ತ ರೂಪದ ಪಠ್ಯದಿಂದ (free-form text) ರಚನಾತ್ಮಕ ಡೇಟಾವನ್ನು ಹೊರತೆಗೆಯುವುದು, ಇದು ಟೂಲ್ಗಳನ್ನು ಬಳಸುವ ಮೊದಲು ಮಾಡುವ ಸಾಮಾನ್ಯ ಹಂತವಾಗಿದೆ.
- Tool calling – ಸರಿಯಾದ ಫಾರ್ಮ್ಯಾಟ್ನಲ್ಲಿರುವ ಫಂಕ್ಷನ್ ಕರೆಯನ್ನು (function call) ಸೃಷ್ಟಿಸುವುದು.
ಮೂರು ಮಾಡೆಲ್ಗಳನ್ನು ಹೋಲಿಕೆ ಮಾಡಲಾಯಿತು:
| ಮಾಡೆಲ್ | ಪ್ರಾಂಪ್ಟ್ ವೇಗ (tok/s) | ಜನರೇಷನ್ ವೇಗ (tok/s) | JSON ಯಶಸ್ಸು (5-ಪ್ರಯತ್ನ) | ಪ್ರತಿ ಕರೆಯ ಸಮಯ |
|---|---|---|---|---|
| Llama 3.2 3B | 702.9 | 56.7 | 5/5 | 0.6 s |
| Qwen 3 14B | 161.8 | 14.6 | 5/5 | 16.1 s |
| Muse Glimmer 30B | 56.7 | 7.1 | 5/5 | 33.4 s |
ಮೂರೂ ಮಾಡೆಲ್ಗಳು ನಿಖರತೆಯ ಗುರಿಯನ್ನು ತಲುಪಿದವು ಮತ್ತು ಪ್ರತಿ ಪ್ರಯೋಗದಲ್ಲೂ ಒಂದೇ ರೀತಿಯ JSON ಔಟ್ಪುಟ್ ನೀಡಿದವು. 3 B ಮಾಡೆಲ್ ಸಂಪೂರ್ಣ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಒಂದು ಸೆಕೆಂಡಿಗಿಂತ ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಮುಗಿಸಿತು; ಆದರೆ 30 B ಮಾಡೆಲ್ಗೆ ಅರ್ಧ ನಿಮಿಷಕ್ಕಿಂತ ಹೆಚ್ಚು ಸಮಯ ಬೇಕಾಯಿತು.
ಈ ಅಂಕಿಅಂಶಗಳ ಅರ್ಥವೇನು
56 ಪಟ್ಟು ನಿಧಾನಗತಿಯು ನೇರವಾಗಿ CPU ಬಳಕೆ ಮತ್ತು ಒಟ್ಟು ಸಮಯವನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ, ಇದು ಶಕ್ತಿ ಬಳಕೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ ಮತ್ತು ಒಂದು ಯಂತ್ರವು ಎಷ್ಟು ಏಕಕಾಲಿಕ ಏಜೆಂಟ್ಗಳನ್ನು (concurrent agents) ನಿಭಾಯಿಸಬಲ್ಲದು ಎಂಬುದನ್ನು ಸೀಮಿತಗೊಳಿಸುತ್ತದೆ. "thinking" ಮೋಡ್ ಆಫ್ ಆಗಿದ್ದರೂ ಸಹ, Muse Glimmer ಹೆಚ್ಚಿನ ಟೋಕನ್ಗಳನ್ನು ಬಳಸುತ್ತಲೇ ಇತ್ತು, ಇದು ವಿಳಂಬವು (latency) ಕೇವಲ ಒಂದು ಆಯ್ಕೆಯಲ್ಲದೆ, ಅದರ ಆರ್ಕಿಟೆಕ್ಚರ್ನಲ್ಲೇ ಅಡಗಿದೆ
Muse Glimmer ಒಂದು 30B ಮಾಡೆಲ್ ನೀಡುವ ಆಳವಾದ ಸಾಮರ್ಥ್ಯವನ್ನು ಒದಗಿಸುತ್ತದೆ, ಆದರೆ ಪ್ರಸ್ತುತ ಗ್ರಾಹಕ ಹಾರ್ಡ್ವೇರ್ಗಳಲ್ಲಿ (consumer hardware), ಹೆಚ್ಚಿನ ಸ್ಥಳೀಯ ಏಜೆಂಟ್ಗಳನ್ನು ಚಲಾಯಿಸುವ ಹೈ-ಫ್ರೀಕ್ವೆನ್ಸಿ ಲೂಪ್ಗಳಿಗೆ (high-frequency loops) ಇದು ತುಂಬಾ ನಿಧಾನವಾಗಿದೆ. ಸಾಧನದಲ್ಲಿರುವ (on-device) ಮಾಡೆಲ್ಗಳನ್ನು ಬಾಹ್ಯ APIಗಳಂತೆ ಪರಿಗಣಿಸಿ: ನಿಖರತೆಯ ಅಗತ್ಯತೆಗಳನ್ನು ಪೂರೈಸುವ ಅತ್ಯಂತ ಚಿಕ್ಕ ಮಾಡೆಲ್ನಿಂದ ಪ್ರಾರಂಭಿಸಿ, ಮತ್ತು ಹೆಚ್ಚಿನ ತಾರ್ಕಿಕ ಸಾಮರ್ಥ್ಯದ (reasoning capacity) ಅಗತ್ಯವಿರುವ ಕಾರ್ಯಗಳಿಗಾಗಿ ಮಾತ್ರ ಈ ಭಾರೀ ಮಾಡೆಲ್ಗಳನ್ನು ಮೀಸಲಿಡಿ. Meta ವೇಗದ ಅಂತರವನ್ನು ಕಡಿಮೆ ಮಾಡುವವರೆಗೆ, ದೈನಂದಿನ ಎಕ್ಸ್ಟ್ರಾಕ್ಷನ್, ಫಾರ್ಮ್ಯಾಟಿಂಗ್ ಮತ್ತು ಸರಳ ಟೂಲ್ ಡಿಸ್ಪ್ಯಾಚ್ ಕಾರ್ಯಗಳಿಗಾಗಿ 3B Llama 3.2 ಅತ್ಯಂತ ಪ್ರಾಯೋಗಿಕ ಆಯ್ಕೆಯಾಗಿ ಉಳಿಯುತ್ತದೆ, ಆದರೆ Muse Glimmer ಸಾಂದರ್ಭಿಕವಾಗಿ ಬರುವ ಆಳವಾದ ಚಿಂತನೆಯ ಸವಾಲುಗಳಿಗಾಗಿ ಬಳಸಬಹುದಾದ ಉನ್ನತ ಹಂತದ ಆಯ್ಕೆಯಾಗಿ ಉಳಿಯುತ್ತದೆ.
