ನೀವು Mac ನಲ್ಲಿ ಲೋಕಲ್ ಆಗಿ ಲಾರ್ಜ್ ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್‌ಗಳನ್ನು (LLMs) ರನ್ ಮಾಡುತ್ತಿದ್ದರೆ, ಒಂದೇ ರೀತಿಯ ಮಾಡೆಲ್‌ನಂತೆ ಕಾಣುವ ಎರಡು ವಿಭಿನ್ನ ಫೋಲ್ಡರ್‌ಗಳು ಏಕೆ ಇವೆ ಎಂದು ನೀವು ಡೌನ್‌ಲೋಡ್ ಪೇಜ್ ನೋಡಿ ಆಶ್ಚರ್ಯಪಟ್ಟಿರಬಹುದು. ಒಂದು .gguf ಎಂದು ಕೊನೆಗೊಳ್ಳುತ್ತದೆ ಮತ್ತು ಒಂದೇ ದೊಡ್ಡ ಫೈಲ್ ಆಗಿರುತ್ತದೆ. ಇನ್ನೊಂದು MLX ಡೈರೆಕ್ಟರಿಯಾಗಿದ್ದು, ಅದರಲ್ಲಿ weights ಫೈಲ್‌ಗಳು, ಟೋಕನೈಜರ್ ಮತ್ತು ಕೆಲವು JSON ಕಾನ್ಫಿಗರೇಶನ್‌ಗಳು ತುಂಬಿರುತ್ತವೆ. ಎರಡೂ Apple Silicon ಮೇಲೆ ಸಮರ್ಥವಾಗಿ ಕೆಲಸ ಮಾಡುತ್ತವೆ ಎಂದು ಹೇಳಿಕೊಳ್ಳುತ್ತವೆ. ಆದರೆ ಅವುಗಳಲ್ಲಿ ಕೇವಲ ಒಂದು ಮಾತ್ರ ನಿಜವಾಗಿಯೂ Apple ಪರಿಸರ ವ್ಯವಸ್ಥೆಯ (Apple garden) ಒಳಗೇ ಇರುತ್ತದೆ.

ಇದು ಕೇವಲ ಪ್ಯಾಕೇಜಿಂಗ್ ವ್ಯತ್ಯಾಸವಲ್ಲ. MLX ಮತ್ತು GGUF ನಡುವಿನ ಆಯ್ಕೆಯು ನಿಮ್ಮ ಮಾಡೆಲ್ ಎಷ್ಟು ವೇಗವಾಗಿ ರನ್ ಆಗುತ್ತದೆ, ಅದು ಎಷ್ಟು ಮೆಮೊರಿಯನ್ನು ಬಳಸುತ್ತದೆ ಮತ್ತು ನಿಮ್ಮ ಪ್ರಾಜೆಕ್ಟ್ ನಿಮ್ಮ ಲ್ಯಾಪ್‌ಟಾಪ್‌ನಿಂದ ಹೊರಬರಲು ಸಾಧ್ಯವೇ ಇಲ್ಲವೇ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ.

GGUF ಅಸಲಿಗೆ ಎಂದರೇನು

GGUF ಎಂಬುದು llama.cpp ಪರಿಸರ ವ್ಯವಸ್ಥೆಯಿಂದ ಬಂದಿದೆ. ಇದು ಮಾಡೆಲ್ weights, ಟೋಕನೈಜರ್ ವೊಕ್ಯಾಬ್ಯುಲರಿ, ಮೆಟಾಡೇಟಾ ಮತ್ತು ಹೈಪರ್‌ಪ್ಯಾರಾಮೀಟರ್‌ಗಳನ್ನು ಒಂದೇ ಸ್ವತಂತ್ರ ಫೈಲ್‌ನಲ್ಲಿ ಸಂಯೋಜಿಸುವ ಬೈನರಿ ಕಂಟೇನರ್ ಫಾರ್ಮ್ಯಾಟ್ ಆಗಿದೆ. ನೀವು ಒಂದೇ ಕ್ವಾಂಟೈಸ್ಡ್ (quantized) ಫೈಲ್ ಅನ್ನು ಪಡೆದು, ಅದನ್ನು ಒಂದು ಫೋಲ್ಡರ್‌ಗೆ ಹಾಕಿ, ಹೊಂದಾಣಿಕೆಯ ಲೋಡರ್ ಇರುವ ಯಾವುದೇ ಯಂತ್ರದಲ್ಲಿ ರನ್ ಮಾಡಬಹುದು. ಅಂದರೆ macOS ನಲ್ಲಿ Metal, Linux ಅಥವಾ Windows ನಲ್ಲಿ CUDA, ಮತ್ತು GPU ಲಭ್ಯವಿಲ್ಲದಿದ್ದರೆ Vulkan ಅಥವಾ CPU-only ಬ್ಯಾಕೆಂಡ್‌ಗಳೂ ಸಹ ಲಭ್ಯವಿರುತ್ತವೆ.

ಇಲ್ಲಿನ ನಿಜವಾದ ಲಾಭವೆಂದರೆ ಪೋರ್ಟಬಿಲಿಟಿ (portability). ಎಲ್ಲವೂ ಒಂದೇ ಫೈಲ್‌ನಲ್ಲಿ ಇರುವುದರಿಂದ, GGUF ಅನ್ನು ಸುಲಭವಾಗಿ ವರ್ಗಾಯಿಸಬಹುದು. ನೀವು ಏನನ್ನೂ ಮರು-ಡೌನ್‌ಲೋಡ್ ಮಾಡದೆ ಅದನ್ನು ನಿಮ್ಮ MacBook ನಿಂದ Linux ಸರ್ವರ್‌ಗೆ ವರ್ಗಾಯಿಸಬಹುದು. ನೀವು ಅದನ್ನು NAS ನಲ್ಲಿ ಆರ್ಕೈವ್ ಮಾಡಬಹುದು ಮತ್ತು ಒಂದು ವರ್ಷದ ನಂತರವೂ ಕೇವಲ ಒಂದು ಕಮಾಂಡ್ ಮೂಲಕ ಅದನ್ನು ಲೋಡ್ ಮಾಡಬಹುದು ಎಂದು ಖಚಿತವಾಗಿರಬಹುದು. ವಿವಿಧ ಹಾರ್ಡ್‌ವೇರ್‌ಗಳನ್ನು ಬಳಸುವ ತಂಡಗಳಿಗೆ ಅಥವಾ ಅಂತಿಮವಾಗಿ ಡೇಟಾ ಸೆಂಟರ್‌ಗೆ ನಿಯೋಜಿಸಬಹುದಾದ ಇನ್‌ಫ್ರಾಸ್ಟ್ರಕ್ಚರ್ ನಿರ್ಮಿಸುವವರಿಗೆ, ಈ ಸೌಲಭ್ಯಕ್ಕೆ ಸಾಟಿಯಿಲ್ಲ.

GGUF llama.cpp ಸಮುದಾಯದ ವರ್ಷಗಳ ಶ್ರಮದ ಕ್ವಾಂಟೈಸೇಶನ್ ಸಂಶೋಧನೆಯನ್ನು ಸಹ ಹೊಂದಿದೆ. Q4_K_M ಮತ್ತು Q5_K_M ನಂತಹ ಮಿಕ್ಸ್ಡ್-ಪ್ರಿಸಿಸನ್ ಸ್ಕೀಮ್‌ಗಳನ್ನು ಅತ್ಯಂತ ಕಡಿಮೆ ಬಿಟ್ ಅಗಲದಲ್ಲಿ ಗುಣಮಟ್ಟವನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಲು ಟ್ಯೂನ್ ಮಾಡಲಾಗಿದೆ. ನೀವು 70 ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್ ಅನ್ನು 40 ಗಿಗಾಬೈಟ್ ಡಿಸ್ಕ್ ಸ್ಪೇಸ್‌ಗೆ ಕುಗ್ಗಿಸುವಾಗ ಈ ತಾಂತ್ರಿಕತೆ ಬಹಳ ಮುಖ್ಯವಾಗುತ್ತದೆ.

MLX ಏನನ್ನು ಒದಗಿಸುತ್ತದೆ

MLX ಎಂಬುದು ಕೇವಲ ಒಂದು ಫೈಲ್ ಫಾರ್ಮ್ಯಾಟ್ ಅಲ್ಲ. ಇದು M-series ಚಿಪ್‌ಗಳಲ್ಲಿ ಮಷೀನ್ ಲರ್ನಿಂಗ್‌ಗಾಗಿ ವಿಶೇಷವಾಗಿ Apple ನಿರ್ಮಿಸಿದ ಅರೇ ಫ್ರೇಮ್‌ವರ್ಕ್ ಆಗಿದೆ. MLX ಮಾಡೆಲ್ ಸಾಮಾನ್ಯವಾಗಿ ಒಂದೇ ದೊಡ್ಡ ಫೈಲ್ ಆಗಿರದೆ, ಫೈಲ್‌ಗಳ ಒಂದು ಡೈರೆಕ್ಟರಿಯಾಗಿರುತ್ತದೆ. ಈ ಫ್ರೇಮ್‌ವರ್ಕ್ ನೇರವಾಗಿ Metal ಬ್ಯಾಕೆಂಡ್‌ಗೆ ಸಂವಹನ ನಡೆಸುತ್ತದೆ ಮತ್ತು CPU ಹಾಗೂ GPU ಮೆಮೊರಿಯನ್ನು ಒಂದೇ ಏಕೀಕೃತ ಪೂಲ್ (unified pool) ಆಗಿ ಪರಿಗಣಿಸುತ್ತದೆ. Apple Silicon ನಲ್ಲಿ, CPU ಮತ್ತು GPU ಒಂದೇ ಭೌತಿಕ ಮೆಮೊರಿ ಚಿಪ್‌ಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳುತ್ತವೆ, ಆದ್ದರಿಂದ ಪ್ರೊಸೆಸರ್ ಮತ್ತು ಗ್ರಾಫಿಕ್ಸ್ ಕಾರ್ಡ್ ನಡುವೆ ಡೇಟಾ ವರ್ಗಾವಣೆಯಾಗುವಾಗ ಸಾಂಪ್ರದಾಯಿಕವಾಗಿ ಆಗುವ ಹೆಚ್ಚಿನ ಡೇಟಾ ಕಾಪಿ ಮಾಡುವ ಪ್ರಕ್ರಿಯೆಯನ್ನು MLX ತಪ್ಪಿಸುತ್ತದೆ.

ಇಲ್ಲಿನ ಮಿತಿ ಸ್ಪಷ್ಟವಾಗಿದೆ: MLX Windows ನಲ್ಲಿ ಕೆಲಸ ಮಾಡುವುದಿಲ್ಲ. ಇದು Linux ನಲ್ಲಿ ಅಥವಾ CUDA ಯಂತ್ರಗಳಲ್ಲಿ ಕೆಲಸ ಮಾಡುವುದಿಲ್ಲ. ನಿಮ್ಮ ಕೆಲಸದ ಹರಿವು (workflow) ಎಂದಾದರೂ Apple ಪರಿಸರ ವ್ಯವಸ್ಥೆಯನ್ನು ಬಿಟ್ಟು ಹೊರಹೋದರೆ, ನೀವು ಮಾಡೆಲ್ ಅನ್ನು ಬೇರೆ ಫಾರ್ಮ್ಯಾಟ್‌ಗೆ ಪರಿವರ್ತಿಸಬೇಕಾಗುತ್ತದೆ ಅಥವಾ ಮರು-ಡೌನ್‌ಲೋಡ್ ಮಾಡಬೇಕಾಗುತ್ತದೆ.

ಸಂಪೂರ್ಣವಾಗಿ Mac Studio ಅಥವಾ MacBook Pro ಬಳಸುವ ಏಕಾಂಗಿ ಡೆವಲಪರ್‌ಗಳಿಗೆ ಈ ಮಿತಿಯು ದೊಡ್ಡ ಸಮಸ್ಯೆಯಲ್ಲದಿರಬಹುದು. ಆದರೆ ಇತರರಿಗೆ ಇದು ಒಂದು ದೊಡ್ಡ ಅಡ್ಡಿಯಾಗಿದೆ.

ಕಾರ್ಯಕ್ಷಮತೆ ಎಲ್ಲಿ ನಿಲ್ಲುತ್ತದೆ

Apple Silicon ನಲ್ಲಿ, MLX ಸಾಮಾನ್ಯವಾಗಿ ವೇಗವಾದ ಆಯ್ಕೆಯಾಗಿದೆ. ಒಂದೇ Mac ನಲ್ಲಿ Metal-backed ಇಂಜಿನ್ ಮೂಲಕ ಲೋಡ್ ಮಾಡಲಾದ GGUF ಗಿಂತ MLX 15 ರಿಂದ 40 ಪ್ರತಿಶತ ಹೆಚ್ಚು ವೇಗವಾಗಿ ರನ್ ಆಗುತ್ತದೆ ಎಂದು ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು ತೋರಿಸುತ್ತವೆ. ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಆ ವ್ಯತ್ಯಾಸವು 20 ಸೆಕೆಂಡುಗಳ ನಿಧಾನಗತಿಯ ಸ್ಟ್ರೀಮಿಂಗ್ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು 12 ಸೆಕೆಂಡುಗಳ ವೇಗದ ಪ್ರತಿಕ್ರಿಯೆಯನ್ನಾಗಿ ಬದಲಾಯಿಸುತ್ತದೆ. ದೀರ್ಘವಾದ ಕೋಡಿಂಗ್ ಸೆಷನ್ ಅಥವಾ ಬರವಣಿಗೆಯ ಕೆಲಸದ ಸಮಯದಲ್ಲಿ, ಆ ಸೆಕೆಂಡುಗಳು ಗಮನಾರ್ಹವಾದ ಸುಗಮ ಅನುಭವವನ್ನು ನೀಡುತ್ತವೆ.

ಮೆಮೊರಿ ಬಳಕೆಯೂ ಸಹ ಇದೇ ರೀತಿಯ ಮಾದರಿಯನ್ನು ಅನುಸರಿಸುತ್ತದೆ. MLX ಸಮಾನವಾದ GGUF ಮಾಡೆಲ್ ಗಿಂತ ಸುಮಾರು 10 ಪ್ರತಿಶತ ಕಡಿಮೆ RAM ಅನ್ನು ಬಳಸುತ್ತದೆ. ಈ ಉಳಿತಾಯವು ಏಕೀಕೃತ ಮೆಮೊರಿ ಆರ್ಕಿಟೆಕ್ಚರ್ ಮತ್ತು ಹೆಚ್ಚುವರಿ ಬಫರ್ ಕಾಪಿಗಳ ಅನುಪಸ್ಥಿತಿಯಿಂದ ಬರುತ್ತದೆ. 64 GB RAM ಇರುವ ಯಂತ್ರದಲ್ಲಿ, 10 ಪ್ರತಿಶತವು ಹೆಚ್ಚಿನ ಸ್ಥಳಾವಕಾಶವನ್ನು ನೀಡುತ್ತದೆ. ಆದರೆ 32 GB Mac ನಲ್ಲಿ, ಇದು 13B ಮಾಡೆಲ್ ಅನ್ನು ಸುಲಭವಾಗಿ ಬಳಸಲು ಅಥವಾ 'swap' ಸಮಸ್ಯೆಯನ್ನು ಎದುರಿಸಲು ನಡುವಿನ ವ್ಯತ್ಯಾಸವಾಗಬಹುದು.

ಆದರೆ ಗುಣಮಟ್ಟದಲ್ಲಿ ಸ್ವಲ್ಪ ವ್ಯತ್ಯಾಸವಿರುತ್ತದೆ. 4-bit ಕ್ವಾಂಟೈಸೇಶನ್‌ನಲ್ಲಿ, Q4_K_M ವಿಧಾನವನ್ನು ಬಳಸುವ ಉತ್ತಮವಾಗಿ ಟ್ಯೂನ್ ಮಾಡಲಾದ GGUF ಫೈಲ್, ಸಾಮಾನ್ಯ 4-bit MLX ಪರಿವರ್ತನೆಗಿಂತ ಸ್ವಲ್ಪ ಉತ್ತಮವಾದ ಔಟ್‌ಪುಟ್ ಗುಣಮಟ್ಟವನ್ನು (fidelity) ನೀಡುತ್ತದೆ. GGUF ನಲ್ಲಿರುವ ಮಿಕ್ಸ್ಡ್-ಪ್ರಿಸಿಸನ್ ತಂತ್ರಗಳು ಸಾವಿರಾರು ಬಳಕೆದಾರರ ಪರೀಕ್ಷೆಗಳ ಮೂಲಕ ಸುಧಾರಿಸಲ್ಪಟ್ಟಿವೆ. ನಿಮ್ಮ ಕೆಲಸವು ನಿಖರವಾದ ತರ್ಕ (reasoning), ಕೋಡಿಂಗ್ ಸಿಂಟ್ಯಾಕ್ಸ್ ಅಥವಾ ಸೂಕ್ಷ್ಮ ಸೂಚನೆಗಳನ್ನು ಪಾಲಿಸುವುದನ್ನು ಒಳಗೊಂಡಿದ್ದರೆ, ಕೇವಲ ವೇಗಕ್ಕಿಂತ ಗುಣಮಟ್ಟದ ಆ ಸಣ್ಣ ವ್ಯತ್ಯಾಸವು ಹೆಚ್ಚು ಮುಖ್ಯವಾಗಬಹುದು.

ನೈಜ ಸನ್ನಿವೇಶಗಳು, ನೈಜ ಆಯ್ಕೆಗಳು

ನಿಮ್ಮ ಬಳಿ M3 Pro MacBook ಮತ್ತು 36 GB ಏಕೀಕೃತ ಮೆಮೊರಿ ಇದೆ ಎಂದು ಊಹಿಸಿಕೊಳ್ಳಿ. ನೀವು ದಿನವಿಡೀ VS Code ಒಳಗೆ ಲೋಕಲ್ ಕೋಡಿಂಗ್ ಅಸಿಸ್ಟೆಂಟ್ ಅನ್ನು ರನ್ ಮಾಡುತ್ತೀರಿ. ನೀವು ಎಂದಿಗೂ Windows ಯಂತ್ರವನ್ನು ಬಳಸುವುದಿಲ್ಲ. ಅಂತಹ ಸಂದರ್ಭದಲ್ಲಿ MLX ಸೂಕ್ತವಾಗಿದೆ. ಅದರ ಹೆಚ್ಚಿನ ವೇಗವು ಆಟೋ-ಕಂಪ್ಲೀಟ್ (autocomplete) ಅನ್ನು ತಕ್ಷಣವೇ ನಡೆಯುವಂತೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಮೆಮೊರಿ ಉಳಿತಾಯವು ನಿಮ್ಮ ಸಿಸ್ಟಮ್ ಮೇಲೆ ಒತ್ತಡವಿಲ್ಲದೆ ಐವತ್ತು ಟ್ಯಾಬ್‌ಗಳೊಂದಿಗೆ ಬ್ರೌಸರ್ ಅನ್ನು ತೆರೆದಿಡಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.

ಈಗ 16 GB RAM ಹೊಂದಿರುವ ಬೇಸ್ M1 MacBook Air ಬಳಸುವ ಒಬ್ಬ ಸಂಶೋಧಕನನ್ನು ಕಲ್ಪಿಸಿಕೊಳ್ಳಿ. ಅವರು ಆಗಾಗ್ಗೆ NVIDIA ಕಾರ್ಡ್‌ಗಳನ್ನು ಹೊಂದಿರುವ ಇಲಾಖೆಯ Linux ಸರ್ವರ್‌ನಲ್ಲಿ ಅದೇ ಅನಾಲಿಸಿಸ್ ನೋಟ್‌ಬುಕ್ ಅನ್ನು ರನ್ ಮಾಡಬೇಕಾಗುತ್ತದೆ. ಅಂತಹ ಸಂದರ್ಭದಲ್ಲಿ GGUF ಅತ್ಯಂತ ಸ್ಪಷ್ಟವಾದ ಆಯ್ಕೆಯಾಗಿದೆ. ಸಿಂಗಲ್ ಫೈಲ್ ಬ್ಯಾಕಪ್‌ಗಳನ್ನು ಸುಲಭಗೊಳಿಸುತ್ತದೆ ಮತ್ತು mixed-precision quantization ಸೀಮಿತ ಮೆಮೊರಿಯಿಂದ ಅತ್ಯುತ್ತಮ ಗುಣಮಟ್ಟವನ್ನು ಹೊರತೆಗೆಯುತ್ತದೆ. ಅವರು ಸರ್ವರ್‌ಗೆ SSH ಮಾಡಿದಾಗ, ಯಾವುದೇ ಫಾರ್ಮ್ಯಾಟ್ ಪರಿವರ್ತನೆಯಿಲ್ಲದೆ ಅಚ್ಚುಕಟ್ಟಾಗಿ ಅದೇ ವೇಯ್ಟ್‌ಗಳನ್ನು (weights) ರನ್ ಮಾಡಬಹುದು.

ಅಥವಾ ડેಸ್ಕ್‌ಟಾಪ್ AI ಟೂಲ್ ನಿರ್ಮಿಸುತ್ತಿರುವ ಒಂದು ಸಣ್ಣ ಸ್ಟಾರ್ಟ್‌ಅಪ್ ಅನ್ನು ಪರಿಗಣಿಸಿ. ಅವರು Mac ಗಳಲ್ಲಿ ಪ್ರೊಟೊಟೈಪ್ ಮಾಡುತ್ತಾರೆ ಆದರೆ ಅವರ ಗ್ರಾಹಕರು Windows ಲ್ಯಾಪ್‌ಟಾಪ್‌ಗಳು ಮತ್ತು Linux ವರ್ಕ್‌ಸ್ಟೇಷನ್‌ಗಳ ಮಿಶ್ರಣವನ್ನು ಬಳಸುತ್ತಾರೆ ಎಂದು ಅವರಿಗೆ ತಿಳಿದಿದೆ. ಆರಂಭದಲ್ಲೇ MLX ಮೇಲೆ ಅವಲಂಬಿತವಾಗುವುದು ಅವರನ್ನು ಕಠಿಣ ಪರಿಸ್ಥಿತಿಗೆ ತಳ್ಳಬಹುದು. GGUF ಅವರ ನಿಯೋಜನೆ (deployment) ಆಯ್ಕೆಗಳನ್ನು ಮುಕ್ತವಾಗಿಡುತ್ತದೆ. ಒಂದು ಫೈಲ್. ಒಂದು ಪೈಪ್‌ಲೈನ್. ಪ್ರತಿಯೊಂದು ಪ್ಲಾಟ್‌ಫಾರ್ಮ್.

ಹೇಗೆ ನಿರ್ಧರಿಸುವುದು

ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳಿಗಿಂತ ನಿಮ್ಮ ಹಾರ್ಡ್‌ವೇರ್ ಮತ್ತು ನಿಮ್ಮ ಭವಿಷ್ಯದ ಯೋಜನೆಗಳು ಹೆಚ್ಚು ಮುಖ್ಯವಾಗಿವೆ.

ನೀವು 32 GB ಅಥವಾ ಅದಕ್ಕಿಂತ ಹೆಚ್ಚು ಮೆಮೊರಿ ಹೊಂದಿರುವ ಆಧುನಿಕ M-series Mac ಅನ್ನು ಹೊಂದಿದ್ದರೆ, ನಿಮಗೆ ಕೇವಲ ಲೋಕಲ್ ಪರ್ಫಾರ್ಮೆನ್ಸ್ ಮುಖ್ಯವಾಗಿದ್ದರೆ ಮತ್ತು ನಿಮ್ಮ ಪ್ರಾಜೆಕ್ಟ್ ಎಂದಿಗೂ Apple ಅಲ್ಲದ ಯಂತ್ರದಲ್ಲಿ ರನ್ ಆಗುವ ಅಗತ್ಯವಿಲ್ಲದಿದ್ದರೆ MLX ಅನ್ನು ಆರಿಸಿ. ಇದರ ವೇಗವರ್ಧನೆಯು ನಿಜವಾದದ್ದು ಮತ್ತು ಯೂನಿಫೈಡ್ ಮೆಮೊರಿ ಇಂಟಿಗ್ರೇಷನ್ ಅತ್ಯಂತ ಸುಂದರವಾಗಿದೆ.

ನಿಮ್ಮ ಬಳಿ 16 GB ಅಥವಾ ಅದಕ್ಕಿಂತ ಕಡಿಮೆ RAM ಇದ್ದರೆ, ನೀವು macOS ಮತ್ತು Linux ಎರಡರಲ್ಲೂ ಕೆಲಸ ಮಾಡುತ್ತಿದ್ದರೆ, ಅಥವಾ ಒಂದು ದಿನ ಸರ್ವರ್‌ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವಂತಹ ಯಾವುದನ್ನಾದರೂ ನೀವು ನಿರ್ಮಿಸುತ್ತಿದ್ದರೆ GGUF ಅನ್ನು ಆರಿಸಿ. ನೀವು ಅತ್ಯಂತ ಸರಳವಾದ ಸೆಟಪ್ ಬಯಸುತ್ತಿದ್ದರೆ ಇದು ಉತ್ತಮ ಆಯ್ಕೆಯಾಗಿದೆ: ಒಂದು ಫೈಲ್, ಒಂದು ಮಾಡೆಲ್, ಯಾವುದೇ ಡಿಪೆಂಡೆನ್ಸಿ ತಲೆನೋವುಗಳಿಲ್ಲ.

ವೇಗವನ್ನು ಸ್ಟಾಪ್‌ವಾಚ್‌ನೊಂದಿಗೆ ಅಳೆಯುವುದು ಸುಲಭ. ಪೋರ್ಟಬಿಲಿಟಿ (Portability) ಕಣ್ಮರೆಯಾದಾಗ ಮಾತ್ರ ಅದರ ಪ್ರಾಮುಖ್ಯತೆ ತಿಳಿಯುತ್ತದೆ. ಒಂದು ವರ್ಷದವರೆಗೆ ಕೇವಲ MLX ಪೈಪ್‌ಲೈನ್ ಅನ್ನು ನಿರ್ಮಿಸಿ, ನೀವು ಇನ್ಫರೆನ್ಸ್ ಅನ್ನು (inference) CUDA ಸರ್ವರ್‌ಗೆ ವರ್ಗಾಯಿಸಬೇಕಾದ ದಿನ, ನೀವು ಅಡಚಣೆಯನ್ನು ಅನುಭವಿಸುತ್ತೀರಿ. ನಿಮ್ಮ ಪ್ರಾಜೆಕ್ಟ್ ಅನ್ನು ಯಾವಾಗಲೂ MacBook ನಲ್ಲಿಯೇ ಇರಿಸಿಕೊಂಡರೆ, ನೀವು ಹಿಂತಿರುಗಿ ನೋಡದೆ MLX ವೇಗವರ್ಧನೆಯ ಪ್ರತಿ ಕ್ಷಣವನ್ನೂ ಆನಂದಿಸಬಹುದು.

ಅಂತಿಮ ತೀರ್ಮಾನ

32 GB ಅಥವಾ ಅದಕ್ಕಿಂತ ದೊಡ್ಡ Mac ನಲ್ಲಿ ವೈಯಕ್ತಿಕ ಬಳಕೆ? MLX ನಿಮಗೆ ಅತ್ಯುತ್ತಮ ನೇಟಿವ್ ಅನುಭವವನ್ನು ನೀಡುತ್ತದೆ. 16 GB ನೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುವುದು, ಆಪರೇಟಿಂಗ್ ಸಿಸ್ಟಮ್‌ಗಳನ್ನು ಬದಲಾಯಿಸುವುದು ಅಥವಾ ಸರ್ವರ್‌ಗೆ ಕಳುಹಿಸುವುದು? GGUF ಹೆಚ್ಚು ಸುರಕ್ಷಿತ ಮತ್ತು ನಮ್ಯತೆಯ (flexible) ಆಯ್ಕೆಯಾಗಿದೆ. ನಿಮಗೆ ನಿಜವಾಗಿಯೂ ನಿರ್ಧರಿಸಲು ಸಾಧ್ಯವಾಗದಿದ್ದರೆ, GGUF ಅನ್ನು ಡಿಫಾಲ್ಟ್ ಆಗಿ ಬಳಸಿ. ನೀವು Apple Silicon ನಲ್ಲಿ ಸ್ವಲ್ಪ ವೇಗವನ್ನು ಕಳೆದುಕೊಳ್ಳಬಹುದು, ಆದರೆ ಎಲ್ಲಿ ಬೇಕಾದರೂ ಹೋಗುವ ಸ್ವಾತಂತ್ರ್ಯವನ್ನು ಪಡೆಯುತ್ತೀರಿ.

Source: MLX vs GGUF on Apple Silicon: Which local LLM format should you actually use?

ಇತರರೊಂದಿಗೆ ಲೋಕಲ್ LLMಗಳ ಬಗ್ಗೆ ಮಾತನಾಡಲು ಬಯಸುವಿರಾ