VIDRAFT ನಿಂದ ಬಿಡುಗಡೆಯಾದ 35-ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ ಹೊಂದಿರುವ ಭಾಷಾ ಮಾದರಿಯಾದ POCKET-35B ಅನ್ನು ಈಗ ಕೇವಲ CPU ಹೊಂದಿರುವ ಲ್ಯಾಪ್‌ಟಾಪ್‌ನಲ್ಲಿ ಚಲಾಯಿಸಬಹುದು. ಈ ಮಾದರಿಯ GGUF-ಫಾರ್ಮ್ಯಾಟ್ ಮಾಡಲಾದ weights ಗಳನ್ನು llama.cpp ಅಥವಾ Ollama ಗೆ ನೇರವಾಗಿ ಲೋಡ್ ಮಾಡಬಹುದು, ಆದ್ದರಿಂದ ಯಾವುದೇ GPU ಬಜೆಟ್ ಇಲ್ಲದ ತಂಡಗಳು ಕೂಡ ತಕ್ಷಣವೇ ಪ್ರಯೋಗಗಳನ್ನು ಪ್ರಾರಂಭಿಸಬಹುದು. ಬಿಡುಗಡೆಯಾದ ಏಳು ವಾರಗಳಲ್ಲೇ ಈ ಮಾದರಿಯು Hugging Face ನಲ್ಲಿ ಒಂದು ಮಿಲಿಯನ್ ಡೌನ್‌ಲೋಡ್‌ಗಳನ್ನು ದಾಟಿದೆ ಮತ್ತು ವಿಶ್ವದಾದ್ಯಂತ ಎಲ್ಲಾ GGUF ಡೌನ್‌ಲೋಡ್‌ಗಳಲ್ಲಿ 13ನೇ ಸ್ಥಾನವನ್ನು ಪಡೆದುಕೊಂಡಿದೆ.

ಈಗ ಕೇವಲ CPU-ಆಧಾರಿತ LLM ಏಕೆ ಮುಖ್ಯವಾಗುತ್ತದೆ

ಗ್ರಾಹಕರ ಇಮೇಲ್‌ಗಳು, ಆಂತರಿಕ ಟಿಕೆಟ್‌ಗಳು, ಕೋಡ್ ಸ್ನಿಪ್ಪೆಟ್‌ಗಳಂತಹ ಸ್ವಂತ ಪಠ್ಯವನ್ನು (proprietary text) ಸ್ಥಳೀಯವಾಗಿ (on-premises) ಇರಿಸಿಕೊಳ್ಳಬೇಕಾದ ಉದ್ಯಮಗಳಿಗೆ ಹೆಚ್ಚಾಗಿ ಪ್ರತ್ಯೇಕ ಗ್ರಾಫಿಕ್ಸ್ ಕಾರ್ಡ್‌ಗಳಿಗಾಗಿ ಹಣದ ಕೊರತೆ ಇರುತ್ತದೆ. ಇತ್ತೀಚಿನವರೆಗೆ, ಡೇಟಾವನ್ನು ಕ್ಲೌಡ್-ಹೋಸ್ಟ್ ಮಾಡಲಾದ API ಗೆ ಕಳುಹಿಸುವುದು ಮಾತ್ರ ಏಕೈಕ ಪ್ರಾಯೋಗಿಕ ಆಯ್ಕೆಯಾಗಿತ್ತು, ಇದು ಗೌಪ್ಯತೆಯನ್ನು ಬಲಿ ಕೊಡುವಂತಾಗುತ್ತಿತ್ತು ಮತ್ತು ಪುನರಾವರ್ತಿತ ವೆಚ್ಚಗಳನ್ನು ಉಂಟುಮಾಡುತ್ತಿತ್ತು. POCKET-35B ಒಂದು ಮಧ್ಯಮ ಮಾರ್ಗವನ್ನು ಭರವಸೆ ನೀಡುತ್ತದೆ: ಇದು ಸಂಕೀರ್ಣ ಪ್ರಾಂಪ್ಟ್‌ಗಳನ್ನು (prompts) ನಿರ್ವಹಿಸಲು ಬೇಕಾದಷ್ಟು ದೊಡ್ಡದಾಗಿದೆ ಮತ್ತು ಸಾಮಾನ್ಯ ಕಚೇರಿ ಲ್ಯಾಪ್‌ಟಾಪ್ ಅಥವಾ ಮಿನಿ-ಪಿಸಿಯ ಮೆಮೊರಿ ಮಿತಿಯೊಳಗೆ ಹೊಂದಿಕೊಳ್ಳುತ್ತದೆ.

ಈ ಮಾದರಿಯು ಲ್ಯಾಪ್‌ಟಾಪ್‌ನಲ್ಲಿ ಹೇಗೆ ಹೊಂದಿಕೊಳ್ಳುತ್ತದೆ

  • GGUF format – ಇದು quantized weights ಗಳನ್ನು ಸಂಗ್ರಹಿಸುವ ಒಂದು ಬೈನರಿ ಕಂಟೈನರ್ ಆಗಿದೆ.
  • Compatibility – llama.cpp ಮತ್ತು Ollama ಎರಡೂ GGUF ಫೈಲ್‌ಗಳನ್ನು ಓದುವ ಮತ್ತು CPU ಗಳ ಮೇಲೆ inference ಅನ್ನು ಕಾರ್ಯಗತಗೊಳಿಸುವ runtimes ಗಳನ್ನು ಒಳಗೊಂಡಿವೆ. ಕೆಲವು ಲೇಯರ್‌ಗಳನ್ನು (layers) ಆಫ್‌ಲೋಡ್ ಮಾಡಲು ಇಂಟಿಗ್ರೇಟೆಡ್ GPU ಅನ್ನು ಬಳಸಬಹುದು, ಆದರೆ ಅದು ಕಡ್ಡಾಯವಲ್ಲ.
  • RAM check – GGUF ಫೈಲ್ ಗಾತ್ರವು ನಿಮಗೆ ಬೇಕಾಗುವ ಕನಿಷ್ಠ RAM ಪ್ರಮಾಣವಾಗಿದೆ. ಉದಾಹರಣೆಗೆ, ಫೈಲ್ ಗಾತ್ರವು ಕೆಲವು ಗಿಗಾಬೈಟ್‌ಗಳಿದ್ದರೆ, ಡೌನ್‌ಲೋಡ್ ಪ್ರಾರಂಭವಾಗುವ ಮೊದಲೇ ಕನಿಷ್ಠ ಅಷ್ಟು ಮುಕ್ತ ಮೆಮೊರಿ ಹೊಂದಿರುವ ಯಂತ್ರದ ಅಗತ್ಯವಿದೆ.

ನಿಮ್ಮ ಲ್ಯಾಪ್‌ಟಾಪ್‌ನಲ್ಲಿ POCKET-35B ಅನ್ನು ಚಲಾಯಿಸಲು ಹಂತಗಳು

  1. Verify memory – ನಿಮ್ಮ ಸಿಸ್ಟಮ್‌ನ ಟಾಸ್ಕ್ ಮ್ಯಾನೇಜರ್ ಅನ್ನು ತೆರೆಯಿರಿ, ಒಟ್ಟು RAM ಅನ್ನು ಗಮನಿಸಿ ಮತ್ತು ಅದನ್ನು Hugging Face ಪುಟದಲ್ಲಿ ಪಟ್ಟಿ ಮಾಡಲಾದ GGUF ಫೈಲ್ ಗಾತ್ರಕ್ಕೆ ಹೋಲಿಸಿ.
  2. Pick the right quantization – Q4 ಆವೃತ್ತಿಯೊಂದಿಗೆ ಪ್ರಾರಂಭಿಸಿ; ಇದು ಹೆಚ್ಚಿನ ಲ್ಯಾಪ್‌ಟಾಪ್‌ಗಳಿಗೆ ಗಾತ್ರ ಮತ್ತು ವೇಗವನ್ನು ಸಮತೋಲನಗೊಳಿಸುತ್ತದೆ.
  3. Download via llama.cpp or Ollama – ಎರಡೂ ಪರಿಕರಗಳು Hugging Face ನಿಂದ ನೇರವಾಗಿ ಮಾದರಿಯನ್ನು ಪಡೆಯಬಹುದು ಮತ್ತು checksum ಪರಿಶೀಲನೆಯನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ನಿರ್ವಹಿಸಬಹುದು.
  4. Run a quick sanity check – ಲೋಡಿಂಗ್ ಯಶಸ್ವಿಯಾಗಿದೆ ಎಂದು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಸರಳವಾದ “Hello, world” ಪ್ರಾಂಪ್ಟ್‌ನೊಂದಿಗೆ runtime ಅನ್ನು ಪ್ರಾರಂಭಿಸಿ.
  5. Create a realistic benchmark suite – ನಿಮ್ಮ ಪ್ರೊಡಕ್ಷನ್ ಕೆಲಸದ ಹೊರೆಯನ್ನು ಪ್ರತಿಬಿಂಬಿಸುವ 30-50 ಕಾರ್ಯಗಳನ್ನು ಸಂಗ್ರಹಿಸಿ (ಉದಾಹರಣೆಗೆ, ಟಿಕೆಟ್ ವರ್ಗಗಳನ್ನು ವರ್ಗೀಕರಿಸುವುದು, ಇಮೇಲ್ ಉತ್ತರಗಳನ್ನು ಸಿದ್ಧಪಡಿಸುವುದು). ಅವುಗಳನ್ನು ಮಾದರಿಯ ಮೂಲಕ ಚಲಾಯಿಸಿ ಮತ್ತು latency ಹಾಗೂ token-output ಗುಣಮಟ್ಟವನ್ನು ದಾಖಲಿಸಿ.
  6. Test language coverage – POCKET-35B ನ ಡಾಕ್ಯುಮೆಂಟೇಶನ್‌ನಲ್ಲಿ ಭಾಷೆಗಳ ಪಟ್ಟಿಯನ್ನು ನೀಡಿಲ್ಲ. ನಿಮಗೆ ವಿಯೆಟ್ನಾಮೀಸ್ ಅಥವಾ ಇತರ ಇಂಗ್ಲಿಷ್ ಅಲ್ಲದ ಲಿಪಿಗಳು ಬೇಕಾದಲ್ಲಿ, ಕೆಲವು ವಾಕ್ಯಗಳನ್ನು ನೀಡಿ ಮಾದರಿಯು ಸುಸಂಬದ್ಧವಾದ ಔಟ್‌ಪುಟ್ ನೀಡುತ್ತದೆಯೇ ಎಂದು ಗಮನಿಸಿ.
  7. Measure actual latency – ನಿಮ್ಮ ನಿರ್ದಿಷ್ಟ ಹಾರ್ಡ್‌ವೇರ್‌ನಲ್ಲಿ ಪ್ರತಿ ಪ್ರಾಂಪ್ಟ್ ಸಮಯವನ್ನು ದಾಖಲಿಸಿ; ವಿಭಿನ್ನ CPU ಅಥವಾ RAM ಬ್ಯಾಂಡ್‌ವಿಡ್ತ್ ಹೊಂದಿರುವ ಇತರ ಬಳಕೆದಾರರು ಪೋಸ್ಟ್ ಮಾಡಿದ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಸಂಖ್ಯೆಗಳನ್ನು ಅವಲಂಬಿಸಬೇಡಿ.

ಡೌನ್‌ಲೋಡ್ ಸಂಖ್ಯೆಗಳು ನಿಮಗೆ ತಿಳಿಸದ ವಿಷಯಗಳು

ಒಂದು ಮಿಲಿಯನ್ ಡೌನ್‌ಲೋಡ್‌ಗಳು ಸಮುದಾಯದ ಬಲವಾದ ಕುತೂಹಲವನ್ನು ಸೂಚಿಸುತ್ತವೆ, ಆದರೆ ಇದು ಖಚಿತವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸೂಚಿಸುವುದಿಲ್ಲ. ಮಾದರಿಯ ತಾರ್ಕಿಕ ಸಾಮರ್ಥ್ಯ (reasoning ability), ಕೋಡ್ ಜನರೇಷನ್ ಕೌಶಲ್ಯ ಮತ್ತು ಸೂಚನೆಗಳನ್ನು ಪಾಲಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಸ್ವತಂತ್ರವಾಗಿ ಪರಿಶೀಲಿಸಲಾಗಿಲ್ಲ. VIDRAFT ಮಾದರಿಯ ಆರ್ಕಿಟೆಕ್ಚರ್ ವಿವರಗಳನ್ನು ಅಥವಾ ತರಬೇತಿ ಡೇಟಾ ಮೂಲಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸಿಲ್ಲ, ಇದು ಮಾಹಿತಿಯ ಕೊರತೆಯನ್ನು ಉಂಟುಮಾಡುತ್ತದೆ ಮತ್ತು ಪ್ರೊಡಕ್ಷನ್ ನಿಯೋಜನೆಯನ್ನು (production deployment) ಅಪಾಯಕಾರಿಯಾಗಿಸುತ್ತದೆ.

ಅಪಾಯಗಳು ಮತ್ತು ವಿರೋಧಾತ್ಮಕ ವಾದಗಳು

  • Unclear quality – ಪ್ರಕಟವಾದ ಮೌಲ್ಯಮಾಪನ ಮಾನದಂಡಗಳಿಲ್ಲದೆ (evaluation metrics), POCKET-35B ಇತರ ಓಪನ್-ಸೋರ್ಸ್ ಪರ್ಯಾಯಗಳ ನಿಖರತೆಗೆ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ ಎಂದು ನೀವು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಸಾಧ್ಯವಿಲ್ಲ.
  • Production-grade uncertainties – ಆರ್ಕಿಟೆಕ್ಚರಲ್ ಪಾರದರ್ಶಕತೆಯ ಕೊರತೆಯು ವಿರೋಧಾತ್ಮಕ ಪ್ರಾಂಪ್ಟ್‌ಗಳು ಅಥವಾ ಎಡ್ಜ್-ಕೇಸ್ ಇನ್‌ಪುಟ್‌ಗಳ ಅಡಿಯಲ್ಲಿ ವರ್ತನೆಯನ್ನು ಊಹಿಸುವುದನ್ನು ಕಷ್ಟವಾಗಿಸುತ್ತದೆ.

ಅಂತಿಮ ತೀರ್ಮಾನ

ನಿಮ್ಮ ತಂಡವು ಇಂದು 35 B-ಪ್ಯಾರಾಮೀಟರ್ LLM ನೊಂದಿಗೆ ಪ್ರಯೋಗ ಮಾಡಬೇಕಾಗಿದ್ದು, GPU ವನ್ನು ಖರೀದಿಸಲು ಸಾಧ್ಯವಾಗದಿದ್ದರೆ, POCKET-35B ಒಂದು ಕಾರ್ಯಸಾಧ್ಯವಾದ, ಕಡಿಮೆ ವೆಚ್ಚದ ಪ್ರವೇಶವನ್ನು ನೀಡುತ್ತದೆ. ಈ ಮಾದರಿಯು GGUF ಫಾರ್ಮ್ಯಾಟ್ ಬಳಸಿ ಸಾಮಾನ್ಯ ಲ್ಯಾಪ್‌ಟಾಪ್‌ನಲ್ಲಿ ಚಲಿಸುತ್ತದೆ ಮತ್ತು ಓಪನ್-ಸೋರ್ಸ್ runtimes ಸೆಟಪ್ ಅನ್ನು ಸರಳಗೊಳಿಸುತ್ತದೆ. ಆದಾಗ್ಯೂ, ಈ ಮಾದರಿಯನ್ನು ಪ್ರಾಯೋಗಿಕವಾಗಿ ಪರಿಗಣಿಸಿ: ಯಾವುದೇ ಪ್ರೊಡಕ್ಷನ್ ಪೈಪ್‌ಲೈನ್‌ನಲ್ಲಿ ಅಳವಡಿಸುವ ಮೊದಲು ಮೆಮೊರಿ ಅಗತ್ಯತೆಗಳನ್ನು ಪರಿಶೀಲಿಸಿ, ನೈಜ ಕಾರ್ಯಗಳೊಂದಿಗೆ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಮಾಡಿ ಮತ್ತು ಭಾಷಾ ನಿರ್ವಹಣೆಯನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಿ. ಸಮುದಾಯದ ಡೇಟಾ ಸಂಗ್ರಹವಾಗುತ್ತಿದ್ದಂತೆ ಮತ್ತು VIDRAFT ಹೆಚ್ಚಿನ ವಿವರಗಳನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದಂತೆ, ಅಪಾಯದ ಸ್ವರೂಪವು ಸ್ಪಷ್ಟವಾಗುತ್ತದೆ—ಆದರೆ ಸದ್ಯಕ್ಕೆ, ಒಂದು ಸಾಮಾನ್ಯ ಲ್ಯಾಪ್‌ಟಾಪ್‌ನಲ್ಲಿ ನಿಜವಾಗಿಯೂ 35 B LLM ಅನ್ನು ಚಲಾಯಿಸಬಹುದು, ಆದರೆ ನಿರೀಕ್ಷೆಗಳನ್ನು ಮಿತಿಯಲ್ಲಿ ಇಟ್ಟುಕೊಳ್ಳುವುದು ಉತ್ತಮ.