Prism ML ಸಂಸ್ಥೆಯು Bonsai 27B ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದೆ, ಇದು ಮೊಬೈಲ್ ಫೋನಿನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬಲ್ಲ Qwen 3.6 ಲಾರ್ಜ್-ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾಡೆಲ್ನ ಒಂದು ಆವೃತ್ತಿಯಾಗಿದೆ. 1-bit quantization ಮೂಲಕ ಮೂಲ 54 GB ಗಾತ್ರದ ಮಾಡೆಲ್ ಅನ್ನು 4 GB ಗಿಂತ ಕಡಿಮೆ ಮಾಡುವ ಮೂಲಕ, ಕಂಪನಿಯು 14 ಪಟ್ಟು ಗಾತ್ರದ ಕಡಿತವನ್ನು ತಂದುಕೊಟ್ಟಿದೆ ಮತ್ತು ಬಳಕೆದಾರರು ಕ್ಲೌಡ್ API ಕರೆಗಳಿಲ್ಲದೆ ಮಾಡೆಲ್ ಅನ್ನು ಸ್ಥಳೀಯವಾಗಿ (locally) ಬಳಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.
ಸಂಕೋಚನ (compression) ಏಕೆ ಮುಖ್ಯ
LLMಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಡೆಸ್ಕ್ಟಾಪ್-ತರದ GPU ಅಥವಾ ಪಾವತಿಸಿದ API ಅನ್ನು ಬಯಸುತ್ತವೆ, ಏಕೆಂದರೆ ಅವುಗಳ weights ಡಜನ್ಗಟ್ಟಲೆ ಗಿಗಾಬೈಟ್ಗಳಷ್ಟು ಜಾಗವನ್ನು ಆಕ್ರಮಿಸುತ್ತವೆ. Quantization—ಪ್ರತಿ weight ಗೆ ಕಡಿಮೆ ಬಿಟ್ಗಳನ್ನು ಬಳಸುವುದು—ಮಾಡೆಲ್ನ ಗಾತ್ರವನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ ಆದರೆ ಜ್ಞಾನವನ್ನು ಕೂಡ ಕಡಿಮೆ ಮಾಡಬಹುದು. Bonsai ಎರಡು ವಿಭಿನ್ನ ಆವೃತ್ತಿಗಳನ್ನು ನೀಡುತ್ತದೆ: ಒಂದು ternary variant (ಮೂರು ಸಂಭವನೀಯ weight ಮೌಲ್ಯಗಳು, 7.2 GB) ಮತ್ತು ಇನ್ನೊಂದು ಹೆಚ್ಚು ತೀವ್ರವಾದ 1-bit variant (3.9 GB). ಗಾತ್ರ ಮತ್ತು ಸಾಮರ್ಥ್ಯದ ನಡುವಿನ ಈ ಸಮತೋಲನವೇ ಈ ಪರೀಕ್ಷೆಯ ಮುಖ್ಯ ಉದ್ದೇಶವಾಗಿದೆ.
ವಾಸ್ತವಿಕ ನೆನಪಿನ ಶಕ್ತಿಯಲ್ಲಿ (factual recall) ಮಾಡೆಲ್ಗಳು ಹೇಗೆ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ
ಪರೀಕ್ಷಕರ ಸರಣಿಯಲ್ಲಿ ಮೂಲ Qwen 3.6 ಪ್ರತಿಯೊಂದು ಐತಿಹಾಸಿಕ ದಿನಾಂಕದ ಪ್ರಶ್ನೆಗೂ ಸರಿಯಾಗಿ ಉತ್ತರಿಸಿತು. Ternary Bonsai ಆರು ಪ್ರಶ್ನೆಗಳಲ್ಲಿ ಐದನ್ನು ತಪ್ಪಿಸಿತು ಮತ್ತು 1-bit ಆವೃತ್ತಿಯು ಪ್ರತಿಯೊಂದು ದಿನಾಂಕದ ಪ್ರಶ್ನೆಯಲ್ಲೂ ವಿಫಲವಾಯಿತು. ನಿರೀಕ್ಷೆಯಂತೆ, ತೀವ್ರವಾದ ಸಂಕೋಚನವು (aggressive compression) ಅಪರೂಪದ ಮತ್ತು ನಿರ್ದಿಷ್ಟ ಸತ್ಯಗಳನ್ನು ಮೊದಲು ಕೈಬಿಡುತ್ತದೆ, ಮತ್ತು ಕೇವಲ ಭಾಷಾ ಪ್ರವಾಹವನ್ನು (fluency) ಕಾಪಾಡುವ ವಿಶಾಲವಾದ ಭಾಷಾ ಮಾದರಿಗಳನ್ನು ಮಾತ್ರ ಉಳಿಸಿಕೊಳ್ಳುತ್ತದೆ.
ಕೋಡಿಂಗ್ ಕಾರ್ಯಕ್ಷಮತೆ ವಿಭಿನ್ನ ಕಥೆಯನ್ನು ಹೇಳುತ್ತದೆ
ಪ್ರಾಂಪ್ಟ್ಗಳನ್ನು ಕೋಡಿಂಗ್ ಕಾರ್ಯಗಳಿಗೆ ಬದಲಾಯಿಸಿದಾಗ, ಫಲಿತಾಂಶಗಳು ಸಂಪೂರ್ಣವಾಗಿ ಬದಲಾದವು. ಮೂರೂ ಮಾಡೆಲ್ಗಳು ಕ್ಲಾಸಿಕ್ concurrency bugs ಗಳನ್ನು ಯಾವುದೇ ದೋಷವಿಲ್ಲದೆ ಪರಿಹರಿಸಿದವು. ಕಠಿಣವಾದ React animation ಸವಾಲಿನಲ್ಲಿ, 1-bit Bonsai ಕೇವಲ ಎರಡು ಪ್ರಯತ್ನಗಳಲ್ಲಿ ಕೆಲಸ ಮುಗಿಸಿತು, ಆದರೆ ಮೂಲ ಮಾಡೆಲ್ ಕೋಡ್ ಅನ್ನು ಪಾರ್ಸ್ ಮಾಡಲು ಹೆಚ್ಚಿನ ಸಮಯ ತೆಗೆದುಕೊಳ್ಳಬೇಕಾಗಿ ನಾಲ್ಕು ಪ್ರಯತ್ನಗಳ ಅಗತ್ಯವಿತ್ತು. Ternary ಆವೃತ್ತಿಯು ಹತ್ತು ಪ್ರಯತ್ನಗಳನ್ನು ಮಾಡಬೇಕಾಯಿತು ಮತ್ತು ಅಂತಿಮವಾಗಿ ಟೆಸ್ಟ್ ಸರ್ವರ್ ಅನ್ನು ಕ್ರ್ಯಾಶ್ ಮಾಡಿತು.
ಪ್ರಾಯೋಗಿಕ ಅಡೆತಡೆಗಳು
Bonsai ಜನಪ್ರಿಯ Ollama runtime ಮೇಲೆ ಕಾರ್ಯನಿರ್ವಹಿಸುವುದಿಲ್ಲ. 1-bit ಮಾಡೆಲ್ಗೆ Prism ML ಒದಗಿಸುವ ಕಸ್ಟಮ್ ಎಕ್ಸಿಕ್ಯೂಷನ್ ಲೇಯರ್ (custom execution layer) ಅಗತ್ಯವಿದೆ, ಆದ್ದರಿಂದ ಬಳಕೆದಾರರು ಇದನ್ನು ಕಾರ್ಯನಿರ್ವಹಿಸಲು ಅಸಂಪ್ರದಾಯಿಕ ಸಾಫ್ಟ್ವೇರ್ ಅನ್ನು ಇನ್ಸ್ಟಾಲ್ ಮಾಡಬೇಕಾಗುತ್ತದೆ. ಈ ಅವಲಂಬನೆಯು ತಮ್ಮ ಎನ್ವಿರಾನ್ಮೆಂಟ್ ಅನ್ನು ಬದಲಾಯಿಸಲು (tweaking) ಸಿದ್ಧರಿರುವವರಿಗೆ ಮಾತ್ರ ಈ ಮಾಡೆಲ್ ಅನ್ನು ಆಕರ್ಷಕವಾಗಿಸುತ್ತದೆ.
ಯಾರು Bonsai ಅನ್ನು ಪರಿಗಣಿಸಬೇಕು ಮತ್ತು ಯಾರು ದೂರವಿರಬೇಕು
- ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ಚಾಟ್ (General-purpose chat) – ವಾಸ್ತವಿಕ ವಿವರಗಳ ತೀವ್ರ ನಷ್ಟವು Bonsai ಅನ್ನು ಜ್ಞಾನದ ಮೂಲದ ಸಹಾಯಕನಾಗಿ (knowledge-base assistant) ಬಳಸಲು ಅಸಮರ್ಪಕವಾಗಿಸುತ್ತದೆ. ಇತಿಹಾಸ, ವಿಜ್ಞಾನ ಅಥವಾ ಪ್ರಚಲಿತ ಘಟನೆಗಳಿಗೆ ನಿಖರವಾದ ಉತ್ತರಗಳಿಗಾಗಿ, ಮೂಲ ಮಾಡೆಲ್ ಅಥವಾ ಕ್ಲೌಡ್ API ಅನ್ನು ಬಳಸಿ.
- ಸ್ಥಳೀಯ ಕೋಡಿಂಗ್ ಸಹಾಯಕ (Local coding aide) – ಕೋಡ್ ಸೂಚಿಸಲು, ಬಗ್ಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಮತ್ತು ಫೋನ್ ಅಥವಾ ಕಡಿಮೆ ಸಾಮರ್ಥ್ಯದ ಲ್ಯಾಪ್ಟಾಪ್ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಆಫ್ಲೈನ್ ಸಾಧನವನ್ನು ಬಯಸುವ ಡೆವಲಪರ್ಗಳಿಗೆ, 1-bit ಆವೃತ್ತಿಯು ವೇಗ ಮತ್ತು ಕಡಿಮೆ ಸ್ಟೋರೇಜ್ ವೆಚ್ಚವನ್ನು ನೀಡುತ್ತದೆ. ಇದು ಸ್ವಾಯತ್ತ ಏಜೆಂಟ್ (autonomous agent) ಅಲ್ಲ, ಆದರೆ ತರ್ಕ (logic) ಮತ್ತು ಸಿಂಟ್ಯಾಕ್ಸ್ ಅನ್ನು ಪರಿಣಾಮಕಾರಿಯಾಗಿ ನಿರ್ವಹಿಸುತ್ತದೆ.
ಅಂತಿಮ ತೀರ್ಮಾನ
54 GB LLM ಅನ್ನು ಫೋನ್ ಸ್ನೇಹಿ 3.9 GB ಗೆ ಸಂಕೋಚನಗೊಳಿಸಬಹುದು ಮತ್ತು ಆದರೂ ಅಚ್ಚರಿಯಷ್ಟು ವೇಗವಾದ, ಸಮರ್ಥ ಕೋಡ್ ಸೂಚನೆಗಳನ್ನು ಪಡೆಯಬಹುದು ಎಂಬುದನ್ನು Bonsai 27B ತೋರಿಸುತ್ತದೆ. ಇದರ ಬೆಲೆಯಾಗಿ ನಿರ್ದಿಷ್ಟ ವಾಸ್ತವಿಕ ನೆನಪಿನ ಶಕ್ತಿಯು ಸಂಪೂರ್ಣವಾಗಿ ಕುಸಿಯುತ್ತದೆ, ಆದ್ದರಿಂದ ಈ ಮಾಡೆಲ್ ವಿಶ್ವಕೋಶದ ಜ್ಞಾನಕ್ಕಿಂತ ಆಫ್ಲೈನ್ ವೇಗವನ್ನು ಮೌಲ್ಯೀಕರಿಸುವ ಡೆವಲಪರ್ಗಳ ಟೂಲ್ಬಾಕ್ಸ್ನಲ್ಲಿ ಇರಲು ಸೂಕ್ತವಾಗಿದೆ.
