Ollama RC ಅಪ್ಡೇಟ್: Qwen3.5 ಮತ್ತು ಸ್ಟ್ರೀಮಿಂಗ್ ಸರಿಪಡಿಸುವಿಕೆಗಳು
Ollama v0.32.6-rc0 ಬಿಡುಗಡೆಯಾಗಿದೆ. ಇದು Apple GPU ಬಳಕೆದಾರರಿಗಾಗಿ ಅಪ್ಡೇಟ್ಗಳನ್ನು ತರುತ್ತದೆ ಮತ್ತು ಸ್ಟ್ರೀಮಿಂಗ್ ಸಮಸ್ಯೆಗಳನ್ನು ಸರಿಪಡಿಸುತ್ತದೆ.
Apple ಬಳಕೆದಾರರಿಗಾಗಿ ಹೊಸ ವೈಶಿಷ್ಟ್ಯಗಳು: MLX engine ಈಗ Qwen3.5 ನೊಂದಿಗೆ speculative decoding ಗಾಗಿ MTP head ಅನ್ನು ಬಳಸುತ್ತದೆ. ಈ ಪ್ರಕ್ರಿಯೆಯು ಟೋಕನ್ಗಳನ್ನು ಮುಂಚಿತವಾಗಿ ಅಂದಾಜಿಸುತ್ತದೆ. ಮುಖ್ಯ ಮಾಡೆಲ್ ಅವುಗಳನ್ನು ಬ್ಯಾಚ್ಗಳಲ್ಲಿ ಪರಿಶೀಲಿಸುತ್ತದೆ. ಇದು ಡಿಕೋಡಿಂಗ್ ಸಮಯದಲ್ಲಿ ಕಾಯುವ ಸಮಯವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
ಇದು Qwen3.5 ಅನ್ನು ವೇಗಗೊಳಿಸುತ್ತದೆ ಎಂದು Ollama ತಿಳಿಸಿದೆ. ಅವರು ನೋಟ್ಸ್ಗಳಲ್ಲಿ ನಿರ್ದಿಷ್ಟ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ಅಥವಾ ವೇಗದ ಶೇಕಡಾವಾರು ಪ್ರಮಾಣವನ್ನು ನೀಡಿಲ್ಲ. ನಿಮ್ಮ ಸ್ವಂತ ಪರೀಕ್ಷೆಗಳಿಲ್ಲದೆ ನಿರ್ದಿಷ್ಟ ವೇಗದ ಹೆಚ್ಚಳವನ್ನು ಊಹಿಸಬೇಡಿ.
ಸ್ಟ್ರೀಮಿಂಗ್ ಹೊಂದಾಣಿಕೆ (Streaming Compatibility): ಈ ಅಪ್ಡೇಟ್ /v1/chat/completions endpoint ಸ್ಟ್ರೀಮಿಂಗ್ ಅನ್ನು ಹೇಗೆ ನಿರ್ವಹಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ. ನಿಮ್ಮ ಸಾಫ್ಟ್ವೇರ್ ನಿರ್ದಿಷ್ಟ chunks ಅಥವಾ finish_reason ಡೇಟಾವನ್ನು ಅವಲಂಬಿಸಿದ್ದರೆ, ಮೊದಲು ಅದನ್ನು ಪರೀಕ್ಷಿಸಿ. ಪ್ರೊಡಕ್ಷನ್ ವರ್ಕ್ಫ್ಲೋಗಳಿಗೆ ವೇಗದಷ್ಟೇ ಮುನ್ಸೂಚನೆ ನೀಡಬಹುದಾದ ನಡವಳಿಕೆಯೂ (predictable behavior) ಮುಖ್ಯವಾಗಿದೆ.
ಪ್ರಮುಖ ಎಚ್ಚರಿಕೆಗಳು:
- ಇದು release candidate ಆಗಿದೆ. ಇದು ಸ್ಥಿರವಾದ (stable) ಆವೃತ್ತಿಯಲ್ಲ.
- ಪ್ರಾಯೋಗಿಕ image generation ತಾತ್ಕಾಲಿಕವಾಗಿ ಇಲ್ಲಿದೆ.
- ನಿಮಗೆ image generation ಅಗತ್ಯವಿದ್ದರೆ 0.32.5 ಆವೃತ್ತಿಯಲ್ಲೇ ಇರಿ.
ಹೇಗೆ ಮುಂದುವರಿಯುವುದು:
- ನೀವು Apple GPU ಬಳಸುತ್ತಿದ್ದರೆ ಮತ್ತು ಉತ್ತಮ Qwen3.5 ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಬಯಸಿದರೆ ಈಗಲೇ ಇದನ್ನು ಪರೀಕ್ಷಿಸಿ.
- ನಿಮಗೆ image generation ಅಥವಾ ಹೆಚ್ಚಿನ ಸ್ಥಿರತೆ ಬೇಕಿದ್ದರೆ stable release ಗಾಗಿ ಕಾಯಿರಿ.
- prefill ಮತ್ತು decode ವೇಗಗಳನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಅಳೆಯಿರಿ. MTP ಡಿಕೋಡಿಂಗ್ಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ ಆದರೆ ಪ್ರತಿ ಕಾರ್ಯಕ್ಕೂ ಒಟ್ಟು latency ಬದಲಾಗದಿರಬಹುದು.
ಮೂಲ (Source): https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3
ಐಚ್ಛಿಕ ಕಲಿಕಾ ಸಮುದಾಯ (Optional learning community): https://t.me/GyaanSetuAi
