Ollama RC अपडेट: Qwen3.5 और स्ट्रीमिंग सुधार
Ollama v0.32.6-rc0 जारी हो गया है। यह Apple GPU उपयोगकर्ताओं के लिए अपडेट लाता है और स्ट्रीमिंग संबंधी समस्याओं को ठीक करता है।
Apple उपयोगकर्ताओं के लिए नए फीचर्स: MLX इंजन अब Qwen3.5 के साथ speculative decoding के लिए MTP head का उपयोग करता है। यह प्रक्रिया टोकन का पहले से अनुमान लगा लेती है। मुख्य मॉडल उन्हें बैचों में सत्यापित करता है। इससे decoding के दौरान प्रतीक्षा समय कम हो जाता है।
Ollama का कहना है कि इससे Qwen3.5 तेज़ हो जाता है। उन्होंने नोट्स में कोई विशिष्ट बेंचमार्क या गति प्रतिशत प्रदान नहीं किया है। अपने स्वयं के परीक्षण के बिना गति में किसी विशिष्ट वृद्धि का अनुमान न लगाएं।
स्ट्रीमिंग कम्पैटिबिलिटी: यह अपडेट /v1/chat/completions endpoint द्वारा स्ट्रीमिंग को संभालने के तरीके को बदल देता है। यदि आपका सॉफ़्टवेयर विशिष्ट chunks या finish_reason डेटा पर निर्भर करता है, तो पहले इसका परीक्षण करें। प्रोडक्शन वर्कफ़्लो के लिए पूर्वानुमानित व्यवहार (predictable behavior) गति जितना ही महत्वपूर्ण है।
महत्वपूर्ण चेतावनियाँ:
- यह एक release candidate है। यह एक stable वर्ज़न नहीं है।
- एक्सपेरिमेंटल इमेज जनरेशन अस्थायी रूप से हटा दिया गया है।
- यदि आपको इमेज जनरेशन की आवश्यकता है, तो वर्ज़न 0.32.5 पर ही रहें।
आगे कैसे बढ़ें:
- यदि आप Apple GPU का उपयोग करते हैं और बेहतर Qwen3.5 परफॉरमेंस चाहते हैं, तो अभी इसका परीक्षण करें।
- यदि आपको इमेज जनरेशन या उच्च स्थिरता (high stability) की आवश्यकता है, तो stable रिलीज़ का इंतज़ार करें।
- prefill और decode स्पीड को अलग-अलग मापें। MTP decoding में मदद करता है लेकिन यह हर कार्य के लिए कुल लेटेंसी (latency) को नहीं बदल सकता है।
वैकल्पिक लर्निंग कम्युनिटी: https://t.me/GyaanSetuAi
