Ollama RC अपडेट: Qwen3.5 आणि स्ट्रीमिंगमधील सुधारणा
Ollama v0.32.6-rc0 उपलब्ध झाले आहे. हे Apple GPU वापरकर्त्यांसाठी अपडेट्स आणि स्ट्रीमिंगमधील समस्यांचे निराकरण घेऊन आले आहे.
Apple वापरकर्त्यांसाठी नवीन वैशिष्ट्ये: MLX इंजिन आता Qwen3.5 सोबत speculative decoding साठी MTP head वापरते. ही प्रक्रिया टोकन्सचे आगाऊ भाकीत (predict) करते. मुख्य मॉडेल बॅचेसमध्ये त्यांची पडताळणी करते. यामुळे decoding दरम्यानचा प्रतीक्षा वेळ कमी होतो.
Ollama नुसार यामुळे Qwen3.5 अधिक वेगवान होते. त्यांनी नोट्समध्ये विशिष्ट बेंचमार्क किंवा वेगाची टक्केवारी दिलेली नाही. स्वतःच्या चाचण्यांशिवाय वेगातील विशिष्ट वाढ गृहीत धरू नका.
स्ट्रीमिंग सुसंगतता: हे अपडेट /v1/chat/completions endpoint स्ट्रीमिंग हाताळण्याची पद्धत बदलते. जर तुमचे सॉफ्टवेअर विशिष्ट chunks किंवा finish_reason डेटावर अवलंबून असेल, तर आधी त्याची चाचणी घ्या. प्रोडक्शन वर्कफ्लोसाठी वेगाइतकीच वर्तणुकीची (behavior) अंदाज येण्यासारखी क्षमता देखील महत्त्वाची असते.
महत्त्वाच्या चेतावण्या:
- हे एक release candidate आहे. ही स्थिर (stable) आवृत्ती नाही.
- प्रायोगिक इमेज जनरेशन (image generation) तात्पुरते काढून टाकण्यात आले आहे.
- तुम्हाला इमेज जनरेशनची आवश्यकता असल्यास आवृत्ती 0.32.5 वरच राहा.
पुढील पावले:
- जर तुम्ही Apple GPU वापरत असाल आणि तुम्हाला Qwen3.5 ची चांगली कामगिरी हवी असेल, तर आताच याची चाचणी घ्या.
- जर तुम्हाला इमेज जनरेशन किंवा उच्च स्थिरता (high stability) हवी असेल, तर स्थिर आवृत्तीची (stable release) प्रतीक्षा करा.
- prefill आणि decode वेग स्वतंत्रपणे मोजा. MTP decoding मध्ये मदत करते परंतु प्रत्येक कार्यासाठी एकूण latency बदलणार नाही.
ऐच्छिक लर्निंग कम्युनिटी: https://t.me/GyaanSetuAi
