Ollama RC അപ്ഡേറ്റ്: Qwen3.5-ഉം സ്ട്രീമിംഗ് പരിഹാരങ്ങളും
Ollama v0.32.6-rc0 പുറത്തിറങ്ങിയിരിക്കുന്നു. ഇത് Apple GPU ഉപയോക്താക്കൾക്കായി പുതിയ അപ്ഡേറ്റുകളും സ്ട്രീമിംഗ് പ്രശ്നത്തിനുള്ള പരിഹാരങ്ങളും നൽകുന്നു.
Apple ഉപയോക്താക്കൾക്കായുള്ള പുതിയ ഫീച്ചറുകൾ: MLX എഞ്ചിൻ ഇപ്പോൾ Qwen3.5-ൽ speculative decoding-നായി MTP head ഉപയോഗിക്കുന്നു. ഈ പ്രക്രിയ ടോക്കണുകളെ മുൻകൂട്ടി പ്രവചിക്കുന്നു. പ്രധാന മോഡൽ അവയെ ബാച്ചുകളായി പരിശോധിക്കുന്നു. ഇത് ഡീകോഡിംഗ് സമയത്തെ കാത്തിരിപ്പ് കുറയ്ക്കുന്നു.
ഇത് Qwen3.5-ന്റെ വേഗത വർദ്ധിപ്പിക്കുമെന്ന് Ollama പ്രസ്താവിക്കുന്നു. എന്നാൽ കുറിപ്പുകളിൽ പ്രത്യേക ബെഞ്ച്മാർക്കുകളോ (benchmarks) വേഗതയുടെ ശതമാനമോ അവർ നൽകിയിട്ടില്ല. സ്വന്തമായി പരിശോധിക്കാതെ വേഗതയിൽ വലിയ വർദ്ധനവുണ്ടാകുമെന്ന് കരുതരുത്.
സ്ട്രീമിംഗ് കംപാറ്റിബിലിറ്റി (Streaming Compatibility): /v1/chat/completions എൻഡ്പോയിന്റ് സ്ട്രീമിംഗ് കൈകാര്യം ചെയ്യുന്ന രീതി ഈ അപ്ഡേറ്റ് മാറ്റുന്നു. നിങ്ങളുടെ സോഫ്റ്റ്വെയർ പ്രത്യേക chunks അല്ലെങ്കിൽ finish_reason ഡാറ്റയെ ആശ്രയിച്ചാണെങ്കിൽ, ആദ്യം അത് പരിശോധിക്കുക. പ്രൊഡക്ഷൻ വർക്ക്ഫ്ലോകളിൽ വേഗത പോലെ തന്നെ പ്രധാനമാണ് പ്രവചിക്കാവുന്ന പെരുമാറ്റവും (predictable behavior).
പ്രധാന മുന്നറിയിപ്പുകൾ:
- ഇതൊരു റിലീസ് കാൻഡിഡേറ്റ് (release candidate) ആണ്. ഇതൊരു സ്റ്റേബിൾ വേർഷനല്ല.
- പരീക്ഷണാടിസ്ഥാനത്തിലുള്ള ഇമേജ് ജനറേഷൻ താൽക്കാലികമായി ഒഴിവാക്കിയിട്ടുണ്ട്.
- നിങ്ങൾക്ക് ഇമേജ് ജനറേഷൻ ആവശ്യമുണ്ടെങ്കിൽ 0.32.5 വേർഷനിൽ തന്നെ തുടരുക.
എങ്ങനെ മുന്നോട്ട് പോകാം:
- നിങ്ങൾ ഒരു Apple GPU ഉപയോഗിക്കുന്ന ആളാണെങ്കിൽ കൂടാതെ Qwen3.5-ന്റെ മികച്ച പ്രകടനം ആഗ്രഹിക്കുന്നുണ്ടെങ്കിൽ ഇത് ഇപ്പോൾ തന്നെ പരീക്ഷിച്ചു നോക്കാവുന്നതാണ്.
- നിങ്ങൾക്ക് ഇമേജ് ജനറേഷനോ ഉയർന്ന സ്റ്റെബിലിറ്റിയോ ആവശ്യമുണ്ടെങ്കിൽ ഒരു സ്റ്റേബിൾ റിലീസിനായി കാത്തിരിക്കുക.
- prefill, decode വേഗതകൾ പ്രത്യേകം അളക്കുക. MTP ഡീകോഡിംഗിനെ സഹായിക്കുമെങ്കിലും എല്ലാ ടാസ്ക്കുകളിലും മൊത്തത്തിലുള്ള ലേറ്റൻസിയിൽ (latency) മാറ്റം വന്നേക്കില്ല.
ഓപ്ഷണൽ ലേണിംഗ് കമ്മ്യൂണിറ്റി: https://t.me/GyaanSetuAi
