Ollama RC અપડેટ: Qwen3.5 અને સ્ટ્રીમિંગ ફિક્સ

Ollama v0.32.6-rc0 બહાર આવ્યું છે. તે Apple GPU વપરાશકર્તાઓ માટે અપડેટ્સ લાવે છે અને સ્ટ્રીમિંગ સમસ્યાઓનું નિવારણ કરે છે.

Apple વપરાશકર્તાઓ માટે નવી સુવિધાઓ: MLX એન્જિન હવે Qwen3.5 સાથે speculative decoding માટે MTP હેડનો ઉપયોગ કરે છે. આ પ્રક્રિયા ટોકન્સનું અગાઉથી અનુમાન લગાવે છે. મુખ્ય મોડેલ તેને બેચમાં વેરિફાય કરે છે. આનાથી decoding દરમિયાન રાહ જોવાનો સમય ઘટે છે.

Ollama જણાવે છે કે આનાથી Qwen3.5 ઝડપી બને છે. તેમણે નોંધમાં ચોક્કસ benchmarks અથવા ઝડપના ટકાવારી આપ્યા નથી. તમારા પોતાના પરીક્ષણ વગર ચોક્કસ ઝડપ વધારાની ધારણા ન કરો.

સ્ટ્રીમિંગ સુસંગતતા (Streaming Compatibility): આ અપડેટ /v1/chat/completions endpoint સ્ટ્રીમિંગને કેવી રીતે હેન્ડલ કરે છે તેમાં ફેરફાર કરે છે. જો તમારું સોફ્ટવેર ચોક્કસ chunks અથવા finish_reason ડેટા પર આધારિત હોય, તો પહેલા તેનું પરીક્ષણ કરો. પ્રોડક્શન વર્કફ્લો માટે અનુમાનિત વર્તન (predictable behavior) ઝડપ જેટલું જ મહત્વનું છે.

મહત્વપૂર્ણ ચેતવણીઓ:

  • આ એક release candidate છે. તે સ્થિર (stable) વર્ઝન નથી.
  • પ્રાયોગિક ઇમેજ જનરેશન કામચલાઉ ધોરણે દૂર કરવામાં આવ્યું છે.
  • જો તમારે ઇમેજ જનરેશનની જરૂર હોય, તો વર્ઝન 0.32.5 પર જ રહો.

આગળ કેવી રીતે વધવું:

  • જો તમે Apple GPU નો ઉપયોગ કરો છો અને Qwen3.5 ના બહેતર પ્રદર્શનની ઈચ્છા રાખો છો, તો અત્યારે જ આનું પરીક્ષણ કરો.
  • જો તમારે ઇમેજ જનરેશન અથવા ઉચ્ચ સ્થિરતાની જરૂર હોય, તો સ્ટેબલ રિલીઝની રાહ જુઓ.
  • prefill અને decode સ્પીડને અલગથી માપો. MTP decoding માં મદદ કરે છે પરંતુ તે દરેક કાર્ય માટે કુલ latency બદલી શકે નહીં.

સ્ત્રોત: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

વૈકલ્પિક લર્નિંગ કોમ્યુનિટી: https://t.me/GyaanSetuAi