Ollama 0.32.14 માં sm_86 CUDA kernels ને બાકાત રાખવાથી RTX 30-series કાર્ડ્સ માટે GPU સપોર્ટ બંધ થઈ ગયો છે, તેથી runtime ચૂપચાપ CPU પર સ્વિચ થઈ જાય છે અને મોડેલ જનરેશનની ગતિ અત્યંત ધીમી પડી જાય છે.

0.32.14 માં શું બદલાયું

નવું binary ફક્ત 7.5, 8.9, 10.0 અને 12.0 કમ્પ્યુટ આર્કિટેક્ચર માટે જ બનાવવામાં આવ્યું છે. આર્કિટેક્ચર 8.6 – જે NVIDIA ના RTX 30-series, A40 અને A6000 માટેનું કોડ નેમ છે – તે ખૂટે છે. જ્યારે લોન્ચર મેચિંગ kernel શોધે છે ત્યારે તેને કંઈ મળતું નથી, ollama ps માં GPU “split” રિપોર્ટ કરે છે, અને પછી એક્સિલરેશન વગર આગળ વધે છે.

જૂનું fallback હવે કેમ કામ કરતું નથી

અગાઉના રિલીઝમાં એક સેકન્ડરી પાથ આપવામાં આવતો હતો જે, જો પ્રાઇમરી kernels નિષ્ફળ જાય, તો CUDA 12 લાઇબ્રેરી લોડ કરતો હતો. તે લાઇબ્રેરીમાં હજુ પણ sm_86 માટે કોડ હતો, જેનાથી તે જ હાર્ડવેર પર મોડેલ ચલાવી શકાય તેમ હતું. 0.32.14 માં, fallback કોડ અજાણતા દૂર કરવામાં આવ્યો હતો, તેથી લોન્ચર સંપૂર્ણપણે GPU ને સ્કીપ કરે છે અને હોસ્ટ પ્રોસેસર પર ચાલે છે.

કોને તેની અસર થશે

RTX 3080, 3080 Ti, 3090, 3090 Ti, A40, A6000 અથવા કમ્પ્યુટ કેપેબિલિટી 8.6 પર આધારિત અન્ય કોઈપણ કાર્ડનો ઉપયોગ કરનાર વ્યક્તિને સ્લોડાઉન જોવા મળશે. આ ફેરફાર અદ્રશ્ય છે – કોઈ એરર મેસેજ નહીં, કોઈ ક્રેશ નહીં – ફક્ત થ્રુપુટમાં નોંધપાત્ર ઘટાડો જોવા મળશે.

તમે CPU પર છો તે કેવી રીતે ચકાસવું

  1. જનરેશન શરૂ કરો અને, બીજા ટર્મિનલમાં, nvidia-smi રન કરો. જો “Memory-Used” કોલમ 0 MiB પર રહે છે, તો કામ CPU પર થઈ રહ્યું છે.
  2. Ollama લોગ્સમાં library=CUDA compute=8.6 ધરાવતી લાઇન તપાસો. તેની ગેરહાજરી પુષ્ટિ કરે છે કે fallback ક્યારેય સક્રિય થયું નથી.
  3. જાણીતા GPU બેઝલાઇન સામે token-per-second ના આંકડાઓની સરખામણી કરો; અગાઉના રિલીઝમાં જે મોડેલ મિનિટો લેતું હતું તે હવે દસوں મિનિટો લેશે.

CUDA_VISIBLE_DEVICES જેવા એન્વાયરમેન્ટ વેરિયેબલ્સ સેટ કરવાથી સમસ્યાનું નિવારણ થશે નહીં કારણ કે ખૂટતા kernels એ compile-time ભૂલ છે, runtime ફ્લેગ નથી.

ઝડપી ઉકેલ: 0.32.13 પર પિન કરો

Windows

  • હાલનું Ollama ઇન્સ્ટોલેશન અનઇન્સ્ટોલ કરો.
  • પ્રોજેક્ટના GitHub releases પેજ પરથી 0.32.13 ઇન્સ્ટોલર ડાઉનલોડ કરો.
  • ઇન્સ્ટોલર રન કરો અને Ollama સર્વિસને રીસ્ટાર્ટ કરો.

Linux

sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package>   # for Debian-based
# or sudo rpm -Uvh <package>   # for RPM-based
sudo systemctl start ollama

ડાઉનગ્રેડ કર્યા પછી, nvidia-smi ચેક ફરીથી કરો; તમારે નોન-ઝીરો VRAM વપરાશ અને જનરેશન સ્પીડમાં વધારો જોવા મળવો જોઈએ.

ભવિષ્યના રિલીઝમાં શું ધ્યાન રાખવું

sm_86 ને બાકાત રાખવું એ જાણીજોઈને કરવામાં આવેલ ડિપ્રિકેશન (deprecation) ને બદલે બિલ્ડ સ્ક્રિપ્ટમાં થયેલી ભૂલ હોય તેવું લાગે છે. જ્યાં સુધી મેન્ટેનર્સ ખૂટતા kernels ને પુનઃસ્થાપિત ન કરે અથવા CUDA 12 fallback ને ફરીથી સક્રિય ન કરે ત્યાં સુધી, 0.32.13 થી ઉપરનું કોઈપણ અપગ્રેડ સમાન જોખમ ધરાવે છે. 8.6 kernels ને ફરીથી ઉમેરતા પેચ માટે પ્રોજેક્ટના issue tracker પર નજર રાખો, અને દરેક અપડેટ પછી તરત જ GPU વપરાશનું પરીક્ષણ કરો.

ટૂંકમાં: 0.32.14 રિલીઝ અજાણતા RTX 30-series એક્સિલરેશનને ડિસેબલ કરે છે. nvidia-smi સાથે GPU એક્ટિવિટી ચકાસો, અને જો તમે તે કાર્ડ્સ પર નિર્ભર હોવ, તો જ્યાં સુધી ખૂટતા kernels પુનઃસ્થાપિત ન થાય ત્યાં સુધી 0.32.13 પર રોલ બેક કરો.