Prism ML એ Bonsai 27B લોન્ચ કર્યું છે, જે Qwen 3.6 લાર્જ-લેંગ્વેજ મોડલનું એક એવું વર્ઝન છે જે મોબાઈલ ફોનમાં સમાઈ શકે છે. 1-bit quantization દ્વારા મૂળ 54 GB ના મોડલને 4 GB થી પણ ઓછું કરીને, કંપની 14× કદમાં ઘટાડો કરે છે અને વપરાશકર્તાઓને ક્લાઉડ API કોલ્સ વગર સ્થાનિક રીતે (locally) મોડલ ચલાવવાની સુવિધા આપે છે.

કોમ્પ્રેશન શા માટે મહત્વનું છે

LLMs ને સામાન્ય રીતે ડેસ્કટોપ-ક્લાસ GPU અથવા પેઇડ API ની જરૂર પડે છે કારણ કે તેના weights ડઝનબંધ ગીગાબાઇટ્સ જગ્યા રોકે છે. Quantization—દરેક weight માટે ઓછા bits નો ઉપયોગ કરવો—મોડલને નાનું બનાવે છે પરંતુ તે જ્ઞાનમાં પણ ઘટાડો કરી શકે છે. Bonsai બે વિરોધાભાસી વિકલ્પો આપે છે: એક ternary variant (ત્રણ સંભવિત weight મૂલ્યો, 7.2 GB) અને એક આક્રમક 1-bit variant (3.9 GB). કદ અને ક્ષમતા વચ્ચેનો આ સંતુલન (trade-off) આ પરીક્ષણનો મુખ્ય આધાર છે.

તથ્ય આધારિત યાદશક્તિ (factual recall) માં મોડલ્સ કેવું પ્રદર્શન કરે છે

ટેસ્ટરના સ્યુટમાં મૂળ Qwen 3.6 એ ઇતિહાસના દરેક તારીખ સંબંધિત પ્રશ્નનો સાચો જવાબ આપ્યો હતો. Ternary Bonsai છમાંથી પાંચ પ્રશ્નોમાં નિષ્ફળ રહ્યું, અને 1-bit વર્ઝન દરેક તારીખના પ્રશ્નોમાં નિષ્ફળ ગયું. અપેક્ષા મુજબ, આક્રમક કોમ્પ્રેશન પહેલા દુર્લભ અને ચોક્કસ તથ્યોને દૂર કરે છે, અને માત્ર ભાષાની વ્યાપક પેટર્નને જ જાળવી રાખે છે જે પ્રવાહિતા (fluency) લાવે છે.

કોડિંગ પરફોર્મન્સ એક અલગ જ વાર્તા કહે છે

જ્યારે પ્રોમ્પ્ટ્સ કોડિંગ કાર્યોમાં બદલાયા, ત્યારે પરિણામો ઉલટાઈ ગયા. ત્રણેય મોડલ્સે ક્લાસિક concurrency bugs ને કોઈપણ ભૂલ વગર ઉકેલ્યા. એક અઘરા React animation ચેલેન્જમાં, 1-bit Bonsai એ માત્ર બે પ્રયત્નોમાં કામ પૂરું કર્યું, જ્યારે મૂળ મોડલને ચાર પ્રયત્નો લાગ્યા કારણ કે તેણે કોડ પાર્સિંગમાં વધુ સમય વિતાવ્યો હતો. Ternary વર્ઝનને દસ પ્રયત્નો લાગ્યા અને અંતે તે ટેસ્ટ સર્વર ક્રેશ કરી દીધું.

વ્યવહારિક અવરોધો

Bonsai લોકપ્રિય Ollama runtime પર ચાલતું નથી. 1-bit મોડલ માટે Prism ML દ્વારા પૂરા પાડવામાં આવેલ કસ્ટમ એક્ઝિક્યુશન લેયરની જરૂર પડે છે, તેથી તેને ચલાવવા માટે વપરાશકર્તાઓએ નોન-સ્ટાન્ડર્ડ સોફ્ટવેર ઇન્સ્ટોલ કરવું પડશે. આ નિર્ભરતા મોડલના આકર્ષણને માત્ર એવા લોકો સુધી મર્યાદિત કરે છે જેઓ તેમના એન્વાયરમેન્ટમાં ફેરફાર કરવામાં નિપુણ હોય.

કોણે Bonsai નો ઉપયોગ કરવો જોઈએ, અને કોણે તેનાથી દૂર રહેવું જોઈએ

  • સામાન્ય હેતુ માટેની ચેટ – તથ્યોની વિગતોમાં મોટા પાયે ઘટાડો થવાને કારણે Bonsai જ્ઞાન-આધારિત સહાયક તરીકે અયોગ્ય છે. ઇતિહાસ, વિજ્ઞાન અથવા વર્તમાન ઘટનાઓના સચોટ જવાબો માટે, મૂળ મોડલ અથવા ક્લાઉડ API નો જ ઉપયોગ કરો.
  • લોકલ કોડિંગ સહાયક – એવા ડેવલપર્સ જેમને એવું ઓફલાઇન ટૂલ જોઈએ છે જે કોડ સૂચવી શકે, બગ્સ પકડી શકે અને ફોન અથવા લો-એન્ડ લેપટોપ પર ચાલી શકે, તેઓ 1-bit વર્ઝનમાં ઝડપ અને ઓછી સ્ટોરેજ ખર્ચ મેળવશે. તે સ્વાયત્ત એજન્ટ નથી, પરંતુ તે લોજિક અને સિન્ટેક્સને કાર્યક્ષમ રીતે હેન્ડલ કરે છે.

નિષ્કર્ષ

Bonsai 27B દર્શાવે છે કે તમે 54 GB ના LLM ને ફોન માટે અનુકૂળ 3.9 GB માં સંકોચી શકો છો અને તેમ છતાં આશ્ચર્યજનક રીતે ઝડપી અને સક્ષમ કોડ સૂચનો મેળવી શકો છો. તેની કિંમત ચોક્કસ તથ્યોની યાદશક્તિમાં લગભગ સંપૂર્ણ ઘટાડો છે, તેથી આ મોડલ એવા ડેવલપર્સ માટે છે જેઓ એન્સાયક્લોપેડિક જ્ઞાન કરતા ઓફલાઇન ઝડપને વધુ મહત્વ આપે છે.