PrismML નું નવું Bonsai 27B 1-bit મોડેલ 3.9 GB ની ફાઇલમાં સમાઈ જાય છે અને iPhone 17 Pro Max પર સેકન્ડ દીઠ લગભગ 11 ટોકન્સની ઝડપે ચાલે છે, જે એ વાતનો પુરાવો છે કે 27-બિલિયન-પેરામીટર ધરાવતું લેંગ્વેજ મોડેલ ગ્રાહક સ્માર્ટફોન પર રહી શકે છે. આ દાવો મહત્વનો છે કારણ કે તે ઓન-ડિવાઇસ AI ની સીમાઓને વિસ્તારવા માટે પ્રોત્સાહિત કરે છે, જે ડેટા ક્લાઉડ પર મોકલ્યા વિના વધુ સમૃદ્ધ ઓફલાઇન આસિસ્ટન્ટ્સનું વચન આપે છે.
આ ઘટાડો શા માટે મહત્વનો છે
ફૂલ-પ્રિસિઝન Bonsai 27B નું કદ 54.7 GB છે. મોડેલને સિંગલ-બીટ રિપ્રેઝન્ટેશનમાં ક્વોન્ટાઇઝ (quantising) કરીને, PrismML તેને ઘટાડીને 3.9 GB કરી દીધું છે—એટલે કે કદમાં 14 ગણો ઘટાડો. આ કમ્પ્રેશન મોડેલને ટેકનિકલી હાઇ-એન્ડ iPhones પર સ્ટોર કરી શકાય તેવું બનાવે છે, જે એક એવી મર્યાદા છે જે અગાઉ થોડા સો મેગાબાઇટ્સથી વધુ કદ ધરાવતી કોઈપણ વસ્તુને બહાર રાખતી હતી.
Apple હાર્ડવેર પર મોડેલ કેવી રીતે કામ કરે છે
PrismML એ આ મોડેલ Apple ના MLX stack માટે બનાવ્યું છે, જે APIs નો એક સેટ છે જે ડેવલપર્સને ન્યુરલ એન્જિન પર સીધા ન્યુરલ નેટ્સ ચલાવવાની મંજૂરી આપે છે. તેના પોતાના પરીક્ષણમાં, મોડેલે iPhone 17 Pro Max પર સેકન્ડ દીઠ અંદાજે 11 ટોકન્સ જનરેટ કર્યા હતા. 15 સ્ટાન્ડર્ડ લેંગ્વેજ-મોડેલ બેન્ચમાર્ક પર, 1-bit વર્ઝને મૂળ મોડેલના ક્વોલિટી સ્કોર્સના 89.5% જાળવી રાખ્યા હતા, જે સૂચવે છે કે કમ્પ્રેશનથી તેની ઉપયોગિતા ક્ષીણ થઈ નથી.
તમે જે વ્યવહારિક મર્યાદાઓનો સામનો કરશો
- મેમરી પ્રેશર – 3.9 GB ની ફાઇલ સમાઈ જાય છે, પરંતુ તાજેતરના સંદર્ભ (context) ને સ્ટોર કરવા માટે મોડેલને key-value (KV) કેશની પણ જરૂર પડે છે. વાતચીતની લંબાઈ સાથે તે કેશ વધતી જાય છે અને ફોનના RAM વપરાશને વધારી શકે છે, જે સંભવિત રીતે ઝડપ ઘટાડી શકે છે.
- ગરમી અને બેટરી – 27-બિલિયન-પેરામીટર નેટવર્ક ચલાવવાથી ન્યુરલ એન્જિન પર ભાર વધે છે. સતત લોડ હેઠળ ફોન ગરમ થતા હોય છે, અને Apple નું થર્મલ મેનેજમેન્ટ હાર્ડવેરના રક્ષણ માટે પર્ફોર્મન્સ ઘટાડી દેશે. PrismML એ બેટરી વપરાશના ચોક્કસ આંકડા જાહેર કર્યા નથી, તેથી દિવસભરના વપરાશની પેટર્ન પર તેની વાસ્તવિક અસર હજુ અજ્ઞાત છે.
- ડિવાઇસની વિશિષ્ટતા – પર્ફોર્મન્સનો આ દાવો લેટેસ્ટ iPhone 17 Pro Max માટે છે. જૂના iPhones, લોઅર-ટિયર iOS ડિવાઇસ અથવા Android ફોનમાં સમાન ન્યુરલ-એન્જિન ક્ષમતાઓ હોતી નથી અને તેમાં ઇન્ફરન્સ (inference) ધીમું જોવા મળશે અથવા મોડેલ કદાચ સમાઈ જ નહીં શકે.
કોને ફાયદો થશે, અને કોણ પાછળ રહી જશે
પ્રાઇવસી-ફર્સ્ટ એપ્સના ડેવલપર્સ હવે યુઝરનો ડેટા ફોન પર રાખીને, ઓન-ડિવાઇસ પર લાર્જ લેંગ્વેજ મોડેલ હોસ્ટ કરી શકે છે. તેનો અર્થ વધુ પ્રતિભાવશીલ વોઇસ આસિસ્ટન્ટ્સ, ઓફલાઇન અનુવાદ અથવા ક્લાઉડ સબ્સ્ક્રિપ્શન વિના સંદર્ભિત ટેક્સ્ટ જનરેશન હોઈ શકે છે.
Android ઉત્પાદકો અને મિડ-રેન્જ ફોન વાપરનારાઓ આ તક ગુમાવશે. આ મોડેલ Apple ના પ્રોપ્રાઇટરી સ્ટેક પર આધારિત છે, તેથી સમાન કમ્પ્રેશન અન્ય ઇકોસિસ્ટમ્સ પર આપમેળે કામ કરશે નહીં.
હજુ શું પરીક્ષણ કરવાનું બાકી છે
PrismML ના આંકડા આંતરિક બેન્ચમાર્ક પરથી લેવામાં આવ્યા છે. સ્વતંત્ર ટેસ્ટર્સ દ્વારા લાંબા સમય સુધી ટોકન-પર-સેકન્ડના દરની ચકાસણી કરવી જરૂરી છે, વાસ્તવિક બેટરી વપરાશ માપવો જોઈએ, અને KV કેશ વધવાની સાથે પર્ફોર્મન્સ કેટલી ઝડપથી ઘટે છે તેનું મૂલ્યાંકન કરવું જોઈએ. વાસ્તવિક ઉપયોગ—એક કલાક સુધી ચેટિંગ કરવું, કન્ટેન્ટ સ્ટ્રીમ કરવું અથવા અન્ય એપ્સની સાથે મોડેલ ચલાવવું—તે દર્શાવશે કે 11-ટોકન-પર-સેકન્ડનો આંકડો નિયંત્રિત લેબની બહાર ટકી રહે છે કે નહીં.
સારાંશ
Bonsai 27B દર્શાવે છે કે 27-બિલિયન-પેરામીટર ધરાવતા લેંગ્વેજ મોડેલ્સને ફ્લેગશિપ iPhone પર ચલાવવા માટે પૂરતું કમ્પ્રેસ કરી શકાય છે, જે મધ્યમ ગતિએ લગભગ સંપૂર્ણ ગુણવત્તા પ્રદાન કરે છે. આ સફળતા Apple ના MLX stack પર નિર્ભર છે અને હજુ પણ વ્યવહારિક અવરોધોનો સામનો કરી રહી છે: મેમરી ઓવરહેડ, થર્મલ થ્રોટલિંગ અને અજ્ઞાત બેટરી પ્રભાવ. જો અનુગામી પરીક્ષણો આ દાવાઓની પુષ્ટિ કરે છે, તો ઓન-ડિવાઇસ AI નિશ ડેમોમાંથી રોજિંદી એપ્સમાં બદલાઈ શકે છે—જો iOS ફ્લેગશિપ અને બાકીના બજાર વચ્ચેનો હાર્ડવેર તફાવત ઓછો થાય.
