Microsoft એ ઓપન-સોર્સ BitNet ફ્રેમવર્કની જાહેરાત કરી છે, જે એક એવું સાધન છે જે ડેવલપર્સને સિંગલ CPU પર 1-bit લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) ચલાવવાની મંજૂરી આપે છે અને હાલના CPU-ઓન્લી ઇન્ફરન્સ કોડ કરતા છ ગણો વધુ સ્પીડ બૂસ્ટ હોવાનો દાવો કરે છે.
1-bit મોડલ શા માટે મહત્વનું છે
મોટાભાગના આધુનિક LLMs 16- અથવા 32-bit ફ્લોટિંગ-પોઈન્ટ નંબર્સનો ઉપયોગ કરે છે, જે મેમરી ફૂટપ્રિન્ટ અને પાવર વપરાશ વધારે છે. BitNet તેને “1.58-bit” ગણિત સાથે બદલે છે, જે દરેક વેઇટને –1, 0, અથવા +1 સુધી મર્યાદિત કરે છે. આ ઘટાડો મોડલના કદને નોંધપાત્ર રીતે ઘટાડે છે; 100-બિલિયન-પેરામીટર ધરાવતું નેટવર્ક લેપટોપ-ક્લાસ CPU પર ચાલી શકે છે. ડેવલપર્સ માટે BitNet આર્કિટેક્ચરનો ઉપયોગ કરીને મોડલ્સને શૂન્યથી તાલીમ (train) આપવી જરૂરી છે; તે માત્ર એક સાદું કન્વર્ઝન નથી.
નોંધવામાં આવેલા પરફોર્મન્સ લાભો
- Throughput: સિંગલ CPU કોર પર સેકન્ડ દીઠ 5–7 ટોકન્સ.
- Speed vs. llama.cpp: x86 પ્રોસેસર્સ પર 2.37×-6.17× વધુ ઝડપી.
- Energy use: સમાન હાર્ડવેર પર 82.2% સુધી ઓછો પાવર.
- Memory: 16×-32× ઓછી RAM જરૂરિયાતો.
કોડબેઝ સાથે રિલીઝ કરવામાં આવેલ ફ્લેગશિપ મોડલ, BitNet-b1.58-2B-4T, માં 2.4 બિલિયન પેરામીટર્સ છે. Microsoft આ સોફ્ટવેરને પરમિસિવ MIT લાયસન્સ હેઠળ બહાર પાડે છે, જે કોઈપણ વ્યક્તિને તેમના પોતાના 1-bit મોડલ્સ બનાવવા, સુધારવા અથવા પુનઃવિતરિત કરવા માટે આમંત્રિત કરે છે.
એજ-ફર્સ્ટ (Edge-first) ઉપયોગના કિસ્સાઓ
GPU વગર ઇન્ફરન્સ ચલાવવાથી ઓફલાઇન અથવા પ્રાઇવસી-સેન્સિટિવ એપ્લિકેશન્સ માટે નવા દ્વાર ખુલે છે. નાના IoT ઉપકરણો, ફિલ્ડ-ડિપ્લોયડ ડ્રોન અને ઇન્ટરનેટ કનેક્શન વગરના લેપટોપ સ્થાનિક રીતે ભાષાની ક્ષમતાઓ ધરાવી શકે છે. ઓછો ઊર્જા વપરાશ બેટરીથી ચાલતા હાર્ડવેર માટે પણ આકર્ષક છે.
મર્યાદાઓ શું છે
સૌથી મોટો અવરોધ શૂન્યથી તાલીમ (training from scratch) આપવાનો છે. Llama જેવા હાલના ઓપન-સોર્સ મોડલ્સને સરળતાથી BitNet ફોર્મેટમાં “bit-quantized” કરી શકાતા નથી; તેમને થ્રી-વેલ્યુ વેઇટ સ્કીમ સાથે ફરીથી બનાવવું આવશ્યક છે.
કોને ફાયદો થશે અને કોણ સ્થિર રહેશે
- Start-ups અને શોખીન લોકો (hobbyists): ઓછી હાર્ડવેર કિંમતો પ્રયોગો અને પ્રોડક્ટ પ્રોટોટાઇપિંગને વેગ આપી શકે છે.
- કડક ડેટા-સાર્વભૌમત્વ (data-sovereignty) નીતિઓ ધરાવતી એન્ટરપ્રાઇઝ: ઓન-પ્રેમિસ ઇન્ફરન્સ ડેટા ક્લાઉડ પ્રોવાઇડર્સને મોકલવાનું ટાળે છે.
- મોટા પાયે AI લેબ્સ: તાલીમ અને હાઇ-થ્રુપુટ સર્વિંગ માટે GPU નો ઉપયોગ ચાલુ રાખવાની શક્યતા છે, જ્યાં કાચી ઝડપ (raw speed) હજુ પણ મહત્વની છે.
આગળ શું જોવા જેવું છે
- કમ્યુનિટી સ્વીકૃતિ: BitNet ફોર્મેટમાં તાલીમ પામેલા થર્ડ-પાર્ટી મોડલ્સની સંખ્યા ઇકોસિસ્ટમ કેટલી ઝડપથી વધે છે તે દર્શાવશે.
- ટૂલિંગ ઇન્ટિગ્રેશન: લોકપ્રિય ટ્રેનિંગ પાઇપલાઇન્સ અને ડિપ્લોયમેન્ટ પ્લેટફોર્મ્સ સાથે સુસંગતતા આ ફ્રેમવર્કને વધુ સુલભ બનાવી શકે છે.
- રિયલ-વર્લ્ડ બેન્ચમાર્ક: વિવિધ હાર્ડવેર પર ચોકસાઈ, લેટન્સી અને પાવરના સ્વતંત્ર માપદંડો એ દર્શાવશે કે લેબની બહાર દાવો કરેલા લાભો જળવાઈ રહે છે કે નહીં.
- વધુ ક્વોન્ટાઇઝેશન સંશોધન: જો સંશોધકો ગુણવત્તા સાથે બાંધછોડ કર્યા વિના બીટ-વિડ્થને હજુ પણ ઓછી કરે છે, તો CPU-ઓન્લી સપનું વધુ વાસ્તવિક બનશે.
BitNet સાબિત કરે છે કે રોજિંદા પ્રોસેસર્સ પર વિશાળ લેંગ્વેજ મોડલ્સ ચલાવવું ટેકનિકલ રીતે શક્ય છે, પરંતુ તે હાઇ-પરફોર્મન્સ સિચ્યુએશનમાં GPU ની જરૂરિયાતને દૂર કરતું નથી. આ ફ્રેમવર્ક ડેવલપર્સના વ્યાપક વર્ગ માટે AI ને વધુ સુલભ બનાવી શકે છે, જ્યારે અત્યાધુનિક સંશોધનને ચલાવતા હેવીવેઇટ કમ્પ્યુટેશનલ વર્કલોડ્સ ભવિષ્યમાં પણ GPU-કેન્દ્રીત રહેવાની શક્યતા છે.
