150-બિલિયન-પેરામીટર ધરાવતું Mixture-of-Experts મોડેલ એક સામાન્ય ડેવલપર લેપટોપ પર ટેક્સ્ટ જનરેટ કરી શકે છે. આ પ્રયોગ દર્શાવે છે કે SSD ની ઝડપ નહીં, પરંતુ RAM એ વાસ્તવિક પર્ફોર્મન્સ લિમિટર છે. આ બાબત મહત્વની છે કારણ કે તે સાબિત કરે છે કે ક્લાઉડ કમ્પ્યુટિંગ પાછળ ખર્ચ કર્યા વિના ફ્રન્ટિયર-સ્કેલ મોડેલ્સનું સ્થાનિક રીતે પરીક્ષણ કરી શકાય છે.
પરીક્ષણ
અમે DeepSeek V4 Flash મોડેલ—જે એક REAP-pruned 150 B-parameter MoE છે—તેને ઓપન-સોર્સ Colibrì inference engine દ્વારા ચલાવ્યું. હાર્ડવેર તરીકે 61 GB RAM અને 1 TB NVMe SSD ધરાવતું AMD Ryzen AI 9 365 લેપટોપ હતું. અમે ત્રણ મિનિટના જનરેશન રનનો સમય નોંધ્યો અને દરેક ડિસ્ક એક્સેસનો ડેટા લોગ કર્યો.
આંકડા શું દર્શાવે છે
- ડિસ્ક પ્રવૃત્તિ ન્યૂનતમ હતી. ત્રણ મિનિટના જનરેશન દરમિયાન SSD એ 11 સેકન્ડથી પણ ઓછું રીડિંગ કર્યું. જો ડ્રાઈવ તરત જ ડેટા વાંચી શકતી હોત, તો પણ કુલ થ્રુપુટમાં માત્ર લગભગ 6 ટકાનો જ સુધારો થયો હોત.
- RAM ના કદની ઝડપ પર સીધી અસર પડી. RAM કેશ (cache) ને અડધી કરવાથી થ્રુપુટમાં અંદાજે 15 ટકાનો ઘટાડો થયો. CPU એ ડિસ્કની રાહ જોવામાં જેટલો સમય વિતાવ્યો, લગભગ તેટલો જ સમય કેશ મિસ (cache misses) હેન્ડલ કરવામાં—ડિ-ક્વોન્ટાઇઝિંગ (de-quantising), કોપી કરવા અને ડેટા મેનેજ કરવામાં—ખર્ચ્યો.
આ આંકડા એ સામાન્ય માન્યતાને ખોટી સાબિત કરે છે કે લેપટોપ પર મોટા મોડેલ ઇન્ફરન્સ (inference) માટે સ્ટોરેજ બેન્ડવિડ્થ એ મુખ્ય અવરોધ છે.
RAM શા માટે SSD કરતા ચઢિયાતું છે
જ્યારે મોડેલ પેરામીટર પહેલેથી જ RAM માં ઉપલબ્ધ ન હોય, ત્યારે સિસ્ટમે આ કરવું પડે છે:
- SSD માંથી ડેટા મેળવવો.
- તેને ડિકોડ કરવો અને કમ્પ્યુટેશન માટે CPU રજિસ્ટરમાં ખસેડવો.
આ બંને સ્ટેપ્સ સાયકલનો વપરાશ કરે છે. પ્રથમ સ્ટેપ SSD ની બેન્ડવિડ્થ દ્વારા મર્યાદિત છે; બીજું સ્ટેપ લગભગ તેટલો જ વિલંબ ઉમેરે છે કારણ કે ડેટા ગમે તેટલી ઝડપથી આવે, CPU એ તેને ડિ-ક્વોન્ટાઇઝ (de-quantise) કરવો જ પડે છે. તેથી, ઝડપી SSD થી મળતા ફાયદા ઘટતા જાય છે, જ્યારે વધુ RAM મોડેલના વધુ ભાગને RAM માં જ રાખવા દે છે અને ખર્ચાળ રાઉન્ડ-ટ્રિપને દૂર કરે છે.
ડેવલપર્સ માટે અસરો
- સ્ટોરેજમાં નહીં, મેમરીમાં રોકાણ કરો.
- સ્થાનિક પરીક્ષણ વ્યવહારુ બને છે. ડેવલપર્સ ક્લાઉડ ક્રેડિટ્સ માટે ચૂકવણી કર્યા વિના હાલના મશીનો પર ઓપન-વેઇટ MoE મોડેલ્સ ચલાવી શકે છે, અને સ્ટાઇલ, ટૂલ-કોલિંગ બિહેવિયર અને આઉટપુટ ક્વોલિટી તપાસી શકે છે.
- બેચ ઇવેલ્યુએશન વાસ્તવિક બને છે. રિયલ-ટાઇમ ચેટ હજુ પણ ધીમી લાગી શકે છે, પરંતુ ક્યુઇડ જોબ્સ (queued jobs)—જેમ કે સંશોધન માટે ડઝનબંધ પ્રોમ્પ્ટ્સ જનરેટ કરવા—લેપટોપ પર આરામથી ચાલી શકે છે.
સંભવિત વિરોધ પક્ષનો તર્ક
કેટલાક લોકો એવી દલીલ કરી શકે છે કે એવા વર્કલોડ્સ માટે SSD લેટન્સી (latency) હજુ પણ મહત્વની છે જે વારંવાર નવા એક્સપર્ટ વેઇટ્સ (expert weights) લોડ કરે છે.
આગળ શું જોવું
- મેમરી-કાર્યક્ષમ મોડેલ વેરિઅન્ટ્સ.
- મોટા ઓન-ચિપ કેશ (on-chip caches) ધરાવતું હાર્ડવેર.
- સોફ્ટવેર-લેવલ કેશિંગ વ્યૂહરચનાઓ.
અંતિમ વાત સ્પષ્ટ છે: જે ડેવલપર્સ લેપટોપ પર વિશાળ MoE મોડેલ્સ સાથે પ્રયોગ કરવા માંગતા હોય તેમણે વધુ RAM ખરીદવી જોઈએ. SSD અપગ્રેડ કરવાથી માત્ર થોડા જ ટકાનો ફાયદો થાય છે, જ્યારે વધારાની મેમરી ઇન્ફરન્સ સમયને ડબલ-ડિજિટ ટકાવારી જેટલો ઘટાડી શકે છે. આ AI પ્રોટોટાઇપિંગ માટેના ખર્ચના ગણિતને બદલે છે અને એવા મોડેલ્સના સ્થાનિક, ખર્ચ રહિત પરીક્ષણ માટેના દ્વાર ખોલે છે જેઓ અગાઉ સમજાતા હતા કે તેના માટે સમર્પિત ક્લાઉડ ક્લસ્ટર્સની જરૂર પડશે.
