Meta નું નવું 30-બિલિયન-પેરામીટર Muse Glimmer, MacBook Pro M2 Pro પર 3-બિલિયન-પેરામીટર Llama 3.2 કરતા 56 ગણું ધીમું ચાલે છે, જે આ મોડેલને મોટાભાગના લોકલ-એજન્ટ વર્કફ્લોઝમાં જરૂરી ઝડપી અને પુનરાવર્તિત કોલ્સ માટે અવ્યવહારુ બનાવે છે.

લોકલ એજન્ટ્સ માટે ઝડપ શા માટે મહત્વની છે

લોકલ-એજન્ટ લૂપ્સ પ્રતિ મિનિટ ડઝનબંધ, ક્યારેક સેંકડો મોડેલ કોલ્સ કરે છે. દરેક કોલ લેટન્સી (વિલંબ) વધારે છે; સંચિત વિલંબ પ્રતિસાદ આપવાની ક્ષમતાને નબળી પાડી શકે છે. તેથી ડેવલપર્સ સચોટતા જાળવી રાખતા સૌથી નાના મોડેલનો ઉપયોગ કરવાનું પસંદ કરે છે, અને જ્યારે કોઈ સમસ્યા માટે ખરેખર ઊંડા તર્ક (reasoning) ની જરૂર હોય ત્યારે જ મોટા મોડેલ્સનો ઉપયોગ કરે છે. Meta એ Muse Glimmer ને આ લૂપ્સ માટે બનાવેલા “thinking” મોડેલ તરીકે માર્કેટ કર્યું છે, જે ઓન-ડિવાઇસ ફાયદા સાથે સમાધાન કર્યા વિના વધુ સમૃદ્ધ ઇન્ફરન્સ (inference) આપવાનું વચન આપે છે.

બેન્ચમાર્ક સેટઅપ

અમે 32 GB RAM ધરાવતા MacBook Pro M2 Pro પર આ ટેસ્ટ ચલાવ્યો હતો, જેમાં ત્રણ પ્રતિનિધિ કાર્યોનું માપન કરવામાં આવ્યું હતું:

  • Context re-read speed – મોડેલ પહેલેથી જોઈ ગયેલા પ્રોમ્પ્ટને કેટલી ઝડપથી પ્રોસેસ કરે છે.
  • Constrained JSON extraction – ફ્રી-ફોર્મ ટેક્સ્ટમાંથી સ્ટ્રક્ચર્ડ ડેટા મેળવવો, જે ટૂલ્સનો ઉપયોગ કરતા પહેલાનું સામાન્ય પગલું છે.
  • Tool calling – સાચી રીતે ફોર્મેટ કરેલ ફંક્શન કોલ જનરેટ કરવો.

ત્રણ મોડેલ્સની તુલના કરવામાં આવી હતી:

Model Prompt speed (tok/s) Generation speed (tok/s) JSON success (5-trial) Time per call
Llama 3.2 3B 702.9 56.7 5/5 0.6 s
Qwen 3 14B 161.8 14.6 5/5 16.1 s
Muse Glimmer 30B 56.7 7.1 5/5 33.4 s

ત્રણેય મોડેલે સચોટતાનું લક્ષ્ય હાંસલ કર્યું, દરેક ટ્રાયલમાં સમાન JSON આઉટપુટ આપ્યું. 3 B મોડેલે આખી પાઇપલાઇન એક સેકન્ડથી ઓછા સમયમાં પૂર્ણ કરી; જ્યારે 30 B મોડેલને અડધા મિનિટથી વધુ સમય લાગ્યો.

આ આંકડાઓનો અર્થ શું છે

56 ગણો ઘટાડો સીધી રીતે CPU વપરાશ અને wall-clock time વધારે છે, જે ઉલટા દ્વારા ઊર્જા વપરાશમાં વધારો કરે છે અને એક સિંગલ મશીન કેટલા કન્કરન્ટ એજન્ટ્સને સપોર્ટ કરી શકે છે તેના પર મર્યાદા મૂકે છે. “thinking” મોડ બંધ હોવા છતાં, Muse Glimmer વિચારવા માટે વધારાના ટોકન્સ વાપરતું રહ્યું, જે સૂચવે છે કે લેટન્સી એ કોઈ વૈકલ્પિક ફીચર નથી પરંતુ આર્કિટેક્ચરમાં જ સામેલ છે.

ચેટ-બોટ્સ, પર્સનલ આસિસ્ટન્ટ્સ અથવા ઓટોનોમસ સ્ક્રિપ્ટ્સ બનાવતા ડેવલપર્સ માટે જેમને તરત જ પ્રતિક્રિયા આપવી જરૂરી છે—જેમ કે “fetch my calendar events” અથવા “summarize a new email”—Llama 3.2 ની 0.6-સેકન્ડની લેટન્સી માનવીય રીતે સ્વીકાર્ય મર્યાદામાં છે. Muse Glimmer તરફથી 33 સેકન્ડનો વિલંબ નોંધપાત્ર હશે અને પ્રોડક્શનમાં કદાચ અસ્વીકાર્ય હશે.

Muse Glimmer હજુ પણ ક્યાં ઉપયોગી છે

આ બેન્ચમાર્ક ટૂંકા અને નિર્ધારિત (deterministic) કાર્યો પર કેન્દ્રિત હતો. Muse Glimmer ઓપન-એન્ડેડ રીઝનિંગમાં શ્રેષ્ઠ કામ કરે છે, જ્યાં તે જનરેટ કરેલા વધારાના ટોકન્સ જવાબ નક્કી કરતા પહેલા અનેક ઉકેલના માર્ગો શોધી શકે છે. એવા કિસ્સાઓમાં જેમાં સૂક્ષ્મ નિર્ણય લેવાની જરૂર હોય—જેમ કે જટિલ કોડ સિન્થેસિસ, મલ્ટી-સ્ટેપ પ્લાનિંગ, અથવા અસ્પષ્ટ યુઝર ઇન્ટેન્ટનું અર્થઘટન—ઊંડું મોડેલ ઉચ્ચ ગુણવત્તાવાળા આઉટપુટ આપી શકે છે જે વિલંબને યોગ્ય ઠેરવે છે.

ખર્ચ સંબંધિત બાબતો

30 B મોડેલને લોકલી ચલાવવાથી 3 B મોડેલ કરતા વધુ GPU મેમરી અને પાવર વપરાય છે. લેપટોપ-ક્લાસ મશીન પર, ધીમો થ્રુપુટ CPU ને લાંબા સમય સુધી idle રાખે છે, જેનાથી વિનંતીઓના બેચનો એકંદર રનટાઇમ વધી જાય છે. ક્લાઉડ-ઇક્વિવેલન્ટ ખર્ચ પર નજર રાખતી ટીમો માટે, આ તફાવત સ્પષ્ટ છે: એક ધીમું લોકલ મોડેલ મોટા, હોસ્ટેડ મોડેલના ઝડપી API કોલ કરતા પ્રતિ ઇન્ફરન્સ વધુ ખર્ચાળ હોઈ શકે છે.

આગળ શું જોવું જોઈએ

Meta એ Muse Glimmer માટે વિગતવાર પરફોર્મન્સ-ટ્યુનિંગ માર્ગદર્શિકા બહાર પાડી નથી. ભવિષ્યના ફર્મવેર અથવા ડ્રાઇવર અપડેટ્સ સ્પીડ ગેપ ઘટાડી શકે છે, ખાસ કરીને જો મોડેલને તેના રીઝનિંગ ક્ષમતા ગુમાવ્યા વિના quantized અથવા pruned કરી શકાય. કોમ્યુનિટી-ડ્રિવન ટૂલકિટ્સ જે મલ્ટીપલ કોલ્સને બેચ કરે છે અથવા ઇન્ટરમીડિયેટ પ્રોમ્પ્ટ્સને કેશ કરે છે તે ચોક્કસ વર્કલોડ્સ માટે લેટન્સી ઘટાડી શકે છે.

ડેવલપર્સ આ બાબતો પર નજર રાખવી જોઈએ:

  • Quantization breakthroughs – લો-પ્રિસિઝન અંકગણિત (lower-precision arithmetic) ટોકન-પર-સેકન્ડ રેટ વધારી શકે છે.
  • Hybrid pipelines – રૂટિન એક્સટ્રેક્શન માટે નાના મોડેલનો ઉપયોગ કરો અને જ્યારે કોન્ફિડન્સ થ્રેશોલ્ડ નિષ્ફળ જાય ત્યારે જ Muse Glimmer નો ઉપયોગ કરો.
  • Hardware shifts – નવા Apple silicon 30 B વેઇટ મેટ્રિક્સને વધુ કાર્યક્ષમ રીતે હેન્ડલ કરી શકે છે.

Takeaway

Muse Glimmer તે ઊંડાઈ પૂરી પાડે છે જેનું 30 B મોડેલ વચન આપે છે, પરંતુ વર્તમાન કન્ઝ્યુમર હાર્ડવેર પર તે મોટાભાગના લોકલ એજન્ટ્સને સજ્જ કરતા હાઈ-ફ્રીક્વન્સી લૂપ્સ માટે ઘણું ધીમું છે. ઓન-ડિવાઇસ મોડેલ્સને એક્સટર્નલ APIs ની જેમ ગણો: સચોટતાની જરૂરિયાતો પૂરી કરતા સૌથી નાના મોડેલથી શરૂઆત કરો, અને હેવીવેઇટ વિચારકને એવા કાર્યો માટે અનામત રાખો જેને ખરેખર તેની વધારાની તર્ક ક્ષમતાની જરૂર હોય. જ્યાં સુધી Meta સ્પીડ ગેપ ઘટાડી ન દે, ત્યાં સુધી રોજિંદા એક્સટ્રેક્શન, ફોર્મેટિંગ અને સાદા ટૂલ ડિસ્પેચ માટે 3 B Llama 3.2 વ્યવહારુ પસંદગી બની રહેશે, જ્યારે Muse Glimmer ક્યારેક આવતા ઊંડા વિચારવા માટેના પડકારો માટે એસ્કેલેશન ટાયર તરીકે રહેશે.

સ્ત્રોત: Frank Chu દ્વારા dev.to લેખ