Meta का नया 30-बिलियन-पैरामीटर Muse Glimmer, MacBook Pro M2 Pro पर 3-बिलियन-पैरामीटर Llama 3.2 की तुलना में 56 गुना धीमा चलता है, जो इसे उन तेज़ और बार-बार होने वाले कॉल्स के लिए अव्यावहारिक बनाता है जो अधिकांश लोकल-एजेंट वर्कफ़्लो को संचालित करते हैं।

लोकल एजेंट्स के लिए गति क्यों मायने रखती है

लोकल-एजेंट लूप प्रति मिनट दर्जनों, कभी-कभी सैकड़ों मॉडल कॉल्स करते हैं। प्रत्येक कॉल लेटेंसी (latency) बढ़ाती है; संचयी देरी (cumulative delay) प्रतिक्रिया क्षमता को गंभीर रूप से प्रभावित कर सकती है। इसलिए, डेवलपर्स सटीकता बनाए रखने वाले सबसे छोटे मॉडल का ही उपयोग करते हैं, और बड़े मॉडलों को केवल तभी बदलते हैं जब किसी समस्या के लिए वास्तव में गहन तर्क (deeper reasoning) की आवश्यकता होती है। Meta ने Muse Glimmer को इन लूप्स के लिए बनाए गए एक "thinking" मॉडल के रूप में प्रचारित किया, जो ऑन-डिवाइस लाभ से समझौता किए बिना समृद्ध इन्फरेंस (inference) का वादा करता है।

बेंचमार्क सेटअप

हमने 32 GB RAM वाले MacBook Pro M2 Pro पर यह परीक्षण किया, जिसमें तीन प्रतिनिधि कार्यों को मापा गया:

  • Context re-read speed – मॉडल पहले से देखे गए प्रॉम्प्ट को कितनी तेज़ी से प्रोसेस करता है।
  • Constrained JSON extraction – फ्री-फॉर्म टेक्स्ट से स्ट्रक्चर्ड डेटा निकालना, जो टूल्स को कॉल करने से पहले का एक सामान्य चरण है।
  • Tool calling – सही ढंग से फॉर्मेट किया गया फंक्शन कॉल जेनरेट करना।

तीन मॉडलों की तुलना की गई:

मॉडल प्रॉम्प्ट स्पीड (tok/s) जनरेशन स्पीड (tok/s) JSON सफलता (5-ट्रायल) प्रति कॉल समय
Llama 3.2 3B 702.9 56.7 5/5 0.6 s
Qwen 3 14B 161.8 14.6 5/5 16.1 s
Muse Glimmer 30B 56.7 7.1 5/5 33.4 s

तीनों ने सटीकता के लक्ष्य को प्राप्त किया, और हर ट्रायल में एक ही JSON आउटपुट दिया। 3 B मॉडल ने पूरे पाइपलाइन को एक सेकंड से भी कम समय में पूरा कर लिया; जबकि 30 B मॉडल को आधे मिनट से अधिक समय लगा।

इन आंकड़ों का क्या अर्थ है

56 गुना धीमी गति सीधे तौर पर CPU उपयोग और वॉल-क्लॉक टाइम (wall-clock time) को बढ़ा देती है, जिससे ऊर्जा की खपत बढ़ जाती है और एक ही मशीन द्वारा संभाले जा सकने वाले समवर्ती (concurrent) एजेंट्स की संख्या सीमित हो जाती है। "thinking" मोड बंद होने पर भी, Muse Glimmer विचार-विमर्श करने में अतिरिक्त टोकन खर्च करता रहा, जिससे पता चलता है कि लेटेंसी किसी वैकल्पिक फीचर के बजाय आर्किटेक्चर का ही हिस्सा है।

चैट-बॉट्स, पर्सनल असिस्टेंट, या स्वायत्त (autonomous) स्क्रिप्ट बनाने वाले डेवलपर्स के लिए जिन्हें तुरंत प्रतिक्रिया देनी होती है—जैसे "मेरे कैलेंडर इवेंट्स निकालो" या "एक नए ईमेल का सारांश दें"—Llama 3.2 की 0.6-सेकंड की लेटेंसी मानवीय रूप से स्वीकार्य सीमा के भीतर है। Muse Glimmer की 33-सेकंड की देरी स्पष्ट रूप से महसूस की जाएगी और प्रोडक्शन में संभवतः अस्वीकार्य होगी।

जहाँ Muse Glimmer की अभी भी भूमिका है

बेंचमार्क छोटे और नियतात्मक (deterministic) कार्यों पर केंद्रित था। Muse Glimmer ओपन-एंडेड रीजनिंग (open-ended reasoning) में चमकता है, जहाँ इसके द्वारा जेनरेट किए गए अतिरिक्त टोकन किसी उत्तर पर पहुँचने से पहले समाधान के कई रास्तों की खोज कर सकते हैं। उन परिदृश्यों में जिनमें सूक्ष्म निर्णय (nuanced judgment) की आवश्यकता होती है—जैसे जटिल कोड सिंथेसिस, मल्टी-स्टेप प्लानिंग, या अस्पष्ट यूजर इंटेंट की व्याख्या करना—गहरा मॉडल उच्च गुणवत्ता वाले आउटपुट दे सकता है जो प्रतीक्षा को सार्थक बना देते हैं।

लागत संबंधी विचार

30 B मॉडल को स्थानीय रूप से चलाने में 3 B मॉडल की तुलना में अधिक GPU मेमोरी और बिजली की खपत होती है। लैपटॉप-क्लास मशीन पर, धीमी थ्रूपुट (throughput) के कारण CPU भी अधिक समय तक खाली रहता है, जिससे अनुरोधों के बैच का कुल रनटाइम बढ़ जाता है। क्लाउड-तुल्य लागतों (cloud-equivalent costs) पर नज़र रखने वाली टीमों के लिए, यह ट्रेड-ऑफ बहुत स्पष्ट है: एक धीमा लोकल मॉडल, किसी बड़े होस्टेड मॉडल को किए गए तेज़ API कॉल की तुलना में प्रति इन्फरेंस अधिक महंगा पड़ सकता है।

आगे क्या देखें

Meta ने Muse Glimmer के लिए विस्तृत परफॉरमेंस-ट्यूनिंग गाइडलाइन्स जारी नहीं की हैं। भविष्य के फर्मवेयर या ड्राइवर अपडेट स्पीड के अंतर को कम कर सकते हैं, खासकर यदि मॉडल को उसकी रीजनिंग क्षमता खोए बिना क्वांटाइज़ (quantized) या प्रून (pruned) किया जा सके। कम्युनिटी-संचालित टूलकिट जो कई कॉल्स को बैच करते हैं या इंटरमीडिएट प्रॉम्प्ट्स को कैश करते हैं, वे भी विशिष्ट वर्कलोड के लिए लेटेंसी को कम कर सकते हैं।

डेवलपर्स को इन पर नज़र रखनी चाहिए:

  • Quantization breakthroughs – कम-सटीकता वाली अंकगणित (lower-precision arithmetic) टोकन-प्रति-सेकंड की दर को बढ़ा सकती है।
  • Hybrid pipelines – रूटीन एक्सट्रैक्शन के लिए छोटे मॉडल का उपयोग करें और Muse Glimmer पर केवल तभी वापस जाएँ जब कॉन्फिडेंस थ्रेशोल्ड विफल हो जाए।
  • Hardware shifts – नया Apple सिलिकॉन 30 B वेट मैट्रिक्स को अधिक कुशलता से संभाल सकता है।

निष्कर्ष

Muse Glimmer वह गहराई प्रदान करता है जिसका वादा एक 30B मॉडल करता है, लेकिन वर्तमान कंज्यूमर हार्डवेयर पर यह उन हाई-फ्रीक्वेंसी लूप्स के लिए बहुत धीमा है जो अधिकांश लोकल एजेंट्स को शक्ति प्रदान करते हैं। ऑन-डिवाइस मॉडल्स के साथ एक्सटर्नल APIs की तरह व्यवहार करें: सबसे पहले उस सबसे छोटे मॉडल से शुरुआत करें जो सटीकता की आवश्यकताओं को पूरा करता हो, और भारी-भरकम थिंकर को उन कार्यों के लिए सुरक्षित रखें जिन्हें वास्तव में उसकी अतिरिक्त तर्क क्षमता की आवश्यकता है। जब तक Meta गति के अंतर को कम नहीं कर देता, तब तक रोज़मर्रा के एक्सट्रैक्शन, फॉर्मेटिंग और सरल टूल डिस्पैच के लिए 3B Llama 3.2 एक व्यावहारिक विकल्प बना हुआ है, जबकि Muse Glimmer कभी-कभार आने वाली गहन सोच वाली चुनौतियों के लिए एक एस्केलेशन टियर के रूप में रहता है।

स्रोत: Frank Chu द्वारा dev.to लेख