Meta ਦਾ ਨਵਾਂ 30-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ Muse Glimmer, MacBook Pro M2 Pro 'ਤੇ 3-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ Llama 3.2 ਨਾਲੋਂ 56 ਗੁਣਾ ਹੌਲੀ ਚੱਲਦਾ ਹੈ, ਜੋ ਕਿ ਇਸ ਮਾਡਲ ਨੂੰ ਉਹਨਾਂ ਤੇਜ਼ ਅਤੇ ਵਾਰ-ਵਾਰ ਹੋਣ ਵਾਲੀਆਂ ਕਾਲਾਂ ਲਈ ਅਵਿਵਹਾਰਕ ਬਣਾਉਂਦਾ ਹੈ ਜੋ ਜ਼ਿਆਦਾਤਰ local-agent ਵਰਕਫਲੋ ਨੂੰ ਚਲਾਉਂਦੀਆਂ ਹਨ।
Local agents ਲਈ ਰਫ਼ਤਾਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
Local-agent ਲੂਪਸ ਪ੍ਰਤੀ ਮਿੰਟ ਵਿੱਚ ਦਰਜਨਾਂ, ਕਈ ਵਾਰ ਸੈਂਕੜੇ ਮਾਡਲ ਕਾਲਾਂ ਕਰਦੇ ਹਨ। ਹਰ ਕਾਲ ਲੇਟੈਂਸੀ (latency) ਵਧਾਉਂਦੀ ਹੈ; ਇਹ ਕੁੱਲ ਦੇਰੀ ਪ੍ਰਤੀਕਿਰਿਆਸ਼ੀਲਤਾ (responsiveness) ਨੂੰ ਖ਼ਰਾਬ ਕਰ ਸਕਦੀ ਹੈ। ਇਸ ਲਈ, ਡਿਵੈਲਪਰ ਸਿਰਫ਼ ਉਸ ਸਭ ਤੋਂ ਛੋਟੇ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ ਜੋ ਸਹੀ ਨਤੀਜੇ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਵੱਡੇ ਮਾਡਲਾਂ ਨੂੰ ਉਦੋਂ ਹੀ ਬਦਲਦੇ ਹਨ ਜਦੋਂ ਕਿਸੇ ਸਮੱਸਿਆ ਲਈ ਡੂੰਘੀ ਸੋਚ-ਵਿਚਾਰ ਦੀ ਸੱਚਮੁੱਚ ਲੋੜ ਹੁੰਦੀ ਹੈ। Meta ਨੇ Muse Glimmer ਨੂੰ ਇਹਨਾਂ ਲੂਪਸ ਲਈ ਬਣਾਏ ਗਏ ਇੱਕ "thinking" ਮਾਡਲ ਵਜੋਂ ਮਾਰਕੀਟ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ on-device ਫਾਇਦੇ ਨੂੰ ਗੁਆਏ ਬਿਨਾਂ ਬਿਹਤਰ ਇਨਫਰੈਂਸ (inference) ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ।
ਬੈਂਚਮਾਰਕ ਸੈੱਟਅੱਪ
ਅਸੀਂ 32 GB RAM ਵਾਲੇ MacBook Pro M2 Pro 'ਤੇ ਟੈਸਟ ਚਲਾਇਆ, ਜਿਸ ਵਿੱਚ ਤਿੰਨ ਪ੍ਰਤੀਨਿਧ ਕੰਮਾਂ ਨੂੰ ਮਾਪਿਆ ਗਿਆ:
- Context re-read speed – ਮਾਡਲ ਉਸ ਪ੍ਰੋਂਪਟ ਨੂੰ ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਪ੍ਰੋਸੈਸ ਕਰਦਾ ਹੈ ਜੋ ਉਹ ਪਹਿਲਾਂ ਹੀ ਦੇਖ ਚੁੱਕਾ ਹੈ।
- Constrained JSON extraction – ਫ੍ਰੀ-ਫਾਰਮ ਟੈਕਸਟ ਤੋਂ ਸੰਰਚਿਤ (structured) ਡੇਟਾ ਕੱਢਣਾ, ਜੋ ਕਿ ਟੂਲਸ ਦੀ ਵਰਤੋਂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਇੱਕ ਆਮ ਕਦਮ ਹੈ।
- Tool calling – ਸਹੀ ਫਾਰਮੈਟ ਵਿੱਚ ਫੰਕਸ਼ਨ ਕਾਲ ਤਿਆਰ ਕਰਨਾ।
ਤਿੰਨ ਮਾਡਲਾਂ ਦੀ ਤੁਲਨਾ ਕੀਤੀ ਗਈ:
| ਮਾਡਲ | ਪ੍ਰੋਂਪਟ ਸਪੀਡ (tok/s) | ਜਨਰੇਸ਼ਨ ਸਪੀਡ (tok/s) | JSON ਸਫਲਤਾ (5-ਟ੍ਰਾਇਲ) | ਪ੍ਰਤੀ ਕਾਲ ਸਮਾਂ |
|---|---|---|---|---|
| Llama 3.2 3B | 702.9 | 56.7 | 5/5 | 0.6 s |
| Qwen 3 14B | 161.8 | 14.6 | 5/5 | 16.1 s |
| Muse Glimmer 30B | 56.7 | 7.1 | 5/5 | 33.4 s |
ਤਿੰਨੋਂ ਮਾਡਲਾਂ ਨੇ ਸਹੀ ਨਤੀਜੇ ਦਾ ਟੀਚਾ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਅਤੇ ਹਰ ਟ੍ਰਾਇਲ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ JSON ਆਉਟਪੁੱਟ ਦਿੱਤਾ। 3 B ਮਾਡਲ ਨੇ ਪੂਰੀ ਪਾਈਪਲਾਈਨ ਇੱਕ ਸੈਕਿੰਡ ਤੋਂ ਵੀ ਘੱਟ ਸਮੇਂ ਵਿੱਚ ਪੂਰੀ ਕਰ ਲਈ; 30 B ਮਾਡਲ ਨੂੰ ਅੱਧੇ ਮਿੰਟ ਤੋਂ ਵੱਧ ਸਮਾਂ ਲੱਗਿਆ।
ਅੰਕੜਿਆਂ ਦਾ ਕੀ ਮਤਲਬ ਹੈ
56 ਗੁਣਾ ਦੀ ਸੁਸਤੀ ਸਿੱਧੇ ਤੌਰ 'ਤੇ CPU ਦੀ ਵਰਤੋਂ ਅਤੇ wall-clock ਸਮੇਂ ਨੂੰ ਵਧਾਉਂਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਊਰਜਾ ਦੀ ਖਪਤ ਵਧ ਜਾਂਦੀ ਹੈ ਅਤੇ ਇੱਕ ਸਿੰਗਲ ਮਸ਼ੀਨ ਕਿੰਨੇ ਇਕੱਠੇ (concurrent) agents ਨੂੰ ਸੰਭਾਲ ਸਕਦੀ ਹੈ, ਇਸ 'ਤੇ ਸੀਮਾ ਲੱਗ ਜਾਂਦੀ ਹੈ। "thinking" ਮੋਡ ਬੰਦ ਹੋਣ ਦੇ ਬਾਵਜੂਦ, Muse Glimmer ਵਿਚਾਰ-ਵਿਚਾਰ ਕਰਨ ਲਈ ਵਾਧੂ ਟੋਕਨ ਖਰਚ ਕਰਦਾ ਰਿਹਾ, ਜੋ ਇਹ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ ਕਿ ਲੇਟੈਂਸੀ (latency) ਇੱਕ ਵਿਕਲਪਿਕ ਵਿਸ਼ੇਸ਼ਤਾ ਹੋਣ ਦੀ ਬਜਾਏ ਆਰਕੀਟੈਕਚਰ ਦਾ ਹੀ ਹਿੱਸਾ ਹੈ।
ਚੈਟ-ਬੋਟਸ, ਪਰਸਨਲ ਅਸਿਸਟੈਂਟ, ਜਾਂ ਆਟੋਨੋਮਸ ਸਕ੍ਰਿਪਟਸ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਲਈ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਤੁਰੰਤ ਪ੍ਰਤੀਕਿਰਿਆ ਦੇਣੀ ਚਾਹੀਦੀ ਹੈ—ਜਿਵੇਂ ਕਿ "ਮੇਰੇ ਕੈਲੰਡਰ ਇਵੈਂਟਸ ਲਿਆਓ" ਜਾਂ "ਨਵੇਂ ਈਮੇਲ ਦਾ ਸਾਰ ਲਓ"—Llama 3.2 ਦੀ 0.6-ਸੈਕਿੰਡ ਦੀ ਲੇਟੈਂਸੀ ਮਨੁੱਖੀ-ਸਵੀਕਾਰਯੋਗ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਹੈ। Muse Glim
Muse Glimmer ਉਹ ਡੂੰਘਾਈ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਜਿਸਦਾ ਵਾਅਦਾ ਇੱਕ 30 B ਮਾਡਲ ਕਰਦਾ ਹੈ, ਪਰ ਮੌਜੂਦਾ ਉਪਭੋਗਤਾ ਹਾਰਡਵੇਅਰ 'ਤੇ ਇਹ ਉਹਨਾਂ ਹਾਈ-ਫ੍ਰੀਕੁਐਂਸੀ ਲੂਪਸ ਲਈ ਬਹੁਤ ਜ਼ਿਆਦਾ ਧੀਮਾ ਹੈ ਜੋ ਜ਼ਿਆਦਾਤਰ ਲੋਕਲ ਏਜੰਟਸ ਨੂੰ ਚਲਾਉਂਦੇ ਹਨ। ਆਨ-ਡਿਵਾਈਸ ਮਾਡਲਸ ਨੂੰ ਐਕਸਟਰਨਲ APIs ਵਾਂਗ ਸਮਝੋ: ਸਭ ਤੋਂ ਛੋਟੇ ਮਾਡਲ ਤੋਂ ਸ਼ੁਰੂਆਤ ਕਰੋ ਜੋ ਸ਼ੁੱਧਤਾ ਦੀਆਂ ਲੋੜਾਂ ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੋਵੇ, ਅਤੇ ਭਾਰੀ ਸੋਚਣ ਵਾਲੇ ਮਾਡਲ ਨੂੰ ਉਹਨਾਂ ਕੰਮਾਂ ਲਈ ਰਾਖਵਾਂ ਰੱਖੋ ਜਿਨ੍ਹਾਂ ਨੂੰ ਸੱਚਮੁੱਚ ਵਾਧੂ ਤਰਕ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਦੀ ਲੋੜ ਹੈ। ਜਦੋਂ ਤੱਕ Meta ਗਤੀ ਦੇ ਅੰਤਰ ਨੂੰ ਖਤਮ ਨਹੀਂ ਕਰ ਦਿੰਦਾ, ਰੋਜ਼ਾਨਾ ਐਕਸਟਰੈਕਸ਼ਨ, ਫਾਰਮੈਟਿੰਗ, ਅਤੇ ਸਧਾਰਨ ਟੂਲ ਡਿਸਪੈਚ ਲਈ 3 B Llama 3.2 ਇੱਕ ਵਿਹਾਰਕ ਚੋਣ ਬਣੀ ਰਹੇਗੀ, ਜਦੋਂ ਕਿ Muse Glimmer ਕਦੇ-ਕਦੇ ਆਉਣ ਵਾਲੀਆਂ ਡੂੰਘੀ ਸੋਚ ਵਾਲੀਆਂ ਚੁਣੌਤੀਆਂ ਲਈ ਇੱਕ ਉੱਚ ਪੱਧਰ ਦੇ ਵਿਕਲਪ ਵਜੋਂ ਰਹੇਗਾ।
