Meta ਦਾ ਨਵਾਂ 30-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ Muse Glimmer, MacBook Pro M2 Pro 'ਤੇ 3-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ Llama 3.2 ਨਾਲੋਂ 56 ਗੁਣਾ ਹੌਲੀ ਚੱਲਦਾ ਹੈ, ਜੋ ਕਿ ਇਸ ਮਾਡਲ ਨੂੰ ਉਹਨਾਂ ਤੇਜ਼ ਅਤੇ ਵਾਰ-ਵਾਰ ਹੋਣ ਵਾਲੀਆਂ ਕਾਲਾਂ ਲਈ ਅਵਿਵਹਾਰਕ ਬਣਾਉਂਦਾ ਹੈ ਜੋ ਜ਼ਿਆਦਾਤਰ local-agent ਵਰਕਫਲੋ ਨੂੰ ਚਲਾਉਂਦੀਆਂ ਹਨ।

Local agents ਲਈ ਰਫ਼ਤਾਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

Local-agent ਲੂਪਸ ਪ੍ਰਤੀ ਮਿੰਟ ਵਿੱਚ ਦਰਜਨਾਂ, ਕਈ ਵਾਰ ਸੈਂਕੜੇ ਮਾਡਲ ਕਾਲਾਂ ਕਰਦੇ ਹਨ। ਹਰ ਕਾਲ ਲੇਟੈਂਸੀ (latency) ਵਧਾਉਂਦੀ ਹੈ; ਇਹ ਕੁੱਲ ਦੇਰੀ ਪ੍ਰਤੀਕਿਰਿਆਸ਼ੀਲਤਾ (responsiveness) ਨੂੰ ਖ਼ਰਾਬ ਕਰ ਸਕਦੀ ਹੈ। ਇਸ ਲਈ, ਡਿਵੈਲਪਰ ਸਿਰਫ਼ ਉਸ ਸਭ ਤੋਂ ਛੋਟੇ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ ਜੋ ਸਹੀ ਨਤੀਜੇ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਵੱਡੇ ਮਾਡਲਾਂ ਨੂੰ ਉਦੋਂ ਹੀ ਬਦਲਦੇ ਹਨ ਜਦੋਂ ਕਿਸੇ ਸਮੱਸਿਆ ਲਈ ਡੂੰਘੀ ਸੋਚ-ਵਿਚਾਰ ਦੀ ਸੱਚਮੁੱਚ ਲੋੜ ਹੁੰਦੀ ਹੈ। Meta ਨੇ Muse Glimmer ਨੂੰ ਇਹਨਾਂ ਲੂਪਸ ਲਈ ਬਣਾਏ ਗਏ ਇੱਕ "thinking" ਮਾਡਲ ਵਜੋਂ ਮਾਰਕੀਟ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ on-device ਫਾਇਦੇ ਨੂੰ ਗੁਆਏ ਬਿਨਾਂ ਬਿਹਤਰ ਇਨਫਰੈਂਸ (inference) ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ।

ਬੈਂਚਮਾਰਕ ਸੈੱਟਅੱਪ

ਅਸੀਂ 32 GB RAM ਵਾਲੇ MacBook Pro M2 Pro 'ਤੇ ਟੈਸਟ ਚਲਾਇਆ, ਜਿਸ ਵਿੱਚ ਤਿੰਨ ਪ੍ਰਤੀਨਿਧ ਕੰਮਾਂ ਨੂੰ ਮਾਪਿਆ ਗਿਆ:

  • Context re-read speed – ਮਾਡਲ ਉਸ ਪ੍ਰੋਂਪਟ ਨੂੰ ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਪ੍ਰੋਸੈਸ ਕਰਦਾ ਹੈ ਜੋ ਉਹ ਪਹਿਲਾਂ ਹੀ ਦੇਖ ਚੁੱਕਾ ਹੈ।
  • Constrained JSON extraction – ਫ੍ਰੀ-ਫਾਰਮ ਟੈਕਸਟ ਤੋਂ ਸੰਰਚਿਤ (structured) ਡੇਟਾ ਕੱਢਣਾ, ਜੋ ਕਿ ਟੂਲਸ ਦੀ ਵਰਤੋਂ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਇੱਕ ਆਮ ਕਦਮ ਹੈ।
  • Tool calling – ਸਹੀ ਫਾਰਮੈਟ ਵਿੱਚ ਫੰਕਸ਼ਨ ਕਾਲ ਤਿਆਰ ਕਰਨਾ।

ਤਿੰਨ ਮਾਡਲਾਂ ਦੀ ਤੁਲਨਾ ਕੀਤੀ ਗਈ:

ਮਾਡਲ ਪ੍ਰੋਂਪਟ ਸਪੀਡ (tok/s) ਜਨਰੇਸ਼ਨ ਸਪੀਡ (tok/s) JSON ਸਫਲਤਾ (5-ਟ੍ਰਾਇਲ) ਪ੍ਰਤੀ ਕਾਲ ਸਮਾਂ
Llama 3.2 3B 702.9 56.7 5/5 0.6 s
Qwen 3 14B 161.8 14.6 5/5 16.1 s
Muse Glimmer 30B 56.7 7.1 5/5 33.4 s

ਤਿੰਨੋਂ ਮਾਡਲਾਂ ਨੇ ਸਹੀ ਨਤੀਜੇ ਦਾ ਟੀਚਾ ਪ੍ਰਾਪਤ ਕੀਤਾ, ਅਤੇ ਹਰ ਟ੍ਰਾਇਲ ਵਿੱਚ ਇੱਕੋ ਜਿਹਾ JSON ਆਉਟਪੁੱਟ ਦਿੱਤਾ। 3 B ਮਾਡਲ ਨੇ ਪੂਰੀ ਪਾਈਪਲਾਈਨ ਇੱਕ ਸੈਕਿੰਡ ਤੋਂ ਵੀ ਘੱਟ ਸਮੇਂ ਵਿੱਚ ਪੂਰੀ ਕਰ ਲਈ; 30 B ਮਾਡਲ ਨੂੰ ਅੱਧੇ ਮਿੰਟ ਤੋਂ ਵੱਧ ਸਮਾਂ ਲੱਗਿਆ।

ਅੰਕੜਿਆਂ ਦਾ ਕੀ ਮਤਲਬ ਹੈ

56 ਗੁਣਾ ਦੀ ਸੁਸਤੀ ਸਿੱਧੇ ਤੌਰ 'ਤੇ CPU ਦੀ ਵਰਤੋਂ ਅਤੇ wall-clock ਸਮੇਂ ਨੂੰ ਵਧਾਉਂਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਊਰਜਾ ਦੀ ਖਪਤ ਵਧ ਜਾਂਦੀ ਹੈ ਅਤੇ ਇੱਕ ਸਿੰਗਲ ਮਸ਼ੀਨ ਕਿੰਨੇ ਇਕੱਠੇ (concurrent) agents ਨੂੰ ਸੰਭਾਲ ਸਕਦੀ ਹੈ, ਇਸ 'ਤੇ ਸੀਮਾ ਲੱਗ ਜਾਂਦੀ ਹੈ। "thinking" ਮੋਡ ਬੰਦ ਹੋਣ ਦੇ ਬਾਵਜੂਦ, Muse Glimmer ਵਿਚਾਰ-ਵਿਚਾਰ ਕਰਨ ਲਈ ਵਾਧੂ ਟੋਕਨ ਖਰਚ ਕਰਦਾ ਰਿਹਾ, ਜੋ ਇਹ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ ਕਿ ਲੇਟੈਂਸੀ (latency) ਇੱਕ ਵਿਕਲਪਿਕ ਵਿਸ਼ੇਸ਼ਤਾ ਹੋਣ ਦੀ ਬਜਾਏ ਆਰਕੀਟੈਕਚਰ ਦਾ ਹੀ ਹਿੱਸਾ ਹੈ।

ਚੈਟ-ਬੋਟਸ, ਪਰਸਨਲ ਅਸਿਸਟੈਂਟ, ਜਾਂ ਆਟੋਨੋਮਸ ਸਕ੍ਰਿਪਟਸ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਲਈ, ਜਿਨ੍ਹਾਂ ਨੂੰ ਤੁਰੰਤ ਪ੍ਰਤੀਕਿਰਿਆ ਦੇਣੀ ਚਾਹੀਦੀ ਹੈ—ਜਿਵੇਂ ਕਿ "ਮੇਰੇ ਕੈਲੰਡਰ ਇਵੈਂਟਸ ਲਿਆਓ" ਜਾਂ "ਨਵੇਂ ਈਮੇਲ ਦਾ ਸਾਰ ਲਓ"—Llama 3.2 ਦੀ 0.6-ਸੈਕਿੰਡ ਦੀ ਲੇਟੈਂਸੀ ਮਨੁੱਖੀ-ਸਵੀਕਾਰਯੋਗ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਹੈ। Muse Glim

Muse Glimmer ਉਹ ਡੂੰਘਾਈ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਜਿਸਦਾ ਵਾਅਦਾ ਇੱਕ 30 B ਮਾਡਲ ਕਰਦਾ ਹੈ, ਪਰ ਮੌਜੂਦਾ ਉਪਭੋਗਤਾ ਹਾਰਡਵੇਅਰ 'ਤੇ ਇਹ ਉਹਨਾਂ ਹਾਈ-ਫ੍ਰੀਕੁਐਂਸੀ ਲੂਪਸ ਲਈ ਬਹੁਤ ਜ਼ਿਆਦਾ ਧੀਮਾ ਹੈ ਜੋ ਜ਼ਿਆਦਾਤਰ ਲੋਕਲ ਏਜੰਟਸ ਨੂੰ ਚਲਾਉਂਦੇ ਹਨ। ਆਨ-ਡਿਵਾਈਸ ਮਾਡਲਸ ਨੂੰ ਐਕਸਟਰਨਲ APIs ਵਾਂਗ ਸਮਝੋ: ਸਭ ਤੋਂ ਛੋਟੇ ਮਾਡਲ ਤੋਂ ਸ਼ੁਰੂਆਤ ਕਰੋ ਜੋ ਸ਼ੁੱਧਤਾ ਦੀਆਂ ਲੋੜਾਂ ਨੂੰ ਪੂਰਾ ਕਰਦਾ ਹੋਵੇ, ਅਤੇ ਭਾਰੀ ਸੋਚਣ ਵਾਲੇ ਮਾਡਲ ਨੂੰ ਉਹਨਾਂ ਕੰਮਾਂ ਲਈ ਰਾਖਵਾਂ ਰੱਖੋ ਜਿਨ੍ਹਾਂ ਨੂੰ ਸੱਚਮੁੱਚ ਵਾਧੂ ਤਰਕ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਦੀ ਲੋੜ ਹੈ। ਜਦੋਂ ਤੱਕ Meta ਗਤੀ ਦੇ ਅੰਤਰ ਨੂੰ ਖਤਮ ਨਹੀਂ ਕਰ ਦਿੰਦਾ, ਰੋਜ਼ਾਨਾ ਐਕਸਟਰੈਕਸ਼ਨ, ਫਾਰਮੈਟਿੰਗ, ਅਤੇ ਸਧਾਰਨ ਟੂਲ ਡਿਸਪੈਚ ਲਈ 3 B Llama 3.2 ਇੱਕ ਵਿਹਾਰਕ ਚੋਣ ਬਣੀ ਰਹੇਗੀ, ਜਦੋਂ ਕਿ Muse Glimmer ਕਦੇ-ਕਦੇ ਆਉਣ ਵਾਲੀਆਂ ਡੂੰਘੀ ਸੋਚ ਵਾਲੀਆਂ ਚੁਣੌਤੀਆਂ ਲਈ ਇੱਕ ਉੱਚ ਪੱਧਰ ਦੇ ਵਿਕਲਪ ਵਜੋਂ ਰਹੇਗਾ।

ਸਰੋਤ: Frank Chu ਦੁਆਰਾ ਲਿਖਿਆ dev.to ਲੇਖ