ਮੈਟਾ ਦਾ ਨਵਾਂ ਓਪਨ ਮਾਡਲ ਸਥਾਨਕ ਤੌਰ 'ਤੇ ਚੱਲ ਸਕਦਾ ਹੈ
ਮੈਟਾ ਨੇ 10 ਅਗਸਤ ਨੂੰ Muse Glimmer ਰਿਲੀਜ਼ ਕੀਤਾ, ਜੋ ਕਿ ਇੱਕ 30-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ ਲੈਂਗੂਏਜ ਮਾਡਲ ਹੈ। ਇਹ ਦਾਅਵਾ ਕੀਤਾ ਗਿਆ ਹੈ ਕਿ ਇਹ ਇੱਕ ਸਿੰਗਲ ਕੰਜ਼ਿਊਮਰ-ਗ੍ਰੇਡ GPU 'ਤੇ agentic coding ਅਤੇ personal-assistant ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ। ਇਹ ਦਾਅਵਾ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ ਉਸ ਸੀਮਾ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ ਜੋ ਡਿਵੈਲਪਰ ਡਾਟਾ ਨੂੰ ਕਲਾਉਡ 'ਤੇ ਭੇਜੇ ਬਿਨਾਂ ਸਥਾਨਕ ਤੌਰ 'ਤੇ ਚਲਾ ਸਕਦੇ ਹਨ, ਇੱਕ ਅਜਿਹਾ ਕਦਮ ਜੋ privacy-focused AI ਐਪਲੀਕੇਸ਼ਨਾਂ ਨੂੰ ਮੁੜ ਵਿਉਂਤਬੰਧਿਤ ਕਰ ਸਕਦਾ ਹੈ।
ਇਹ ਰਿਲੀਜ਼ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਓਪਨ-ਸੋਰਸ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲ (LLMs) ਹੁਣ code assistants ਤੋਂ ਲੈ ਕੇ personal knowledge bases ਤੱਕ private-by-design agents ਨੂੰ ਸ਼ਕਤੀ ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ। ਹੁਣ ਤੱਕ, ਜ਼ਿਆਦਾਤਰ ਮਾਡਲ ਜੋ agent benchmarks 'ਤੇ ਵਧੀਆ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦੇ ਸਨ, ਉਹਨਾਂ ਲਈ server-grade hardware ਦੀ ਲੋੜ ਹੁੰਦੀ ਸੀ ਜਾਂ ਉਹ proprietary APIs 'ਤੇ ਨਿਰਭਰ ਸਨ। Muse Glimmer ਦਾ "ਕਿਤੇ ਵੀ ਚਲਾਓ" (run anywhere) ਦਾ ਵਾਅਦਾ 24 GB ਗ੍ਰਾਫਿਕਸ ਕਾਰਡ ਜਾਂ ਇੱਕ ਨਵੇਂ Apple Silicon Mac ਨਾਲ ਲੈਸ ਸ਼ੌਕੀਆ (hobbyists) ਅਤੇ ਛੋਟੀਆਂ ਟੀਮਾਂ ਲਈ 30B ਮਾਡਲ ਨੂੰ ਪਹੁੰਚ ਦੇ ਅੰਦਰ ਲਿਆਉਂਦਾ ਹੈ। ਜੇਕਰ ਮਾਡਲ ਆਪਣੇ ਦਾਅਵਿਆਂ 'ਤੇ ਖਰਾ ਉਤਰਦਾ ਹੈ, ਤਾਂ ਡਿਵੈਲਪਰ ਸਾਰੇ prompts ਅਤੇ outputs ਨੂੰ device 'ਤੇ ਹੀ ਰੱਖ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ hosted services ਦੇ ਨਾਲ ਆਉਣ ਵਾਲੇ data-exfiltration ਦੇ ਜੋਖਮਾਂ ਤੋਂ ਬਚਿਆ ਜਾ ਸਕਦਾ ਹੈ।
Muse Glimmer ਅਸਲ ਵਿੱਚ ਕੀ ਹੈ
Glimmer, ਮੈਟਾ ਦੀ closed-source Muse Spark ਲਾਈਨ ਦਾ ਇੱਕ ਘਟਾਇਆ ਹੋਇਆ (trimmed-down) ਸੰਸਕਰਣ ਹੈ। ਸਭ ਤੋਂ ਸਮਰੱਥ Spark variant, Muse Spark 1.2, ਅਜੇ ਵੀ ਜਨਤਾ ਲਈ ਉਪਲਬਧ ਨਹੀਂ ਹੈ, ਹਾਲਾਂਕਿ ਮੈਟਾ ਨੇ "ਕੁਝ ਹਫ਼ਤਿਆਂ ਵਿੱਚ" ਇੱਕ open release ਦਾ ਇਸ਼ਾਰਾ ਦਿੱਤਾ ਹੈ। ਇਹ ਸੰਦਰਭ ਮਹੱਤਵਪੂਰਨ ਹੈ: Glimmer ਦਾ ਮੁਲਾਂਕਣ ਕਿਸੇ ਅਣ-ਰਿਲੀਜ਼ ਕੀਤੇ ਮਾਡਲ ਦੇ preview ਵਜੋਂ ਕਰਨ ਦੀ ਬਜਾਏ ਇਸਦੀ ਆਪਣੀ ਯੋਗਤਾ ਦੇ ਆਧਾਰ 'ਤੇ ਕਰੋ।
ਇਸਦਾ ਆਰਕੀਟੈਕਚਰ ਇੱਕ dense causal transformer ਹੈ, ਜੋ ਕਿ ਇੱਕ ਕਲਾਸਿਕ ਡਿਜ਼ਾਈਨ ਹੈ ਜਿੱਥੇ ਹਰੇਕ token ਇੱਕ ਸਿੰਗਲ forward pass ਵਿੱਚ ਅਗਲੇ token ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ। ਇਹ ਸਾਦਗੀ ਲੈਪਟਾਪਾਂ 'ਤੇ ਆਸਾਨ ਤਾਇਨਾਤੀ (deployment) ਵਿੱਚ ਮਦਦ ਕਰਦੀ ਹੈ; ਇਸ ਵਿੱਚ ਕੋਈ mixture-of-experts routing ਜਾਂ ਹੋਰ ਭਾਰੀ ਤਕਨੀਕਾਂ ਨਹੀਂ ਹਨ ਜੋ ਕੁਝ ਮੁਕਾਬਲੇਬਾਜ਼ ਮਾਡਲ ਵਰਤਦੇ ਹਨ।
ਇੱਕ ਖਾਸ ਵਾਧਾ DFlash ਹੈ, ਜੋ ਕਿ ਇੱਕ speculative decoding ਤਕਨੀਕ ਹੈ ਜੋ ਭਵਿੱਖ ਦੇ tokens ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦੀ ਹੈ ਅਤੇ ਉਹਨਾਂ ਨੂੰ parallel ਵਿੱਚ ਸਵੀਕਾਰ ਕਰਦੀ ਹੈ। ਅਸਲ ਵਿੱਚ, DFlash ਟੈਕਸਟ ਦੀ ਗੁਣਵੱਤਾ ਨਾਲ ਸਮਝੌਤਾ ਕੀਤੇ ਬਿਨਾਂ latency ਨੂੰ ਘਟਾਉਂਦੀ ਹੈ, ਜੋ ਕਿ interactive agents ਲਈ ਇੱਕ ਲਾਹੇਵੰਦ ਵਿਸ਼ੇਸ਼ਤਾ ਹੈ।
Quantized weights ਮੈਮੋਰੀ ਦੀ ਵਰਤੋਂ ਨੂੰ ਲਗਭਗ 17 GB ਤੱਕ ਘਟਾ ਦਿੰਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਮਾਡਲ 24 GB VRAM ਵਾਲੇ GPUs 'ਤੇ ਚੱਲ ਸਕਦਾ ਹੈ। ਉਹੀ quantized version llama.cpp runtime ਰਾਹੀਂ Apple Silicon 'ਤੇ ਚੱਲਦਾ ਹੈ, ਜੋ macOS ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਮਾਡਲ ਲਈ ਇੱਕ native ਰਸਤਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
ਇਹ ਮੁਕਾਬਲੇਬਾਜ਼ੀ ਦੇ ਸਾਹਮਣੇ ਕਿਵੇਂ ਖੜ੍ਹਾ ਹੈ
ਮੈਟਾ ਨੇ Glimmer ਦਾ Google ਦੇ Gemma ਅਤੇ Alibaba ਦੇ Qwen ਦੇ ਵਿਰੁੱਧ benchmark ਕੀਤਾ। ਨਤੀਜੇ ਮਿਸ਼ਰਤ ਤਸਵੀਰ ਦਿਖਾਉਂਦੇ ਹਨ:
- Agent-oriented tasks – Glimmer ਕੁਝ benchmarks 'ਤੇ ਦੋਵਾਂ ਵਿਰੋਧੀਆਂ ਨੂੰ ਪਛਾੜ ਦਿੰਦਾ ਹੈ ਜੋ planning ਅਤੇ tool use ਦਾ ਟੈਸਟ ਕਰਦੇ ਹਨ।
- Coding and broad reasoning – Qwen ਲਗਾਤਾਰ Glimmer ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ, ਜੋ code generation ਅਤੇ ਕਈ ਤਰਕਸ਼ੀਲ ਪਹੇਲੀਆਂ (logical puzzles) 'ਤੇ ਉੱਚੀ ਸਟੀਕਤਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
- Safety metrics – Gemma ਘੱਟ ਉਲੰਘਣਾ ਦਰ ਦਰਜ ਕਰਦਾ ਹੈ, ਜੋ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਉਹੀ ਟੈਸਟ ਸ਼ਰਤਾਂ ਦੇ ਅਧੀਨ ਅਣਚਾਹੇ ਕੰਟੈਂਟ ਬਣਾਉਣ ਦੀ ਸੰਭਾਵਨਾ ਘੱਟ ਹੈ।
ਸੰਖੇਪ ਵਿੱਚ, Glimmer ਵਿਸ਼ੇਸ਼ agent workloads ਲਈ ਮੁਕਾਬਲੇਬਾਜ਼ ਹੈ ਪਰ ਇਹ ਵਿਆਪਕ coding ਜਾਂ reasoning ਦੇ ਖੇਤਰ ਵਿੱਚ ਦਬਦਬਾ ਨਹੀਂ ਬਣਾਉਂਦਾ।
ਸੁਰੱਖਿਆ ਸੰਕੇਤ ਅਤੇ ਉਹਨਾਂ ਦਾ ਕੀ ਮਤਲਬ ਹੈ
ਮੈਟਾ Glimmer ਨੂੰ personal agents ਦੇ ਅਧਾਰ ਵਜੋਂ ਮਾਰਕੀਟ ਕਰਦਾ ਹੈ ਜੋ ਫਾਈਲਾਂ ਪੜ੍ਹ ਸਕਦੇ ਹਨ, ਸੁਨੇਹੇ ਭੇਜ ਸਕਦੇ ਹਨ, ਅਤੇ ਹੋਰਨਾਂ ਤਰੀਕਿਆਂ ਨਾਲ ਉਪਭੋਗਤਾ ਦੇ ਬਦਲੇ ਕੰਮ ਕਰ ਸਕਦੇ ਹਨ। ਅਜਿਹੀਆਂ ਸਮਰੱਥਾਵਾਂ ਸੁਰੱਖਿਆ ਲਈ ਜੋਖਮ ਵਧਾਉਂਦੀਆਂ ਹਨ। ਦੋ ਅੰਦਰੂਨੀ ਮੁਲਾਂਕਣ ਮਾਡਲ ਦੇ ਰਿਸਕ ਪ੍ਰੋਫਾਈਲ 'ਤੇ ਰੌਸ਼ਨੀ ਪਾਉਂਦੇ ਹਨ:
- CI Memories test – Glimmer Gemma ਨਾਲੋਂ ਉੱਚੀ ਉਲੰਘਣਾ ਦਰ ਦਿਖਾਉਂਦਾ ਹੈ, ਜਿਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇਹ ਅਕਸਰ ਅਜਿਹੇ outputs ਪੈਦਾ ਕਰਦਾ ਹੈ ਜੋ ਪਹਿਲਾਂ ਤੋਂ ਨਿਰਧਾਰਤ ਸੁਰੱਖਿਆ ਨਿਯਮਾਂ ਦੀ ਉਲੰਘਣਾ ਕਰਦੇ ਹਨ।
- Siren AgentDojo attack suite – ਮਾਡਲ ਅਣਸੁਰੱਖਿਅਤ ਵਿਵਹਾਰ ਨੂੰ ਉਤੇਜਿਤ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤੇ ਗਏ adversarial prompts ਲਈ ਉੱਚੀ ਸਫਲਤਾ ਦਰ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ।
ਇਹ ਖੋਜਾਂ ਸੁਝਾਉਂਦੀਆਂ ਹਨ ਕਿ, ਬਿਨਾਂ ਕਿਸੇ ਤਿਆਰੀ ਦੇ (out of the box), Glimmer ਆਪਣੇ ਸਾਥੀਆਂ ਵਿੱਚੋਂ ਘੱਟੋ-ਘੱਟ ਇੱਕ ਨਾਲੋਂ ਸੁਰੱਖਿਆ ਕਮੀਆਂ ਲਈ ਵਧੇਰੇ ਪ੍ਰਵਿਰਤਿਤ ਹੈ। ਉਹ ਡਿਵੈਲਪਰ ਜੋ ਮਾਡਲ ਨੂੰ ਨਿੱਜੀ ਫਾਈਲਾਂ ਜਾਂ ਸੰਚਾਰ ਚੈਨਲਾਂ ਤੱਕ ਪਹੁੰਚ ਦੇਣ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਹੇ ਹਨ, ਉਹਨਾਂ ਨੂੰ ਬਾਹਰੀ content filters ਅਤੇ sandboxed execution environments ਜੋੜਨੇ ਚਾਹੀਦੇ ਹਨ।
ਕਿਸ ਨੂੰ ਇਸ ਨੂੰ ਚਲਾਉਣ ਬਾਰੇ ਵਿਚਾਰ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ
ਚੰਗੇ ਵਿਕਲਪ
- ਉਹ ਟੀਮਾਂ ਜਿਨ੍ਹਾਂ ਨੂੰ ਇੱਕ ਸਥਾਨਕ code-assistant ਦੀ ਲੋੜ ਹੈ ਜੋ ਨੈੱਟਵਰਕ ਤੋਂ ਬਾਹਰ ਰਹਿੰਦੇ ਹੋਏ ਪੂਰੀ ਰਿਪੋਜ਼ੀਟਰੀ (repository) ਨੂੰ ਅੰਸ਼ਗ੍ਰਹਿਣ (ingesting) ਕਰਨ ਦੇ ਯੋਗ ਹੋਵੇ।
- ਉਹ ਉਪਭੋਗਤਾ ਜੋ data residency ਨੂੰ ਤਰਜੀਹ ਦਿੰਦੇ ਹਨ ਅਤੇ ਇੱਕ ਅਜਿਹਾ LLM ਚਾਹੁੰਦੇ ਹਨ ਜੋ ਕਦੇ ਵੀ ਉਹਨਾਂ ਦੇ device ਤੋਂ ਬਾਹਰ ਨਾ ਜਾਵੇ।
- ਖੋਜਕਰਤਾ ਜਾਂ ਇੰਜੀਨੀਅਰ ਜੋ outputs ਨੂੰ batch-evaluate ਕਰਨ ਲਈ LLM-as-a-judge ਦੀ ਭਾਲ ਕਰ ਰਹੇ ਹਨ, ਜਿੱਥੇ ਗਤੀ ਅਤੇ on-device execution ਮਹੱਤਵਪੂਰਨ ਹੈ।
- ਕੋਈ ਵੀ ਜਿਸ ਕੋਲ 24 GB+ GPU ਜਾਂ Apple Silicon Mac ਹੈ ਜੋ llama.cpp ਚਲਾ ਸਕਦਾ ਹੈ।
ਹੋਰ ਲੋੜਾਂ ਲਈ ਬਿਹਤਰ ਵਿਕਲਪ
- ਜੇਕਰ ਕੋਡਿੰਗ ਦੀ ਸ਼ੁੱਧ ਪ੍ਰਦਰਸ਼ਨ ਸਭ ਤੋਂ ਵੱਡੀ ਤਰਜੀਹ ਹੈ, ਤਾਂ Qwen ਇਸ ਸਮੇਂ ਵਧੇਰੇ ਸ਼ੁੱਧਤਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
- ਜਦੋਂ ਬਹੁਤ ਹੀ ਸੰਵੇਦਨਸ਼ੀਲ ਨਿੱਜੀ ਡੇਟਾ ਨੂੰ ਸੰਭਾਲਿਆ ਜਾ ਰਿਹਾ ਹੋਵੇ, ਤਾਂ Gemma ਦੀ ਘੱਟ ਉਲੰਘਣਾ ਦਰ ਇਸਨੂੰ ਇੱਕ ਸੁਰੱਖਿਅਤ ਵਿਕਲਪ ਬਣਾਉਂਦੀ ਹੈ।
- ਜਿਨ੍ਹਾਂ ਡਿਵੈਲਪਰਾਂ ਕੋਲ ਲੋੜੀਂਦਾ ਹਾਰਡਵੇਅਰ ਨਹੀਂ ਹੈ, ਉਨ੍ਹਾਂ ਨੂੰ ਛੋਟੇ ਅਤੇ ਵਧੇਰੇ ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਸਮਰਥਿਤ ਮਾਡਲਾਂ ਵੱਲ ਦੇਖਣਾ ਚਾਹੀਦਾ ਹੈ ਜੋ 24 GB ਤੋਂ ਘੱਟ ਮੈਮੋਰੀ ਵਾਲੇ GPU 'ਤੇ ਚੱਲ ਸਕਦੇ ਹਨ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਆਉਣ ਵਾਲੇ ਹਫ਼ਤਿਆਂ ਵਿੱਚ Meta ਵੱਲੋਂ ਇੱਕ ਓਪਨ Muse Spark 1.2 ਦਾ ਇਸ਼ਾਰਾ ਸੰਤੁਲਨ ਨੂੰ ਡਰਾਮੇਟਿਕ ਤਰੀਕੇ ਨਾਲ ਬਦਲ ਸਕਦਾ ਹੈ। ਜੇਕਰ Spark ਉਹੀ ਹਾਰਡਵੇਅਰ ਵਰਤ ਕੇ Glimmer ਦੀ ਪ੍ਰਦਰਸ਼ਨ ਦੇ ਬਰਾਬਰ ਜਾਂ ਉਸ ਤੋਂ ਵਧੇਰੇ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦਾ ਹੈ, ਤਾਂ ਮੌਜੂਦਾ ਮਾਡਲ ਇੱਕ ਲੰਬੇ ਸਮੇਂ ਦੇ ਹੱਲ ਦੀ ਬਜਾਏ ਸਿਰਫ਼ ਇੱਕ ਮੁਢਲੇ ਪੜਾਅ ਵਜੋਂ ਰਹਿ ਸਕਦਾ ਹੈ। Glimmer ਦੀਆਂ ਸੁਰੱਖਿਆ ਕਮੀਆਂ ਪ੍ਰਤੀ ਕਮਿਊਨਿਟੀ ਦੀ ਪ੍ਰਤੀਕਿਰਿਆ—ਤੀਜੀ ਧਿਰ ਦੇ ਫਿਲਟਰਾਂ, ਫਾਈਨ-ਟਿਊਨਿੰਗ, ਜਾਂ ਪ੍ਰੋਂਪਟ ਇੰਜੀਨੀਅਰਿੰਗ ਰਾਹੀਂ—ਦੀ ਇਸਦੀ ਵਰਤੋਂ ਦੇ ਰੁਝਾਨ 'ਤੇ ਵੀ ਅਸਰ ਪਵੇਗਾ।
llama.cpp ਰਾਹੀਂ ਮਾਡਲ ਦੀ ਤੁਰੰਤ ਉਪਲਬਧਤਾ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਡਿਵੈਲਪਰ ਅੱਜ ਤੋਂ ਹੀ ਪ੍ਰਯੋਗ ਸ਼ੁਰੂ ਕਰ ਸਕਦੇ ਹਨ, ਪਰ ਨਿੱਜੀ ਡੇਟਾ ਲਈ ਇਸ 'ਤੇ ਭਰੋਸਾ ਕਰਨ ਦਾ ਫੈਸਲਾ Meta ਦੁਆਰਾ ਪ੍ਰਗਟ ਕੀਤੇ ਗਏ ਸੁਰੱਖਿਆ ਅੰਕੜਿਆਂ ਅਤੇ ਸੁਤੰਤਰ ਆਡਿਟਾਂ 'ਤੇ ਅਧਾਰਤ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ।
ਸਿੱਟਾ: Muse Glimmer ਡੈਸਕਟੌਪ 'ਤੇ 30B LLM ਲਿਆਉਂਦਾ ਹੈ, ਜੋ ਆਨ-ਡਿਵਾਈਸ ਏਜੰਟਾਂ ਲਈ ਨਵੇਂ ਰਾਹ ਖੋਲ੍ਹਦਾ ਹੈ, ਫਿਰ ਵੀ ਇਸਦੀ ਪ੍ਰਦਰਸ਼ਨ ਅਤੇ ਸੁਰੱਖਿਆ ਪ੍ਰਮੁੱਖ ਪ੍ਰਤੀਯੋਗੀਆਂ ਤੋਂ ਪਿੱਛੇ ਹੈ। ਇਸਦੀ ਵਰਤੋਂ ਉਦੋਂ ਕਰੋ ਜੇਕਰ ਸਥਾਨਕ (local) ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਜ਼ਰੂਰੀ ਹੈ ਅਤੇ ਤੁਸੀਂ ਹਾਰਡਵੇਅਰ ਦਾ ਖਰਚਾ ਚੁੱਕ ਸਕਦੇ ਹੋ; ਨਹੀਂ ਤਾਂ, ਅਜਿਹੇ ਮਾਡਲ ਦੀ ਚੋਣ ਕਰੋ ਜੋ ਪਹਿਲਾਂ ਹੀ ਕੋਡਿੰਗ ਸ਼ੁੱਧਤਾ ਵਿੱਚ ਮਾਹਰ ਹੈ ਜਾਂ ਵਧੇਰੇ ਮਜ਼ਬੂਤ ਸੁਰੱਖਿਆ ਰਿਕਾਰਡ ਪੇਸ਼ ਕਰਦਾ ਹੈ।
