Prism ML ਨੇ Bonsai 27B ਲਾਂਚ ਕੀਤਾ ਹੈ, ਜੋ Qwen 3.6 large-language model ਦਾ ਇੱਕ ਅਜਿਹਾ ਵਰਜ਼ਨ ਹੈ ਜੋ ਮੋਬਾਈਲ ਫ਼ੋਨ 'ਤੇ ਚੱਲ ਸਕਦਾ ਹੈ। 1-bit quantization ਦੀ ਵਰਤੋਂ ਕਰਕੇ 54 GB ਦੇ ਅਸਲ ਮਾਡਲ ਨੂੰ 4 GB ਤੋਂ ਵੀ ਘੱਟ ਤੱਕ ਸੁੰਗੜ ਕੇ, ਕੰਪਨੀ ਨੇ 14× ਸਾਈਜ਼ ਘਟਾਇਆ ਹੈ ਅਤੇ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ cloud API ਕਾਲਾਂ ਤੋਂ ਬਿਨਾਂ ਮਾਡਲ ਨੂੰ ਸਥਾਨਕ (locally) ਤੌਰ 'ਤੇ ਚਲਾਉਣ ਦੀ ਸਹੂਲਤ ਦਿੱਤੀ ਹੈ।

ਕੰਪਰੈਸ਼ਨ (compression) ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

LLMs ਨੂੰ ਆਮ ਤੌਰ 'ਤੇ ਡੈਸਕਟਾਪ-ਕਲਾਸ GPU ਜਾਂ ਇੱਕ ਪੇਡ API ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ ਕਿਉਂਕਿ ਉਹਨਾਂ ਦੇ weights ਕਈ ਗੀਗਾਬਾਈਟ ਜਗ੍ਹਾ ਘੇਰਦੇ ਹਨ। Quantization—ਹਰ weight ਲਈ ਘੱਟ bits ਦੀ ਵਰਤੋਂ ਕਰਨਾ—ਮਾਡਲ ਦੇ ਆਕਾਰ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ ਪਰ ਇਸ ਨਾਲ ਗਿਆਨ (knowledge) ਵੀ ਘਟ ਸਕਦਾ ਹੈ। Bonsai ਦੋ ਅන්ත ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ: ਇੱਕ ternary variant (ਤਿੰਨ ਸੰਭਵ weight values, 7.2 GB) ਅਤੇ ਇੱਕ aggressive 1-bit variant (3.9 GB)। ਸਾਈਜ਼ ਅਤੇ ਸਮਰੱਥਾ ਵਿਚਕਾਰ ਦਾ ਸਮਝੌਤਾ (trade-off) ਹੀ ਇਸ ਟੈਸਟ ਦਾ ਮੁੱਖ ਆਧਾਰ ਹੈ।

ਤੱਥਾਂ ਦੀ ਯਾਦਦਾਸ਼ਤ (factual recall) ਵਿੱਚ ਮਾਡਲ ਕਿਵੇਂ ਰਿਹਾ

ਅਸਲ Qwen 3.6 ਨੇ ਟੈਸਟਰ ਦੇ ਸੂਟ ਵਿੱਚ ਇਤਿਹਾਸਕ-ਮਿਤੀਆਂ ਨਾਲ ਸਬੰਧਤ ਹਰ ਸਵਾਲ ਦਾ ਸਹੀ ਜਵਾਬ ਦਿੱਤਾ। Ternary Bonsai ਛੇ ਵਿੱਚੋਂ ਪੰਜ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਦੇਣ ਵਿੱਚ ਅਸਫਲ ਰਿਹਾ, ਅਤੇ 1-bit ਵਰਜ਼ਨ ਹਰ ਇੱਕ ਮਿਤੀ ਵਾਲੇ ਸਵਾਲ ਵਿੱਚ ਫੇਲ੍ਹ ਹੋ ਗਿਆ। ਉਮੀਦ ਅਨੁਸਾਰ, ਤੇਜ਼ ਕੰਪਰੈਸ਼ਨ ਪਹਿਲਾਂ ਦੁਰਲੱਭ ਅਤੇ ਖਾਸ ਤੱਥਾਂ ਨੂੰ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਸਿਰਫ਼ ਉਹ ਵਿਆਪਕ ਭਾਸ਼ਾ ਪੈਟਰਨਾਂ ਨੂੰ ਬਚਾਉਂਦਾ ਹੈ ਜੋ ਬੋਲਣ ਦੀ ਰਵਾਨਗੀ (fluency) ਨੂੰ ਬਣਾਈ ਰੱਖਦੇ ਹਨ।

ਕੋਡਿੰਗ ਪ੍ਰਦਰਸ਼ਨ ਇੱਕ ਵੱਖਰੀ ਕਹਾਣੀ ਦੱਸਦਾ ਹੈ

ਜਦੋਂ ਪ੍ਰੋਂਪਟ (prompts) ਕੋਡਿੰਗ ਕੰਮਾਂ ਵੱਲ ਮੁੜੇ, ਤਾਂ ਨਤੀਜੇ ਬਦਲ ਗਏ। ਤਿੰਨਾਂ ਮਾਡਲਾਂ ਨੇ ਬਿਨਾਂ ਕਿਸੇ ਗਲਤੀ ਦੇ ਕਲਾਸਿਕ concurrency bugs ਨੂੰ ਹੱਲ ਕਰ ਲਿਆ। ਇੱਕ ਚੁਣੌਤੀਪੂਰਨ React animation ਚੈਲੇਂਜ ਵਿੱਚ, 1-bit Bonsai ਨੇ ਦੋ ਕੋਸ਼ਿਸ਼ਾਂ ਵਿੱਚ ਕੰਮ ਪੂਰਾ ਕਰ ਲਿਆ, ਜਦੋਂ ਕਿ ਅਸਲ ਮਾਡਲ ਨੂੰ ਚਾਰ ਕੋਸ਼ਿਸ਼ਾਂ ਦੀ ਲੋੜ ਪਈ ਕਿਉਂਕਿ ਉਸਨੇ ਕੋਡ ਨੂੰ ਪਾਰਸ (parsing) ਕਰਨ ਵਿੱਚ ਵਾਧੂ ਸਮਾਂ ਲਗਾਇਆ। Ternary ਵਰਜ਼ਨ ਨੂੰ ਦਸ ਕੋਸ਼ਿਸ਼ਾਂ ਦੀ ਲੋੜ ਪਈ ਅਤੇ ਅੰਤ ਵਿੱਚ ਟੈਸਟ ਸਰਵਰ ਕ੍ਰੈਸ਼ ਹੋ ਗਿਆ।

ਵਿਵਹਾਰਕ ਰੁਕਾਵਟਾਂ (Practical hurdles)

Bonsai ਪ੍ਰਸਿੱਧ Ollama runtime 'ਤੇ ਨਹੀਂ ਚੱਲਦਾ। 1-bit ਮਾਡਲ ਨੂੰ Prism ML ਦੁਆਰਾ ਦਿੱਤੇ ਗਏ ਇੱਕ ਕਸਟਮ execution layer ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਇਸ ਲਈ ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਇਸਨੂੰ ਚਲਾਉਣ ਲਈ ਗੈਰ-ਮਿਆਰੀ (non-standard) ਸਾਫਟਵੇਅਰ ਇੰਸਟਾਲ ਕਰਨਾ ਪਵੇਗਾ। ਇਹ ਨਿਰਭਰਤਾ ਮਾਡਲ ਦੀ ਵਰਤੋਂ ਨੂੰ ਸਿਰਫ਼ ਉਹਨਾਂ ਤੱਕ ਸੀਮਤ ਕਰਦੀ ਹੈ ਜੋ ਆਪਣੇ ਮਾਹੌਲ (environment) ਨੂੰ ਬਦਲਣ ਵਿੱਚ ਮਾਹਰ ਹਨ।

ਕਿਸ ਨੂੰ Bonsai 'ਤੇ ਵਿਚਾਰ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ, ਅਤੇ ਕਿਸ ਨੂੰ ਦੂਰ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ

  • ਆਮ ਉਦੇਸ਼ਾਂ ਲਈ ਚੈਟ (General-purpose chat) – ਤੱਥਾਂ ਦੇ ਵੇਰਵਿਆਂ ਵਿੱਚ ਭਾਰੀ ਕਮੀ Bonsai ਨੂੰ ਗਿਆਨ-ਆਧਾਰਿਤ ਸਹਾਇਕ (knowledge-base assistant) ਵਜੋਂ ਅਣਉਚਿਤ ਬਣਾਉਂਦੀ ਹੈ। ਇਤਿਹਾਸ, ਵਿਗਿਆਨ, ਜਾਂ ਮੌਜੂਦਾ ਘਟਨਾਵਾਂ ਦੇ ਸਹੀ ਜਵਾਬਾਂ ਲਈ, ਅਸਲ ਮਾਡਲ ਜਾਂ cloud API ਦੀ ਵਰਤੋਂ ਕਰੋ।
  • ਲੋਕਲ ਕੋਡਿੰਗ ਸਹਾਇਕ (Local coding aide) – ਉਹ ਡਿਵੈਲਪਰ ਜੋ ਇੱਕ ਅਫਲਾਈਨ ਟੂਲ ਚਾਹੁੰਦੇ ਹਨ ਜੋ ਕੋਡ ਸੁਝਾ ਸਕਦਾ ਹੈ, ਬੱਗ (bugs) ਫੜ ਸਕਦਾ ਹੈ, ਅਤੇ ਫ਼ੋਨ ਜਾਂ ਘੱਟ ਸਮਰੱਥਾ ਵਾਲੇ ਲੈਪਟਾਪ 'ਤੇ ਚੱਲ ਸਕਦਾ ਹੈ, ਉਹਨਾਂ ਲਈ 1-bit ਵਰਜ਼ਨ ਤੇਜ਼ੀ ਅਤੇ ਘੱਟ ਸਟੋਰੇਜ ਲਾਗਤ ਪ੍ਰਦਾਨ ਕਰੇਗਾ। ਇਹ ਇੱਕ ਖੁਦਮੁਖਤਿਆਰ ਏਜੰਟ (autonomous agent) ਨਹੀਂ ਹੈ, ਪਰ ਇਹ ਲੌਜਿਕ ਅਤੇ ਸਿੰਟੈਕਸ (syntax) ਨੂੰ ਕੁਸ਼ਲਤਾ ਨਾਲ ਸੰਭਾਲਦਾ ਹੈ।

ਨਿਚੋੜ (Bottom line)

Bonsai 27B ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਤੁਸੀਂ 54 GB ਦੇ LLM ਨੂੰ ਫ਼ੋਨ-ਅਨੁਕੂਲ 3.9 GB ਤੱਕ ਕੰਪਰੈਸ ਕਰ ਸਕਦੇ ਹੋ ਅਤੇ ਫਿਰ ਵੀ ਹੈਰਾਨੀਜਨਕ ਤੌਰ 'ਤੇ ਤੇਜ਼ ਅਤੇ ਸਮਰੱਥ ਕੋਡ ਸੁਝਾਅ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੇ ਹੋ। ਇਸਦੀ ਕੀਮਤ ਖਾਸ ਤੱਥਾਂ ਦੀ ਯਾਦਦਾਸ਼ਤ ਦਾ ਲਗਭਗ ਪੂਰੀ ਤਰ੍ਹਾਂ ਖਤਮ ਹੋਣਾ ਹੈ, ਇਸ ਲਈ ਇਹ ਮਾਡਲ ਉਹਨਾਂ ਡਿਵੈਲਪਰਾਂ ਲਈ ਹੈ ਜੋ ਵਿਆਪਕ ਗਿਆਨ (encyclopedic knowledge) ਨਾਲੋਂ ਅਫਲਾਈਨ ਰਫ਼ਤਾਰ ਨੂੰ ਤਰਜੀਹ ਦਿੰਦੇ ਹਨ।