PrismML ਦਾ ਨਵਾਂ Bonsai 27B 1-bit ਮਾਡਲ 3.9 GB ਦੀ ਫਾਈਲ ਵਿੱਚ ਆ ਜਾਂਦਾ ਹੈ ਅਤੇ iPhone 17 Pro Max 'ਤੇ ਲਗਭਗ 11 tokens ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਦੀ ਰਫ਼ਤਾਰ ਨਾਲ ਚੱਲਦਾ ਹੈ, ਜੋ ਇਸ ਗੱਲ ਦਾ ਸਬੂਤ ਹੈ ਕਿ ਇੱਕ 27-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ language model ਇੱਕ ਆਮ ਸਮਾਰਟਫੋਨ 'ਤੇ ਚੱਲ ਸਕਦਾ ਹੈ। ਇਹ ਦਾਅਵਾ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ on-device AI ਦੀਆਂ ਸੀਮਾਵਾਂ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ, ਜੋ ਡੇਟਾ ਨੂੰ cloud 'ਤੇ ਭੇਜੇ ਬਿਨਾਂ ਬਿਹਤਰ offline assistants ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ।

ਇਹ ਕਟੌਤੀ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

Full-precision Bonsai 27B ਦਾ ਭਾਰ 54.7 GB ਹੈ। ਮਾਡਲ ਨੂੰ single-bit representation ਵਿੱਚ quantise ਕਰਕੇ, PrismML ਨੇ ਇਸਨੂੰ 3.9 GB ਤੱਕ ਘਟਾ ਦਿੱਤਾ ਹੈ—ਜੋ ਕਿ ਆਕਾਰ ਵਿੱਚ 14 ਗੁਣਾ ਦੀ ਕਟੌਤੀ ਹੈ। ਇਹ compression ਮਾਡਲ ਨੂੰ ਤਕਨੀਕੀ ਤੌਰ 'ਤੇ high-end iPhones 'ਤੇ ਸਟੋਰ ਕਰਨ ਯੋਗ ਬਣਾਉਂਦਾ ਹੈ, ਇੱਕ ਅਜਿਹੀ ਸੀਮਾ ਜਿਸ ਤੋਂ ਪਹਿਲਾਂ ਕੁਝ ਸੌ ਮੈਗਾਬਾਈਟਾਂ ਤੋਂ ਵੱਧ ਕੁਝ ਵੀ ਸੰਭਵ ਨਹੀਂ ਸੀ।

Apple ਹਾਰਡਵੇਅਰ 'ਤੇ ਮਾਡਲ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ

PrismML ਨੇ ਇਹ ਮਾਡਲ Apple ਦੇ MLX stack ਲਈ ਬਣਾਇਆ ਹੈ, ਜੋ ਕਿ APIs ਦਾ ਇੱਕ ਸਮੂਹ ਹੈ ਜੋ developers ਨੂੰ neural engine 'ਤੇ ਸਿੱਧੇ ਤੌਰ 'ਤੇ neural nets ਚਲਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ। ਆਪਣੇ ਟੈਸਟਿੰਗ ਵਿੱਚ, ਮਾਡਲ ਨੇ iPhone 17 Pro Max 'ਤੇ ਲਗਭਗ ਹਰ ਸੈਕਿੰਡ 11 tokens ਜਨਰੇਟ ਕੀਤੇ। 15 ਮਿਆਰੀ language-model benchmarks ਵਿੱਚ, 1-bit ਵਰਜ਼ਨ ਨੇ ਅਸਲ ਮਾਡਲ ਦੇ quality scores ਦਾ 89.5% ਬਰਕਰਾਰ ਰੱਖਿਆ, ਜੋ ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ compression ਨੇ ਇਸਦੀ ਉਪਯੋਗਤਾ ਨੂੰ ਖ਼ਰਾਬ ਨਹੀਂ ਕੀਤਾ ਹੈ।

ਉਹ ਵਿਹਾਰਕ ਸੀਮਾਵਾਂ ਜਿਨ੍ਹਾਂ ਦਾ ਤੁਹਾਨੂੰ ਸਾਹਮਣਾ ਕਰਨਾ ਪਵੇਗਾ

  • Memory pressure – 3.9 GB ਦੀ ਫਾਈਲ ਤਾਂ ਆ ਜਾਂਦੀ ਹੈ, ਪਰ ਮਾਡਲ ਨੂੰ ਹਾਲੀਆ context ਨੂੰ ਸਟੋਰ ਕਰਨ ਲਈ ਇੱਕ key-value (KV) cache ਦੀ ਵੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਉਹ cache ਗੱਲਬਾਤ ਦੀ ਲੰਬਾਈ ਦੇ ਨਾਲ ਵਧਦਾ ਹੈ ਅਤੇ ਫ਼ੋਨ ਦੇ RAM ਦੀ ਵਰਤੋਂ ਨੂੰ ਵਧਾ ਸਕਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਰਫ਼ਤਾਰ ਘਟ ਸਕਦੀ ਹੈ।
  • Heat and battery – 27-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੇ network ਨੂੰ ਚਲਾਉਣਾ neural engine 'ਤੇ ਬੋਝ ਪਾਉਂਦਾ ਹੈ। ਲਗਾਤਾਰ ਲੋਡ ਹੇਠ ਫ਼ੋਨ ਗਰਮ ਹੋ ਜਾਂਦੇ ਹਨ, ਅਤੇ Apple ਦਾ thermal management ਹਾਰਡਵੇਅਰ ਦੀ ਰੱਖਿਆ ਲਈ performance ਨੂੰ ਘਟਾ (throttle) ਦੇਵੇਗਾ। PrismML ਨੇ ਬੈਟਰੀ ਖ਼ਤਮ ਹੋਣ ਦੇ ਕੋਈ ਸਪੱਸ਼ਟ ਅੰਕੜੇ ਜਾਰੀ ਨਹੀਂ ਕੀਤੇ ਹਨ, ਇਸ ਲਈ ਦਿਨ ਭਰ ਦੇ ਵਰਤੋਂ ਦੇ ਪੈਟਰਨ 'ਤੇ ਇਸਦਾ ਅਸਲ ਪ੍ਰਭਾਵ ਅਜੇ ਅਣਜਾਣ ਹੈ।
  • Device specificity – ਇਹ performance ਦਾ ਦਾਅਵਾ ਸਭ ਤੋਂ ਨਵੇਂ iPhone 17 Pro Max ਲਈ ਹੈ। ਪੁਰਾਣੇ iPhones, ਘੱਟ ਰੇਂਗ ਦੇ iOS devices, ਜਾਂ Android ਫ਼ੋਨਾਂ ਵਿੱਚ ਉਹੀ neural-engine ਸਮਰੱਥਾਵਾਂ ਨਹੀਂ ਹੁੰਦੀਆਂ ਅਤੇ ਉਹਨਾਂ ਵਿੱਚ inference ਹੌਲੀ ਹੋਵੇਗਾ ਜਾਂ ਸ਼ਾਇਦ ਮਾਡਲ ਉਹਨਾਂ ਵਿੱਚ ਚੱਲੇ ਹੀ ਨਾ।

ਕਿਸ ਨੂੰ ਫਾਇਦਾ ਹੋਵੇਗਾ, ਅਤੇ ਕੌਣ ਪਿੱਛੇ ਰਹਿ ਸਕਦਾ ਹੈ

Privacy-first ਐਪਸ ਦੇ developers ਹੁਣ on-device ਇੱਕ ਵੱਡਾ language model host ਕਰ ਸਕਦੇ ਹਨ, ਜਿਸ ਨਾਲ ਯੂਜ਼ਰ ਦਾ ਡੇਟਾ ਫ਼ੋਨ 'ਤੇ ਹੀ ਰਹੇਗਾ। ਇਸਦਾ ਮਤਲਬ ਹੋ ਸਕਦਾ ਹੈ ਕਿ ਬਿਨਾਂ ਕਿਸੇ cloud subscription ਦੇ ਵਧੇਰੇ responsive voice assistants, offline translation, ਜਾਂ contextual text generation ਮਿਲ ਸਕੇ।

Android ਨਿਰਮਾਤਾ ਅਤੇ mid-range ਫ਼ੋਨਾਂ ਦੇ ਯੂਜ਼ਰ ਇਸ ਤੋਂ ਵਾਂਝੇ ਰਹਿ ਜਾਣਗੇ। ਇਹ ਮਾਡਲ Apple ਦੇ proprietary stack 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ, ਇਸ ਲਈ ਉਹੀ compression ਦੂਜੇ ecosystems 'ਤੇ ਆਪਣੇ ਆਪ ਕੰਮ ਨਹੀਂ ਕਰੇਗੀ।

ਕੀ ਅਜੇ ਵੀ ਟੈਸਟ ਕੀਤਾ ਜਾਣਾ ਬਾਕੀ ਹੈ

PrismML ਦੇ ਅੰਕੜੇ ਅੰਦਰੂਨੀ benchmarks ਤੋਂ ਆਏ ਹਨ। ਸੁਤੰਤਰ ਟੈਸਟਰਾਂ ਨੂੰ ਲੰਬੇ ਸਮੇਂ ਤੱਕ token-per-second ਦੀ ਰਫ਼ਤਾਰ ਦੀ ਜਾਂਚ ਕਰਨੀ ਪਵੇਗੀ, ਅਸਲ ਬੈਟਰੀ ਦੀ ਖਪਤ ਨੂੰ ਮਾਪਣਾ ਪਵੇਗਾ, ਅਤੇ ਇਹ ਦੇਖਣਾ ਪਵੇਗਾ ਕਿ KV cache ਵਧਣ ਨਾਲ performance ਕਿੰਨੀ ਤੇਜ਼ੀ ਨਾਲ ਘਟਦੀ ਹੈ। ਅਸਲ ਵਰਤੋਂ—ਜਿਵੇਂ ਕਿ ਇੱਕ ਘੰਟੇ ਤੱਕ ਚੈਟ ਕਰਨਾ, content streaming ਕਰਨਾ, ਜਾਂ ਮਾਡਲ ਨੂੰ ਹੋਰ ਐਪਸ ਦੇ ਨਾਲ ਚਲਾਉਣਾ—ਇਹ ਦੱਸੇਗਾ ਕਿ ਕੀ 11-token-per-second ਦਾ ਅੰਕੜਾ ਇੱਕ ਕੰਟਰੋਲਡ ਲੈਬ ਤੋਂ ਬਾਹਰ ਟਿਕ ਸਕਦਾ ਹੈ।

Takeaway

Bonsai 27B ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ 27-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੇ language models ਨੂੰ ਇੰਨਾ ਕੰਪਰੈਸ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ ਕਿ ਉਹ ਇੱਕ flagship iPhone 'ਤੇ ਚੱਲ ਸਕਣ, ਜੋ ਕਿ ਇੱਕ ਮੱਧਮ ਰਫ਼ਤਾਰ 'ਤੇ ਲਗਭਗ ਪੂਰੀ ਕੁਆਲਿਟੀ ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ। ਇਹ ਵੱਡੀ ਪ੍ਰਾਪਤੀ Apple ਦੇ MLX stack 'ਤੇ ਨਿਰਭਰ ਕਰਦੀ ਹੈ ਅਤੇ ਅਜੇ ਵੀ ਵਿਹਾਰਕ ਰੁਕਾਵਟਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰ ਰਹੀ ਹੈ: memory overhead, thermal throttling, ਅਤੇ ਬੈਟਰੀ 'ਤੇ ਅਣਜਾਣ ਪ੍ਰਭਾਵ। ਜੇਕਰ ਅਗਲੇ ਟੈਸਟਾਂ ਵਿੱਚ ਇਹ ਦਾਅਵੇ ਸਹੀ ਸਾਬਤ ਹੁੰਦੇ ਹਨ, ਤਾਂ on-device AI ਕੁਝ ਖਾਸ ਡੈਮੋਸ ਤੋਂ ਨਿਕਲ ਕੇ ਰੋਜ਼ਾਨਾ ਦੀਆਂ ਐਪਸ ਦਾ ਹਿੱਸਾ ਬਣ ਸਕਦੀ ਹੈ—ਬਸ਼ਰਤੇ ਕਿ iOS flagships ਅਤੇ ਬਾਕੀ ਮਾਰਕੀਟ ਦੇ ਵਿਚਕਾਰ ਹਾਰਡਵੇਅਰ ਦਾ ਪਾੜਾ ਘਟ ਜਾਵੇ।