VIDRAFT ਦੁਆਰਾ ਰਿਲੀਜ਼ ਕੀਤਾ ਗਿਆ 35-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ ਲੈਂਗੂਏਜ ਮਾਡਲ, POCKET-35B, ਹੁਣ ਸਿਰਫ਼ CPU ਵਾਲੇ ਲੈਪਟਾਪ 'ਤੇ ਚਲਾਇਆ ਜਾ ਸਕਦਾ ਹੈ। ਮਾਡਲ ਦੇ GGUF-ਫਾਰਮੈਟ ਵਾਲੇ weights ਸਿੱਧੇ llama.cpp ਜਾਂ Ollama ਵਿੱਚ ਲੋਡ ਹੋ ਜਾਂਦੇ ਹਨ, ਇਸ ਲਈ ਜਿਨ੍ਹਾਂ ਟੀਮਾਂ ਕੋਲ GPU ਬਜਟ ਜ਼ੀਰੋ ਹੈ, ਉਹ ਤੁਰੰਤ ਪ੍ਰਯੋਗ ਸ਼ੁਰੂ ਕਰ ਸਕਦੀਆਂ ਹਨ। ਆਪਣੀ ਲਾਂਚਿੰਗ ਦੇ ਸੱਤ ਹਫ਼ਤਿਆਂ ਦੇ ਅੰਦਰ ਹੀ, ਮਾਡਲ ਨੇ Hugging Face 'ਤੇ ਇੱਕ ਮਿਲੀਅਨ ਡਾਊਨਲੋਡਾਂ ਦਾ ਅੰਕੜਾ ਪਾਰ ਕਰ ਲਿਆ, ਜੋ ਕਿ ਦੁਨੀਆ ਭਰ ਵਿੱਚ ਸਾਰੇ GGUF ਡਾਊਨਲੋਡਾਂ ਵਿੱਚ 13ਵੇਂ ਸਥਾਨ 'ਤੇ ਹੈ।
ਹੁਣ ਸਿਰਫ਼ CPU ਵਾਲਾ LLM ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਉਹ ਕਾਰੋਬਾਰੀ ਸੰਸਥਾਵਾਂ (Enterprises) ਜਿਨ੍ਹਾਂ ਨੂੰ ਆਪਣਾ ਨਿੱਜੀ ਟੈਕਸਟ—ਗਾਹਕਾਂ ਦੇ ਈਮੇਲ, ਅੰਦਰੂਨੀ ਟਿਕਟਾਂ, ਕੋਡ ਸਨਿਪੇਟਸ—ਆਪਣੇ ਪ੍ਰੀਮਿਸਿਸ (on-premises) 'ਤੇ ਰੱਖਣ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਉਹ ਅਕਸਰ ਸਮਰਪਿਤ ਗ੍ਰਾਫਿਕਸ ਕਾਰਡਾਂ ਲਈ ਫੰਡਾਂ ਦੀ ਕਮੀ ਮਹਿਸੂਸ ਕਰਦੇ ਹਨ। ਹਾਲ ਹੀ ਤੱਕ, ਇੱਕੋ ਇੱਕ ਵਿਹਾਰਕ ਵਿਕਲਪ ਡਾਟਾ ਨੂੰ ਕਲਾਉਡ-ਹੋਸਟਡ API 'ਤੇ ਭੇਜਣਾ ਸੀ, ਜਿਸ ਨਾਲ ਪ੍ਰਾਈਵੇਸੀ ਨਾਲ ਸਮਝੌਤਾ ਕਰਨਾ ਪੈਂਦਾ ਸੀ ਅਤੇ ਵਾਰ-ਵਾਰ ਖਰਚੇ ਵਧਦੇ ਸਨ। POCKET-35B ਇੱਕ ਵਿਚਕਾਰਲਾ ਰਸਤਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ: ਇੱਕ ਅਜਿਹਾ ਮਾਡਲ ਜੋ ਗੁੰਝਲਦਾਰ ਪ੍ਰੋਂਪਟਸ (prompts) ਨੂੰ ਸੰਭਾਲਣ ਲਈ ਕਾਫ਼ੀ ਵੱਡਾ ਹੈ ਅਤੇ ਨਾਲ ਹੀ ਇੱਕ ਆਮ ਦਫ਼ਤਰੀ ਲੈਪਟਾਪ ਜਾਂ ਮਿਨੀ-PC ਦੀ ਮੈਮੋਰੀ ਸੀਮਾ ਵਿੱਚ ਫਿੱਟ ਹੋ ਜਾਂਦਾ ਹੈ।
ਮਾਡਲ ਲੈਪਟਾਪ 'ਤੇ ਕਿਵੇਂ ਫਿੱਟ ਹੁੰਦਾ ਹੈ
- GGUF format – ਇੱਕ ਬਾਈਨਰੀ ਕੰਟੇਨਰ ਜੋ quantized weights ਨੂੰ ਸਟੋਰ ਕਰਦਾ ਹੈ।
- Compatibility – llama.cpp ਅਤੇ Ollama ਦੋਵਾਂ ਵਿੱਚ ਅਜਿਹੇ runtimes ਸ਼ਾਮਲ ਹਨ ਜੋ GGUF ਫਾਈਲਾਂ ਨੂੰ ਪੜ੍ਹਦੇ ਹਨ ਅਤੇ CPU 'ਤੇ inference ਚਲਾਉਂਦੇ ਹਨ। ਕੁਝ ਲੇਅਰਾਂ ਨੂੰ offload ਕਰਨ ਲਈ ਇੱਕ integrated GPU ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ, ਪਰ ਇਹ ਲਾਜ਼ਮੀ ਨਹੀਂ ਹੈ।
- RAM check – GGUF ਫਾਈਲ ਦਾ ਆਕਾਰ ਉਹ ਘੱਟੋ-ਘੱਟ RAM ਹੈ ਜਿਸਦੀ ਤੁਹਾਨੂੰ ਲੋੜ ਹੈ। ਜੇਕਰ ਫਾਈਲ ਦਾ ਆਕਾਰ, ਉਦਾਹਰਨ ਲਈ, ਕੁਝ ਗੀਗਾਬਾਈਟ ਹੈ, ਤਾਂ ਡਾਊਨਲੋਡ ਸ਼ੁਰੂ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਹੀ ਘੱਟੋ-ਘੱਟ ਉਨੀ ਫ੍ਰੀ ਮੈਮੋਰੀ ਵਾਲੀ ਮਸ਼ੀਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।
ਆਪਣੇ ਲੈਪਟਾਪ 'ਤੇ POCKET-35B ਚਲਾਉਣ ਦੇ ਕਦਮ
- ਮੈਮੋਰੀ ਦੀ ਜਾਂਚ ਕਰੋ – ਆਪਣੇ ਸਿਸਟਮ ਦਾ task manager ਖੋਲ੍ਹੋ, ਕੁੱਲ RAM ਨੋਟ ਕਰੋ, ਅਤੇ ਇਸਦੀ ਤੁਲਨਾ Hugging Face ਪੇਜ 'ਤੇ ਦਿੱਤੇ ਗਏ GGUF ਫਾਈਲ ਦੇ ਆਕਾਰ ਨਾਲ ਕਰੋ।
- ਸਹੀ quantization ਚੁਣੋ – Q4 ਵਰਜ਼ਨ ਨਾਲ ਸ਼ੁਰੂ ਕਰੋ; ਇਹ ਜ਼ਿਆਦਾਤਰ ਲੈਪਟਾਪਾਂ ਲਈ ਆਕਾਰ ਅਤੇ ਰਫ਼ਤਾਰ ਵਿੱਚ ਸੰਤੁਲਨ ਬਣਾਉਂਦਾ ਹੈ।
- llama.cpp ਜਾਂ Ollama ਰਾਹੀਂ ਡਾਊਨਲੋਡ ਕਰੋ – ਦੋਵੇਂ ਟੂਲ Hugging Face ਤੋਂ ਸਿੱਧੇ ਮਾਡਲ ਨੂੰ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੇ ਹਨ, ਅਤੇ checksum verification ਨੂੰ ਆਪਣੇ ਆਪ ਸੰਭਾਲ ਲੈਂਦੇ ਹਨ।
- ਇੱਕ ਤੇਜ਼ sanity check ਕਰੋ – ਇਹ ਪੁਸ਼ਟੀ ਕਰਨ ਲਈ ਕਿ ਲੋਡਿੰਗ ਸਫਲ ਰਹੀ ਹੈ, ਇੱਕ ਸਧਾਰਨ “Hello, world” ਪ੍ਰੋਂਪਟ ਨਾਲ runtime ਚਲਾਓ।
- ਇੱਕ ਯਥਾਰਥਵਾਦੀ benchmark suite ਬਣਾਓ – 30-50 ਅਜਿਹੇ ਕੰਮ ਇਕੱਠੇ ਕਰੋ ਜੋ ਤੁਹਾਡੇ production workload (ਜਿਵੇਂ ਕਿ ਟਿਕਟ ਸ਼੍ਰੇਣੀਆਂ ਦਾ ਵਰਗੀਕਰਨ ਕਰਨਾ, ਈਮੇਲ ਜਵਾਬਾਂ ਦਾ ਡਰਾਫਟ ਤਿਆਰ ਕਰਨਾ) ਨੂੰ ਦਰਸਾਉਂਦੇ ਹੋਣ। ਉਹਨਾਂ ਨੂੰ ਮਾਡਲ ਰਾਹੀਂ ਚਲਾਓ ਅਤੇ latency ਅਤੇ token-output ਦੀ ਗੁਣਵੱਤਾ ਨੂੰ ਰਿਕਾਰਡ ਕਰੋ।
- ਭਾਸ਼ਾ ਦੀ ਕਵਰੇਜ ਦੀ ਜਾਂਚ ਕਰੋ – POCKET-35B ਦੇ ਦਸਤਾਵੇਜ਼ਾਂ ਵਿੱਚ ਭਾਸ਼ਾਵਾਂ ਦੀ ਸੂਚੀ ਨਹੀਂ ਦਿੱਤੀ ਗਈ ਹੈ। ਜੇਕਰ ਤੁਹਾਨੂੰ Vietnamese ਜਾਂ ਹੋਰ ਗੈਰ-ਅੰਗਰੇਜ਼ੀ ਲਿਪੀਆਂ ਦੀ ਲੋੜ ਹੈ, ਤਾਂ ਕੁਝ accent ਵਾਲੇ ਵਾਕ ਭੇਜੋ ਅਤੇ ਦੇਖੋ ਕਿ ਕੀ ਮਾਡਲ ਸਪਸ਼ਟ (coherent) ਆਉਟਪੁੱਟ ਦਿੰਦਾ ਹੈ।
- ਅਸਲ latency ਨੂੰ ਮਾਪੋ – ਆਪਣੇ ਖਾਸ ਹਾਰਡਵੇਅਰ 'ਤੇ ਪ੍ਰਤੀ-ਪ੍ਰੋਂਪਟ ਸਮਾਂ ਰਿਕਾਰਡ ਕਰੋ; ਵੱਖ-ਵੱਖ CPU ਜਾਂ RAM bandwidth ਵਾਲੇ ਹੋਰ ਉਪਭੋਗਤਾਵਾਂ ਦੁਆਰਾ ਪੋਸਟ ਕੀਤੇ ਗਏ benchmark ਨੰਬਰਾਂ 'ਤੇ ਭਰੋਸਾ ਨਾ ਕਰੋ।
ਡਾਊਨਲੋਡ ਦੇ ਅੰਕੜੇ ਤੁਹਾਨੂੰ ਕੀ ਨਹੀਂ ਦੱਸਦੇ
ਇੱਕ ਮਿਲੀਅਨ ਡਾਊਨਲੋਡ ਭਾਈਚਾਰੇ ਦੀ ਮਜ਼ਬੂਤ ਦਿਲਚਸਪੀ ਦਾ ਸੰਕੇਤ ਹਨ, ਨਾ ਕਿ ਗਾਰੰਟੀਸ਼ੁਦਾ ਪ੍ਰਦਰਸ਼ਨ ਦਾ। ਮਾਡਲ ਦੀ ਤਰਕ ਸ਼ਕਤੀ (reasoning ability), ਕੋਡ ਜਨਰੇਸ਼ਨ ਹੁਨਰ, ਅਤੇ ਹਦਾਇਤਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਦੀ ਸੁਤੰਤਰ ਤੌਰ 'ਤੇ ਜਾਂਚ ਨਹੀਂ ਕੀਤੀ ਗਈ ਹੈ। VIDRAFT ਨੇ ਮਾਡਲ ਦੇ architecture ਦੇ ਵੇਰਵੇ ਜਾਂ training data ਦੇ ਸਰੋਤਾਂ ਦਾ ਖੁਲਾਸਾ ਨਹੀਂ ਕੀਤਾ ਹੈ, ਜਿਸ ਨਾਲ ਜਾਣਕਾਰੀ ਦੀ ਘਾਟ ਰਹਿ ਗਈ ਹੈ ਜੋ production deployment ਨੂੰ ਜੋਖਮ ਭਰਿਆ ਬਣਾਉਂਦੀ ਹੈ।
ਜੋਖਮ ਅਤੇ ਵਿਰੋਧੀ ਦਲੀਲਾਂ
- ਅਸਪਸ਼ਟ ਗੁਣਵੱਤਾ – ਪ੍ਰਕਾਸ਼ਿਤ evaluation metrics ਤੋਂ ਬਿਨਾਂ, ਤੁਸੀਂ ਯਕੀਨੀ ਨਹੀਂ ਹੋ ਸਕਦੇ ਕਿ POCKET-35B ਹੋਰ open-source ਵਿਕਲਪਾਂ ਦੀ ਸ਼ੁੱਧਤਾ (accuracy) ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ।
- Production-grade ਅਨਿਸ਼ਚਿਤਤਾਵਾਂ – architectural ਪਾਰਦਰਸ਼ਤਾ ਦੀ ਘਾਟ ਕਾਰਨ adversarial prompts ਜਾਂ edge-case inputs ਦੇ ਅਧੀਨ ਵਿਵਹਾਰ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨਾ ਮੁਸ਼ਕਲ ਹੋ ਜਾਂਦਾ ਹੈ।
ਨਿਚੋੜ
ਜੇਕਰ ਤੁਹਾਡੀ ਟੀਮ ਨੂੰ ਅੱਜ 35 B-ਪੈਰਾਮੀਟਰ ਵਾਲੇ LLM ਨਾਲ ਪ੍ਰਯੋਗ ਕਰਨ ਦੀ ਲੋੜ ਹੈ ਅਤੇ ਉਹ GPU ਦਾ ਖਰਚਾ ਨਹੀਂ ਚੁੱਕ ਸਕਦੀ, ਤਾਂ POCKET-35B ਇੱਕ ਵਿਹਾਰਕ, ਘੱਟ ਲਾਗਤ ਵਾਲਾ ਵਿਕਲਪ ਪੇਸ਼ ਕਰਦਾ ਹੈ। ਮਾਡਲ GGUF ਫਾਰਮੈਟ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਇੱਕ ਸਟੈਂਡਰਡ ਲੈਪਟਾਪ 'ਤੇ ਚੱਲਦਾ ਹੈ, ਅਤੇ open-source runtimes ਸੈੱਟਅੱਪ ਨੂੰ ਸੌਖਾ ਬਣਾਉਂਦੇ ਹਨ। ਹਾਲਾਂਕਿ, ਮਾਡਲ ਨੂੰ ਪ੍ਰਯੋਗਿਕ ਮੰਨ ਕੇ ਚੱਲੋ: ਕਿਸੇ ਵੀ production pipeline ਵਿੱਚ ਸ਼ਾਮਲ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ ਮੈਮੋਰੀ ਦੀਆਂ ਲੋੜਾਂ ਦੀ ਜਾਂਚ ਕਰੋ, ਅਸਲ ਕੰਮਾਂ ਨਾਲ benchmark ਕਰੋ, ਅਤੇ ਭਾਸ਼ਾ ਦੀ ਵਰਤੋਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰੋ। ਜਿਵੇਂ-ਜਿਵੇਂ ਭਾਈਚਾਰੇ ਦਾ ਡਾਟਾ ਇਕੱਠਾ ਹੁੰਦਾ ਹੈ ਅਤੇ VIDRAFT ਹੋਰ ਵੇਰਵੇ ਜਾਰੀ ਕਰਦਾ ਹੈ, ਜੋਖਮ ਦੀ ਸਥਿਤੀ ਸਪਸ਼ਟ ਹੋ ਜਾਵੇਗੀ—ਪਰ ਫਿਲਹਾਲ, ਇੱਕ ਸਿੰਗਲ ਲੈਪਟਾਪ ਵਾਕਈ ਇੱਕ 35 B LLM ਨੂੰ ਹੋਸਟ ਕਰ ਸਕਦਾ ਹੈ, ਭਾਵੇਂ ਕੁਝ ਸੀਮਾਵਾਂ ਦੇ ਨਾਲ।
