DeepSeek ਦਾ DSpark ਫਰੇਮਵਰਕ ਹੁਣ ਮੁੱਖਧਾਰਾ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ (large language models) ਨੂੰ ਬਿਨਾਂ ਕਿਸੇ ਰੀਟ੍ਰੇਨਿੰਗ ਜਾਂ ਗੁਣਵੱਤਾ ਦੇ ਨੁਕਸਾਨ ਦੇ 85% ਤੱਕ ਤੇਜ਼ੀ ਨਾਲ ਟੈਕਸਟ ਜਨਰੇਟ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ। ਇਹ ਸਪੀਡ ਬੂਸਟ ਅੱਜ DeepSeek ਦੇ API ਰਾਹੀਂ ਅਤੇ ਇੱਕ ਓਪਨ-ਸੋਰਸ MIT-ਲਾਈਸੰਸਡ ਲਾਇਬ੍ਰੇਰੀ ਵਜੋਂ ਉਪਲਬਧ ਹੈ ਜਿਸ ਨੂੰ ਕੋਈ ਵੀ ਆਪਣੇ ਡਿਪਲਾਈਮੈਂਟ ਵਿੱਚ ਵਰਤ ਸਕਦਾ ਹੈ।
ਇਨਫਰੈਂਸ (inference) ਦੀ ਰਫਤਾਰ ਹੁਣ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
2026 ਤੱਕ AI ਲਈ ਜ਼ਿਆਦਾਤਰ ਕੰਪਿਊਟ ਬਜਟ ਇਨਫਰੈਂਸ (inference) 'ਤੇ ਖਰਚ ਕੀਤਾ ਜਾਵੇਗਾ - ਉਹ ਪੜਾਅ ਜਿੱਥੇ ਇੱਕ ਟ੍ਰੇਂਡ ਮਾਡਲ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਦਿੰਦਾ ਹੈ। ਜਿਵੇਂ ਕਿ ਉਦਯੋਗ ਵੱਡੇ ਮਾਡਲਾਂ ਨੂੰ ਬਣਾਉਣ ਤੋਂ ਹਟ ਕੇ ਉਹਨਾਂ ਨੂੰ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਪ੍ਰਦਾਨ ਕਰਨ ਵੱਲ ਵਧ ਰਹੇ ਹਨ, ਲੇਟੈਂਸੀ (latency) ਅਤੇ ਹਾਰਡਵੇਅਰ ਦੀ ਲਾਗਤ ਨਿਰਣਾਇਕ ਕਾਰਕ ਬਣ ਜਾਂਦੇ ਹਨ। ਤੇਜ਼ ਇਨਫਰੈਂਸ ਦਾ ਮਤਲਬ ਹੈ ਸਸਤੇ GPU ਕਲੱਸਟਰ, ਘੱਟ ਕਲਾਉਡ ਬਿੱਲ, ਅਤੇ ਵਧੇਰੇ ਰਿਸਪੌਂਸਿਵ ਯੂਜ਼ਰ ਅਨੁਭਵ।
ਸਪੈਕੂਲੇਟਿਵ ਡੀਕੋਡਿੰਗ (speculative decoding) ਦਾ ਤਰੀਕਾ
ਰਵਾਇਤੀ ਜਨਰੇਸ਼ਨ ਟੋਕਨ-ਦਰ-ਟੋਕਨ ਚੱਲਦੀ ਹੈ: ਮਾਡਲ ਅਗਲੇ ਸ਼ਬਦ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ, ਫਿਰ ਅਗਲੇ ਦੀ, ਅਤੇ ਇਸੇ ਤਰ੍ਹਾਂ। ਇਹ ਲਗਾਤਾਰ ਚੱਲਣ ਦੀ ਪ੍ਰਕਿਰਿਆ ਆਧੁਨਿਕ GPU 'ਤੇ ਬੋਝ ਪਾਉਂਦੀ ਹੈ, ਜਿਨ੍ਹਾਂ ਦੀ ਤਾਕਤ ਪੈਰਲਲਿਜ਼ਮ (parallelism) ਵਿੱਚ ਹੈ। DSpark ਸਪੈਕੂਲੇਟਿਵ ਡੀਕੋਡਿੰਗ ਰਾਹੀਂ ਇਸ ਰੁਕਾਵਟ ਨੂੰ ਦੂਰ ਕਰਦਾ ਹੈ:
- ਇੱਕ ਹਲਕਾ "ਡਰਾਫਟ" (draft) ਮਾਡਲ ਕਈ ਟੋਕਨਾਂ ਦੀ ਪਹਿਲਾਂ ਹੀ ਭਵਿੱਖਬਾਣੀ ਕਰਦਾ ਹੈ।
- ਮੁੱਖ, ਬਹੁਤ ਵੱਡਾ ਮਾਡਲ ਇੱਕੋ ਵਾਰ ਵਿੱਚ ਉਹਨਾਂ ਭਵਿੱਖਬਾਣੀਆਂ ਦੀ ਪੁਸ਼ਟੀ ਕਰਦਾ ਹੈ।
- ਜਦੋਂ ਡਰਾਫਟ ਦੇ ਅੰਦਾਜ਼ੇ ਵੱਡੇ ਮਾਡਲ ਦੀਆਂ ਉਮੀਦਾਂ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹਨ, ਤਾਂ ਸਿਸਟਮ ਪੂਰੇ ਬੈਚ ਨੂੰ ਇੱਕੋ ਵਾਰ ਵਿੱਚ ਜਾਰੀ ਕਰ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਪ੍ਰਤੀ-ਟੋਕਨ ਉਡੀਕ ਘੱਟ ਜਾਂਦੀ ਹੈ।
- ਜੇਕਰ ਕੋਈ ਅੰਦਾਜ਼ਾ ਗਲਤ ਹੁੰਦਾ ਹੈ, ਤਾਂ ਬੈਚ ਨੂੰ ਰੱਦ ਕਰ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ ਅਤੇ ਪ੍ਰਕਿਰਿਆ ਦੁਬਾਰਾ ਦੁਹਰਾਈ ਜਾਂਦੀ ਹੈ, ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦੇ ਹੋਏ ਕਿ ਅੰਤਿਮ ਆਉਟਪੁੱਟ ਉਹੀ ਹੋਵੇ ਜੋ ਵੱਡਾ ਮਾਡਲ ਆਪਣੇ ਆਪ ਪੈਦਾ ਕਰਦਾ।
ਕਿਉਂਕਿ ਵੱਡਾ ਮਾਡਲ ਅਜੇ ਵੀ ਅੰਤਿਮ ਜਾਂਚ ਕਰਦਾ ਹੈ, ਇਸ ਲਈ ਜਨਰੇਟ ਕੀਤਾ ਗਿਆ ਟੈਕਸਟ ਬਿਲਕੁਲ ਉਹੀ ਗੁਣਵੱਤਾ ਅਤੇ ਸ਼ੁੱਧਤਾ ਰੱਖਦਾ ਹੈ ਜੋ ਇੱਕ ਸ਼ੁੱਧ, ਸਿੰਗਲ-ਟੋਕਨ ਰਨ ਵਿੱਚ ਹੁੰਦੀ ਹੈ।
DSpark ਅੱਜ ਕੀ ਸਪੋਰਟ ਕਰਦਾ ਹੈ
- MIT ਲਾਇਸੈਂਸ ਦੇ ਤਹਿਤ ਓਪਨ-ਸੋਰਸ, ਤਾਂ ਜੋ ਟੀਮਾਂ ਲਾਇਸੈਂਸਿੰਗ ਦੀਆਂ ਰੁਕਾਵਟਾਂ ਤੋਂ ਬਿਨਾਂ ਇਸਦੀ ਜਾਂਚ, ਸੋਧ ਜਾਂ ਇਸਨੂੰ ਵਰਤ ਸਕਣ।
- DeepSeek, Alibaba ਦੇ Qwen, ਅਤੇ Google ਦੇ Gemma ਨਾਲ ਅਨੁਕੂਲਤਾ, ਜੋ ਕਿ ਪ੍ਰਸਿੱਧ, ਓਪਨ-ਸੋਰਸ LLM ਪਰਿਵਾਰਾਂ ਨੂੰ ਕਵਰ ਕਰਦਾ ਹੈ।
- ਮੌਜੂਦਾ ਹਾਰਡਵੇਅਰ 'ਤੇ ਤੁਰੰਤ ਸਪੀਡ ਦਾ ਲਾਭ; ਉਪਭੋਗਤਾ 60% ਤੋਂ 85% ਤੱਕ ਤੇਜ਼ ਇਨਫਰੈਂਸ ਦੀ ਰਿਪੋਰਟ ਕਰਦੇ ਹਨ, ਜਿਸਦਾ ਮਤਲਬ ਹੈ ਕਿ ਉਹੀ ਕੰਮ ਕਰਨ ਲਈ ਘੱਟ GPU ਘੰਟੇ ਲੱਗਣਗੇ।
- ਨਵੇਂ ਅਤੇ ਮਹਿੰਗੇ GPU ਅਪਗ੍ਰੇਡ ਕਰਨ ਦਾ ਘੱਟ ਦਬਾਅ, ਜੋ ਕਿ ਸਟਾਰਟਅੱਪਸ ਅਤੇ ਉਦਯੋਗਾਂ ਦੋਵਾਂ ਲਈ ਲਾਗਤ ਘਟਾਉਣ ਦਾ ਇੱਕ ਮੁੱਖ ਸਾਧਨ ਹੈ।
ਜੇਕਰ ਤੁਸੀਂ ਪਹਿਲਾਂ ਹੀ DeepSeek ਦੇ ਹੋਸਟਡ API ਦੀ ਵਰਤੋਂ ਕਰ ਰਹੇ ਹੋ, ਤਾਂ DSpark ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ ਪਿਛੋਕੜ ਵਿੱਚ ਆਪਣੇ ਆਪ ਚੱਲਦੀ ਹੈ। ਆਨ-ਪ੍ਰੇਮਿਸ (on-premise) ਡਿਪਲਾਈਮੈਂਟ ਲਈ, GitHub 'ਤੇ DeepSpec ਕੋਡਬੇਸ ਉਹ ਡਰਾਫਟ-ਮਾਡਲ ਇਨਫਰਾਸਟ੍ਰਕਚਰ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਜਿਸਦੀ ਤੁਹਾਨੂੰ ਆਪਣੀ ਸਪੈਕੂਲੇਟਿਵ ਪਾਈਪਲਾਈਨ ਬਣਾਉਣ ਲਈ ਲੋੜ ਹੈ।
ਸਿੱਟਾ
DSpark ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਸਿਰਫ ਇੱਕ ਸਾਫਟਵੇਅਰ ਤਬਦੀਲੀ ਲੇਟੈਂਸੀ ਵਿੱਚ ਉਹ ਕਮੀ ਲਿਆ ਸਕਦੀ ਹੈ ਜਿਸ ਲਈ ਕਦੇ ਨਵੇਂ ਹਾਰਡਵੇਅਰ ਦੀ ਲੋੜ ਮੰਨੀ ਜਾਂਦੀ ਸੀ। ਸਪੈਕੂਲੇਟਿਵ ਡੀਕੋਡਿੰਗ ਨੂੰ ਖੁੱਲ੍ਹੇਆਮ ਉਪਲਬਧ ਕਰਵਾ ਕੇ, DeepSeek AI ਕੁਸ਼ਲਤਾ ਦੀ ਲੜਾਈ ਨੂੰ "ਵੱਡੇ ਚਿਪਸ" ਤੋਂ "ਸਮਾਰਟ ਕੋਡ" ਵੱਲ ਲੈ ਜਾਂਦਾ ਹੈ, ਜੋ ਕਿ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀ ਨੂੰ ਜੋ ਇੱਕ ਵੱਡਾ ਮਾਡਲ ਚਲਾ ਸਕਦਾ ਹੈ, ਇਸਨੂੰ ਤੇਜ਼ੀ ਨਾਲ ਅਤੇ ਸਸਤੇ ਵਿੱਚ ਚਲਾਉਣ ਦਾ ਮੌਕਾ ਦਿੰਦਾ ਹੈ।
