Qwen-Drive-1.0 ਪਰਸੈਪਸ਼ਨ (perception), ਪਲੈਨਿੰਗ (planning) ਅਤੇ ਭਾਸ਼ਾ ਨੂੰ ਇੱਕ ਸਿੰਗਲ ਮਾਡਲ ਵਿੱਚ ਇਕੱਠਾ ਕਰਦਾ ਹੈ, ਜੋ ਆਟੋਨੋਮਸ-ਵਹੀਕਲ ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਬੋਲੀਆਂ ਜਾਂ ਲਿਖਤੀ ਹਦਾਇਤਾਂ ਦੀ ਪਾਲਣਾ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਨੂੰ ਗੁਆਏ ਬਿਨਾਂ ਇੱਕ ਸਾਫ਼ ਸਟੈਕ ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ। ਇਹ ਇਕਜੁੱਟ ਆਰਕੀਟੈਕਚਰ ਵਿਕਾਸ ਦੀ ਗੁੰਝਲਤਾ ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ ਜਦੋਂ ਕਿ ਕਾਰਾਂ ਨੂੰ “ਤੁਸੀਂ ਮੋੜ ਕਿਉਂ ਲਿਆ?” ਦਾ ਜਵਾਬ ਦੇਣ ਜਾਂ “ਅਗਲੇ ਨਿਕਾਸ (exit) ਤੋਂ ਮੋੜ ਲਓ” ਦੀ ਪਾਲਣਾ ਕਰਨ ਦੇ ਯੋਗ ਰੱਖਦਾ ਹੈ।
ਇੱਕ ਇਕਜੁੱਟ ਫਾਊਂਡੇਸ਼ਨ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਅੱਜ ਜ਼ਿਆਦਾਤਰ ਸਵੈ-ਚਾਲਿਤ (self-driving) ਸਾਫਟਵੇਅਰ ਵੱਖ-ਵੱਖ ਮੋਡਿਊਲਾਂ ਦਾ ਇੱਕ ਸਮੂਹ ਹਨ: ਇੱਕ ਵਿਜ਼ਨ ਸਿਸਟਮ ਜੋ ਕੈਮਰਾ ਅਤੇ lidar ਡੇਟਾ ਨੂੰ ਪੜ੍ਹਦਾ ਹੈ, ਇੱਕ ਪਲੈਨਰ ਜੋ ਰਸਤਾ (trajectory) ਤੈਅ ਕਰਦਾ ਹੈ, ਅਤੇ ਇੱਕ ਭਾਸ਼ਾ ਇੰਟਰਫੇਸ ਜੋ ਉਪਭੋਗਤਾ ਦੇ ਕਮਾਂਡਾਂ ਜਾਂ ਵਿਆਖਿਆਵਾਂ ਨੂੰ ਸੰਭਾਲਦਾ ਹੈ। ਹਰੇਕ ਹਿੱਸਾ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਸਿਖਾਇਆ ਜਾਂਦਾ ਹੈ, ਇਸ ਲਈ ਜਦੋਂ ਵਿਜ਼ਨ ਜਾਂ ਪਲੈਨਿੰਗ ਹਿੱਸੇ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਹੁੰਦੇ ਹਨ, ਤਾਂ ਭਾਸ਼ਾ ਵਾਲਾ ਹਿੱਸਾ ਅਕਸਰ ਭਟਕ ਜਾਂਦਾ ਹੈ। ਨਤੀਜੇ ਵਜੋਂ ਇੱਕ ਅਜਿਹਾ ਵਾਹਨ ਮਿਲਦਾ ਹੈ ਜੋ ਨੇਵੀਗੇਟ ਤਾਂ ਕਰ ਸਕਦਾ ਹੈ ਪਰ ਕੁਦਰਤੀ ਭਾਸ਼ਾ ਨੂੰ ਭਰੋਸੇਯੋਗਤਾ ਨਾਲ ਸਮਝਣ ਜਾਂ ਪੈਦਾ ਕਰਨ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦਾ ਹੈ।
Qwen-Drive-1.0 ਇੱਕੋ ਸਮੇਂ ਤਿੰਨ ਕਾਰਜਾਂ—3-D ਪਰਸੈਪਸ਼ਨ, ਵਿਜ਼ੂਅਲ ਕੁਐਸਚਨ ਐਂਸਰਿੰਗ (VQA), ਅਤੇ ਮੋਸ਼ਨ ਪਲੈਨਿੰਗ—ਤੇ ਇੱਕ ਸਿੰਗਲ ਬੈਕਬੋਨ ਨੂੰ ਸਿਖਾ ਕੇ ਇਸ ਖੰਡਿਤਤਾ (fragmentation) ਨੂੰ ਹੱਲ ਕਰਦਾ ਹੈ। ਡਰਾਈਵਿੰਗ ਡੇਟਾਸੈਟਾਂ ਨੂੰ ਆਮ ਵਿਜ਼ਨ-ਲੈਂਗੂਏਜ ਕੋਰਪਸ ਦੇ ਨਾਲ ਮਿਲਾ ਕੇ, ਮਾਡਲ ਦੇਖਣ ਅਤੇ ਕੰਮ ਕਰਨ ਨੂੰ ਸਿੱਖਦੇ ਹੋਏ ਆਪਣਾ ਭਾਸ਼ਾਈ ਗਿਆਨ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ। ਇਹ “ਮਲਟੀਮੋਡਲ ਫਾਊਂਡੇਸ਼ਨ” ਵੱਡੇ ਭਾਸ਼ਾ ਮਾਡਲਾਂ ਦੇ ਰੁਝਾਨਾਂ ਨੂੰ ਦਰਸਾਉਂਦੀ ਹੈ ਜੋ ਕਈ ਡਾਊਨਸਟ੍ਰੀਮ ਐਪਲੀਕੇਸ਼ਨਾਂ ਲਈ ਅਧਾਰ ਵਜੋਂ ਕੰਮ ਕਰਦੇ ਹਨ, ਪਰ ਇਹ ਸੁਰੱਖਿਅਤ ਨੇਵੀਗੇਸ਼ਨ ਲਈ ਲੋੜੀਂਦੀ ਸਪੇਸ਼ੀਅਲ ਰੀਜ਼ਨਿੰਗ (spatial reasoning) ਵੀ ਜੋੜਦੀ ਹੈ।
ਮਾਡਲ ਦਾ ਮੁਲਾਂਕਣ ਕਿਵੇਂ ਕੀਤਾ ਗਿਆ
ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਮਾਡਲ ਨੂੰ ਓਪਨ-ਲੂਪ (open-loop) ਅਤੇ ਕਲੋਜ਼ਡ-ਲੂਪ (closed-loop) ਦੋਵਾਂ ਟੈਸਟਾਂ ਰਾਹੀਂ ਚਲਾਇਆ। ਓਪਨ-ਲੂਪ ਸਥਿਤੀਆਂ ਵਿੱਚ, ਸਿਸਟਮ ਨੇ ਰਿਕਾਰਡ ਕੀਤੇ ਸੈਂਸਰ ਸਟ੍ਰੀਮਾਂ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕੀਤਾ ਅਤੇ ਵਾਤਾਵਰਣ ਨੂੰ ਪ੍ਰਭਾਵਿਤ ਕੀਤੇ ਬਿਨਾਂ ਭਵਿੱਖਬਾਣੀਆਂ ਪੈਦਾ ਕੀਤੀਆਂ; ਕਲੋਜ਼ਡ-ਲੂਪ ਟਰਾਇਲਜ਼ ਵਿੱਚ ਇਸਨੇ ਅਸਲ ਵਿੱਚ ਇੱਕ ਸਿਮੂਲੇਟਡ ਵਾਹਨ ਨੂੰ ਕੰਟਰੋਲ ਕੀਤਾ। ਇਹਨਾਂ ਸੈਟਿੰਗਾਂ ਵਿੱਚ, Qwen-Drive-1.0 ਦੀ ਮੋਸ਼ਨ-ਪਲੈਨਿੰਗ ਪ੍ਰਦਰਸ਼ਨ ਨੇ ਉਹਨਾਂ ਮਾਹਰ ਮਾਡਲਾਂ ਨਾਲ ਮੇਲ ਖਾਧਾ ਜੋ ਸਿਰਫ਼ ਡਰਾਈਵਿੰਗ 'ਤੇ ਕੇਂਦਰਿਤ ਹਨ। ਇਸ ਦੇ ਨਾਲ ਹੀ, ਇਸਦੇ VQA ਹਿੱਸੇ ਨੇ ਦ੍ਰਿਸ਼ ਬਾਰੇ ਪੁੱਛੇ ਗਏ ਸਵਾਲਾਂ ਦੇ ਜਵਾਬ ਦਿੱਤੇ, ਜੋ ਇਹ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਸਾਂਝੀ ਸਿਖਲਾਈ ਦੇ ਬਾਵਜੂਦ ਭਾਸ਼ਾ ਦੀ ਸਮਰੱਥਾ ਬਰਕਰਾਰ ਰਹੀ।
ਬਾਕੀ ਰਹਿੰਦੀਆਂ ਰੁਕਾਵਟਾਂ
ਮੌਜੂਦਾ ਕੰਮ ਇੱਕ ਪੂਰੇ ਸੈਂਸਰ ਸੂਟ ਤੱਕ ਨਹੀਂ ਪਹੁੰਚਿਆ ਹੈ। ਹਾਈ-ਰੈਜ਼ੋਲਿਊਸ਼ਨ lidar ਇਨਪੁੱਟਸ ਅਤੇ ਲੌਂਗ-ਰੇਂਜ ਭਵਿੱਖਬਾਣੀ—ਦੋਵੇਂ ਹਾਈਵੇਅ ਡਰਾਈਵਿੰਗ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹਨ—ਟ੍ਰੇਨਿੰਗ ਸੈੱਟ ਵਿੱਚ ਗੈਰ-ਹਾਜ਼ਰ ਹਨ। ਪਰਸੈਪਸ਼ਨ ਵੀ ਡੇਟਾਸੈਟਾਂ ਦੇ ਇੱਕ ਸੀਮਤ ਸੰਗ੍ਰਹਿ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ, ਜੋ ਵੱਖ-ਵੱਖ ਮੌਸਮ, ਰੌਸ਼ਨੀ ਅਤੇ ਟ੍ਰੈਫਿਕ ਸਥਿਤੀਆਂ ਵਿੱਚ ਜਨਰਲਾਈਜ਼ੇਸ਼ਨ ਬਾਰੇ ਸਵਾਲ ਖੜ੍ਹੇ ਕਰਦਾ ਹੈ। ਜਦੋਂ ਤੱਕ ਮਾਡਲ ਅਸਲ ਦੁਨੀਆ ਦੇ ਹਾਈ-ਬੈਂਡਵਿਡਥ ਸੈਂਸਰ ਸਟ੍ਰੀਮਾਂ 'ਤੇ ਆਪਣੇ ਆਪ ਨੂੰ ਸਾਬਤ ਨਹੀਂ ਕਰਦਾ, ਇੰਜੀਨੀਅਰ ਪ੍ਰਮਾਣਿਤ ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਬਦਲਣ ਵਿੱਚ ਝਿਜਕਣਗੇ।
ਜੇਕਰ ਇਹ ਪਹੁੰਚ ਵਿਸਤਾਰਿਤ ਹੁੰਦੀ ਹੈ ਤਾਂ ਕੀ ਬਦਲ ਸਕਦਾ ਹੈ
ਜੇਕਰ ਇੱਕ ਸਿੰਗਲ ਫਾਊਂਡੇਸ਼ਨ ਪੂਰੇ ਪਰਸੈਪਸ਼ਨ-ਪਲੈਨਿੰਗ-ਭਾਸ਼ਾ ਸਟੈਕ ਨੂੰ ਸੰਭਾਲ ਸਕਦੀ ਹੈ, ਤਾਂ ਆਟੋਮੋਟਿਵ ਟੀਮਾਂ ਵੱਖ-ਵੱਖ ਮੋਡਿਊਲਾਂ ਦੇ ਗੁੰਝਲਦਾਰ ਤਾਲਮੇਲ ਨੂੰ ਛੱਡ ਸਕਦੀਆਂ ਹਨ। ਇਸ ਨਾਲ ਇੰਟੀਗ੍ਰੇਸ਼ਨ ਦੀ ਕੋਸ਼ਿਸ਼ ਘਟੇਗੀ, ਮੋਡਿਊਲ-ਵਿਚਕਾਰ ਸੰਚਾਰ ਤੋਂ ਲੇਟੈਂਸੀ (latency) ਘਟੇਗੀ, ਅਤੇ ਅੱਪਡੇਟਸ ਨੂੰ ਸਰਲ ਬਣਾਇਆ ਜਾ ਸਕੇਗਾ: ਪਲੈਨਰ ਨੂੰ ਦੁਬਾਰਾ ਸਿਖਾਏ ਬਿਨਾਂ ਇੱਕ ਨਵੀਂ ਭਾਸ਼ਾ ਸਮਰੱਥਾ ਜੋੜੀ ਜਾ ਸਕਦੀ ਹੈ। ਆਟੋਨੋਮਸ ਡਰਾਈਵਿੰਗ ਲਈ ਬੈਂਚਮਾਰਕ ਸੂਟਾਂ ਨੂੰ ਵੀ ਵਿਕਸਿਤ ਕਰਨ ਦੀ ਲੋੜ ਹੋਵੇਗੀ, ਜਿਸ ਵਿੱਚ ਰਵਾਇਤੀ ਸੁਰੱਖਿਆ ਅਤੇ ਕੁਸ਼ਲਤਾ ਸਕੋਰ ਦੇ ਨਾਲ-ਨਾਲ ਭਾਸ਼ਾ-ਕੇਂਦ੍ਰਿਤ ਮੈਟ੍ਰਿਕਸ ਵੀ ਸ਼ਾਮਲ ਕੀਤੇ ਜਾਣਗੇ।
ਵਿਰੋਧੀ ਵਿਚਾਰ: ਵਿਸ਼ੇਸ਼ਤਾ (specialization) ਦੀ ਅਜੇ ਵੀ ਆਪਣੀ ਜਗ੍ਹਾ ਹੈ
ਮਾਹਰ ਮਾਡਲ ਇਸ ਲਈ ਵਧੀਆ ਹੁੰਦੇ ਹਨ ਕਿਉਂਕਿ ਉਹਨਾਂ ਨੂੰ ਵਿਸ਼ੇਸ਼, ਡੋਮੇਨ-ਸਧਾਰਨ ਡੇਟਾ 'ਤੇ ਫਾਈਨ-ਟਿਊਨ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। ਇੱਕ ਇਕਜੁੱਟ ਮਾਡਲ ਸ਼ਾਇਦ lidar-only ਪਰਸੈਪਸ਼ਨ ਨੈੱਟਵਰਕ ਜਾਂ ਅਰਬਾਂ ਮੀਲ ਦੇ ਡਰਾਈਵਿੰਗ ਲੌਗਸ 'ਤੇ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਪਲੈਨਰ ਦੇ ਅੰਤਿਮ ਸ਼ਿਖਰ ਪ੍ਰਦਰਸ਼ਨ ਨਾਲ ਮੇਲ ਖਾਣ ਲਈ ਸੰਘਰਸ਼ ਕਰ ਸਕਦਾ ਹੈ। ਸੁਰੱਖਿਆ-ਅਹਿਮ ਕਾਰਜਾਂ ਲਈ, ਨਿਯਮਕ ਅਤੇ ਨਿਰਮਾਤਾ ਸਮਰਪਿਤ, ਵਿਆਪਕ ਤੌਰ 'ਤੇ ਪ੍ਰਮਾਣਿਤ ਹਿੱਸਿਆਂ ਦੀ ਮੰਗ ਕਰਨਾ ਜਾਰੀ ਰੱਖ ਸਕਦੇ ਹਨ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਭਵ
