Google DeepMind ਨੇ GenCeption ਦਾ ਐਲਾਨ ਕੀਤਾ ਹੈ, ਇੱਕ ਅਜਿਹਾ ਮਾਡਲ ਜੋ ਸਿਰਫ਼ 7,500 ਸਿੰਥੈਟਿਕ ਵੀਡੀਓਜ਼ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਇੱਕ text-to-video generator ਨੂੰ ਵਿਜ਼ਨ (vision) ਦੇ ਕਈ ਕੰਮਾਂ ਲਈ ਇੱਕ ਸਿੰਗਲ ਫਾਊਂਡੇਸ਼ਨ ਮਾਡਲ ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਦਾਅਵਾ ਸਧਾਰਨ ਹੈ: ਇੱਕ ਵੀਡੀਓ ਜਨਰੇਟਰ ਜੋ ਪਹਿਲਾਂ ਹੀ ਜਾਣਦਾ ਹੈ ਕਿ ਵਸਤੂਆਂ ਕਿਵੇਂ ਹਿੱਲਦੀਆਂ ਹਨ ਅਤੇ ਆਪਸ ਵਿੱਚ ਕਿਵੇਂ ਕਿਰਿਆ ਕਰਦੀਆਂ ਹਨ, ਉਸ ਨੂੰ ਹਰੇਕ ਲਈ ਵੱਖਰਾ ਨੈੱਟਵਰਕ ਬਣਾਏ ਬਿਨਾਂ depth, surface normals, segmentation masks ਅਤੇ 3D pose ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨ ਲਈ ਦੁਬਾਰਾ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ।
ਖਿੰਡੀਆਂ ਹੋਈਆਂ ਵਿਜ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਤੋਂ ਇੱਕ ਇਕਸਾਰ ਮਾਡਲ ਤੱਕ
Large language models ਅਗਲੇ ਸ਼ਬਦ ਦੀ ਭਵਿੱਖਬਾਣੀ ਕਰਨਾ ਸਿੱਖ ਕੇ ਬਹੁਮੁਖੀ ਬਣ ਗਏ। ਇਸਦੇ ਉਲਟ, Computer-vision ਖੋਜ ਅਜੇ ਵੀ ਵਿਸ਼ੇਸ਼ ਪ੍ਰਣਾਲੀਆਂ (specialist systems) ਨਾਲ ਜੂਝ ਰਹੀ ਹੈ—ਕੋਈ segmentation ਲਈ, ਕੋਈ depth ਲਈ, ਅਤੇ ਕੋਈ pose ਲਈ। GenCeption ਇਸ ਟੁਕੜਿਆਂ ਵਾਲੇ ਤਰੀਕੇ ਨੂੰ ਛੱਡ ਦਿੰਦਾ ਹੈ। ਇੱਕ text prompt ਮਾਡਲ ਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਕਿਹੜਾ ਆਉਟਪੁੱਟ ਤਿਆਰ ਕਰਨਾ ਹੈ, ਅਤੇ ਉਹੀ 14-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੀ ਆਰਕੀਟੈਕਚਰ depth maps, normal maps, segmentation masks ਜਾਂ keypoint predictions ਪ੍ਰਦਾਨ ਕਰਦੀ ਹੈ। ਹਰ ਆਉਟਪੁੱਟ ਨੂੰ ਇੱਕ ਸਟੈਂਡਰਡ ਤਿੰਨ-ਚੈਨਲ RGB ਇਮੇਜ ਵਜੋਂ ਮੰਨ ਕੇ, ਸਿਸਟਮ ਪਾਈਪਲਾਈਨ ਨੂੰ ਇਕਸਾਰ ਰੱਖਦਾ ਹੈ; ਉਹਨਾਂ ਕੰਮਾਂ ਲਈ ਜੋ ਕੁਦਰਤੀ ਤੌਰ 'ਤੇ ਚਿੱਤਰ (images) ਪੈਦਾ ਨਹੀਂ ਕਰਦੇ, ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਛੋਟੇ ਸਿਖਲਾਈਯੋਗ (trainable) ਮੋਡਿਊਲ ਜੋੜ ਦਿੱਤੇ ਹਨ।
ਇੱਕ ਬਹੁਤ ਛੋਟੇ ਸਿੰਥੈਟਿਕ ਕੋਰਪਸ 'ਤੇ ਸਿਖਲਾਈ
ਟੀਮ ਨੇ Blender ਵਿੱਚ ਇੱਕ ਸਿੰਥੈਟਿਕ ਡੇਟਾਸੈੱਟ ਬਣਾਇਆ, ਜਿਸ ਵਿੱਚ 200 ਮੋਸ਼ਨ-ਕੈਪਚਰ ਸੀਕੁਐਂਸਾਂ ਦੁਆਰਾ ਚਲਾਏ ਗਏ 800 ਡਿਜੀਟਲ ਮਨੁੱਖੀ ਮਾਡਲਾਂ ਤੋਂ 7,500 ਛੋਟੀਆਂ ਵੀਡੀਓਜ਼ ਰੈਂਡਰ ਕੀਤੀਆਂ ਗਈਆਂ। D4RT ਜਾਂ VGGT Omega ਵਰਗੇ ਰਵਾਇਤੀ ਵੀਡੀਓ-ਜਨਰੇਸ਼ਨ ਮਾਡਲ ਲੱਖਾਂ ਕਲਿੱਪਾਂ 'ਤੇ ਸਿਖਲਾਈ ਲੈਂਦੇ ਹਨ; GenCeption ਉਸ ਡੇਟਾ ਦੇ ਸੱਤਵੇਂ ਹਿੱਸੇ ਤੋਂ ਲੈ ਕੇ ਇੱਕ ਸੌਵਾਂ ਹਿੱਸੇ ਦੇ ਵਿਚਕਾਰ ਵਰਤ ਕੇ ਤੁਲਨਾਯੋਗ ਜਾਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ। ਰਿਪੋਰਟ ਕੀਤੇ ਬੈਂਚਮਾਰਕਾਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ:
- DepthAnything 3 ਵਰਗੇ ਵਿਸ਼ੇਸ਼ ਮਾਡਲਾਂ ਦੇ ਬਰਾਬਰ depth estimation।
- Surface-normal prediction ਜੋ NormalCrafter ਅਤੇ Lotus-2 ਨੂੰ ਪਛਾੜ ਦਿੰਦਾ ਹੈ।
- 3D pose recognition ਜੋ Genmo ਅਤੇ TRAM ਤੋਂ ਅੱਗੇ ਹੈ।
- Language-guided segmentation ਜੋ Meta ਦੇ SAM 3 ਅਤੇ Gemini 3.5 Flash ਦੀ ਸਾਂਝੀ ਤਾਕਤ ਨਾਲ ਮੇਲ ਖਾਂਦਾ ਹੈ।
ਲੇਖਕਾਂ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ generative objective ਨੈੱਟਵਰਕ ਨੂੰ ਸੀਨ ਦੀ ਜਿਓਮੈਟਰੀ ਅਤੇ ਭੌਤਿਕ ਵਿਗਿਆਨ (physics) ਨੂੰ ਅੰਦਰੂਨੀ ਤੌਰ 'ਤੇ ਸਮਝਣ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ, ਜੋ ਫਿਰ ਅਗਲੇ ਪੜਾਅ ਦੇ perception ਕੰਮਾਂ ਵਿੱਚ ਮਦਦ ਕਰਦਾ ਹੈ।
ਰਫ਼ਤਾਰ ਲਈ ਆਰਕੀਟੈਕਚਰਲ ਸ਼ਾਰਟਕੱਟ
GenCeption Alibaba ਦੇ open-source Wan2.1 ਵੀਡੀਓ ਮਾਡਲ 'ਤੇ ਅਧਾਰਤ ਹੈ। ਕਈ ਇਟਰੇਸ਼ਨਾਂ ਵਿੱਚ ਫਰੇਮਾਂ ਨੂੰ ਸੁਧਾਰਨ ਵਾਲੀ ਆਮ diffusion ਪ੍ਰਕਿਰਿਆ ਦੀ ਬਜਾਏ, ਖੋਜਕਰਤਾਵਾਂ ਨੇ ਸਿਸਟਮ ਨੂੰ ਇੱਕ ਸਿੰਗਲ forward pass ਵਿੱਚ ਭਵਿੱਖਬਾਣੀ ਕਰਨ ਲਈ ਮੁੜ-ਇੰਜੀਨੀਅਰ ਕੀਤਾ ਹੈ। ਨਤੀਜਾ: ਮਾਡਲ ਮੌਜੂਦਾ ਹਾਰਡਵੇਅਰ 'ਤੇ ਲਗਭਗ ਦਸ ਸਕਿੰਟਾਂ ਵਿੱਚ 81-ਫਰੇਮ ਵਾਲੀ ਕਲਿੱਪ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਦਾ ਹੈ। 14-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਦਾ ਆਕਾਰ ਵੱਡਾ ਰਹਿੰਦਾ ਹੈ, ਪਰ ਸਿਖਲਾਈ ਦੀ ਬਚਤ ਅਤੇ ਕਈ ਕੰਮ-ਵਿਸ਼ੇਸ਼ ਨੈੱਟਵਰਕਾਂ ਦਾ ਖਾਤਮਾ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਕੁਸ਼ਲਤਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
AI ਭਾਈਚਾਰੇ ਨੂੰ ਇਸ ਵੱਲ ਧਿਆਨ ਕਿਉਂ ਦੇਣਾ ਚਾਹੀਦਾ ਹੈ
ਜੇਕਰ ਇੱਕ ਵੀਡੀਓ ਜਨਰੇਟਰ ਇੱਕ “world model” ਵਜੋਂ ਵੀ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ—ਇੱਕ ਅਜਿਹੀ ਪ੍ਰਤੀਨਿਧਤਾ ਜੋ ਇਹ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਵਸਤੂਆਂ ਸਪੇਸ ਵਿੱਚ ਕਿਵੇਂ ਘੇਰਾ ਪਾਉਂਦੀਆਂ ਹਨ ਅਤੇ ਸਮੇਂ ਦੇ ਨਾਲ ਕਿਵੇਂ ਹਿੱਲਦੀਆਂ ਹਨ—ਤਾਂ ਵਿਜ਼ੂਅਲ AI ਵਿੱਚ ਅਗਲੀ ਵੱਡੀ ਛਾਲ ਵੱਡੇ ਡੇਟਾਸੈੱਟਾਂ ਨੂੰ ਐਨੋਟੇਟ ਕਰਨ ਦੀ ਬਜਾਏ generative ਸਮਰੱਥਾਵਾਂ ਨੂੰ ਵਧਾਉਣ ਤੋਂ ਆ ਸਕਦੀ ਹੈ। ਇੱਕ ਸਿੰਗਲ, prompt-driven ਮਾਡਲ ਉਤਪਾਦ ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਸਰਲ ਬਣਾ ਸਕਦਾ ਹੈ, ਇੰਜੀਨੀਅਰਿੰਗ ਦੇ ਖਰਚੇ ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ, ਅਤੇ ਉਹਨਾਂ ਡਿਵੈਲਪਰਾਂ ਲਈ ਰੁਕਾਵਟਾਂ ਨੂੰ ਘੱਟ ਕਰ ਸਕਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਵਿਜ਼ਨ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਦੀ ਲੋੜ ਹੈ ਪਰ ਕਈ ਵਿਸ਼ੇਸ਼ ਨੈੱਟਵਰਕਾਂ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਸਰੋਤਾਂ ਦੀ ਕਮੀ ਹੈ।
ਸਾਵਧਾਨੀਆਂ ਅਤੇ ਅਣਸੁਲਝੇ ਸਵਾਲ
ਪ੍ਰਦਰਸ਼ਨ ਦੇ ਅੰਕੜੇ ਸਿੰਥੈਟਿਕ ਡੇਟਾ ਅਤੇ ਬੈਂਚਮਾਰਕ ਸੂਟਾਂ ਤੋਂ ਆਉਂਦੇ ਹਨ ਜੋ ਸ਼ਾਇਦ ਅਸਲ ਦੁਨੀਆ ਦੇ ਫੁਟੇਜ ਦੀ ਗੁੰਝਲਦਾਰਤਾ ਨੂੰ ਨਾ ਦਰਸਾਉਣ। ਅਣਕੰਟਰੋਲਡ ਰੌਸ਼ਨੀ, ਮੌਸਮ ਜਾਂ ਕੈਮਰਾ ਮੋਸ਼ਨ ਲਈ ਜਨਰਲਾਈਜ਼ੇਸ਼ਨ ਅਜੇ ਵੀ ਅਣਪ੍ਰਮਾਣਿਤ ਹੈ। 81-ਫਰੇਮ ਵਾਲੀ ਕਲਿੱਪ ਲਈ ਦਸ-ਸਕਿੰਟ ਦਾ inference, ਹਾਲਾਂਕਿ iterative diffusion ਨਾਲੋਂ ਤੇਜ਼ ਹੈ, ਫਿਰ ਵੀ ਰੋਬੋਟਿਕਸ ਜਾਂ AR ਲਈ ਰੀਅਲ-ਟਾਈਮ ਤੋਂ ਬਹੁਤ ਦੂਰ ਹੈ। ਇਸ ਤੋਂ ਇਲਾਵਾ, ਮਾਡਲ ਦੇ 14-ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਤੈਨਾਤ ਕਰਨ ਲਈ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਕੰਪਿਊਟ ਬਜਟ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ, ਜੋ ਕਿ ਚੰਗੀ ਤਰ੍ਹਾਂ ਫੰਡ ਪ੍ਰਾਪਤ ਲੈਬਾਂ ਤੋਂ ਬਾਹਰ ਪਹੁੰਚ ਨੂੰ ਸੀਮਤ ਕਰ ਸਕਦਾ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
- Real-world validation: ਅਜਿਹੇ ਅਧਿਐਨ ਜੋ GenCeption ਦਾ ਬਾਹਰੀ ਡਰਾਈਵਿੰਗ ਵੀਡੀਓਜ਼, ਹੈਂਡਹੈਲਡ ਫ਼ੋਨ ਫੁਟੇਜ, ਜਾਂ ਉਦਯੋਗਿਕ ਨਿਰੀਖਣ ਦ੍ਰਿਸ਼ਾਂ 'ਤੇ ਟੈਸਟ ਕਰਦੇ ਹਨ।
- Model scaling: ਕੀ ਵੱਡੇ ਜਾਂ ਵਧੇਰੇ ਕੁਸ਼ਲਤਾ ਨਾਲ ਸਿਖਲਾਈ ਪ੍ਰਾਪਤ ਸੰਸਕਰਣ ਡੇਟਾ-ਕੁਸ਼ਲਤਾ ਨੂੰ ਬਣਾਈ ਰੱਖਦੇ ਹੋਏ ਲੇਟੈਂਸੀ (latency) ਦੇ ਪਾੜੇ ਨੂੰ ਭਰ ਸਕਦੇ ਹਨ।
- Integration pathways: ਕਲਾਉਡ ਪ੍ਰੋਵਾਈਡਰ ਜਾਂ edge-AI ਪਲੇਟਫਾਰਮ ਕਿਵੇਂ ਇੱਕ ਸਿੰਗਲ API ਪ੍ਰਦਾਨ ਕਰ ਸਕਦੇ ਹਨ ਜੋ ਟੈਕਸਟਕੁਲ ਟਾਸਕ ਵਰਣਨ ਨੂੰ ਸਵੀਕਾਰ ਕਰਦਾ ਹੈ ਅਤੇ ਉਚਿਤ ਵਿਜ਼ੂਅਲ ਆਉਟਪੁੱਟ ਵਾਪਸ ਕਰਦਾ ਹੈ।
- Alternative training sources: ਮਜ਼ਬੂਤੀ (robustness) ਨੂੰ ਸੁਧਾਰਨ ਲਈ ਸਿੰਥੈਟਿਕ ਕਲਿੱਪਾਂ ਨੂੰ ਕੁਝ ਅਸਲ ਵੀਡੀਓਜ਼ ਨਾਲ ਮਿਲਾਉਣ ਦੇ ਯਤਨ।
ਮੁੱਖ ਗੱਲ (Takeaway)
GenCeption ਇਹ ਦਰਸਾਉਂਦਾ ਹੈ ਕਿ ਇੱਕ ਵੀਡੀਓ-ਜਨਰੇਸ਼ਨ ਇੰਜਣ ਇੱਕ ਮਲਟੀ-ਟਾਸਕ ਵਿਜ਼ਨ ਫਾਊਂਡੇਸ਼ਨ ਮਾਡਲ ਵਜੋਂ ਵੀ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ, ਜੋ ਰਵਾਇਤੀ ਤਰੀਕਿਆਂ ਨਾਲੋਂ ਕਈ ਗੁਣਾ ਛੋਟੇ ਡੇਟਾਸੈੱਟ ਤੋਂ ਸਿੱਖਦੇ ਹੋਏ ਅਤਿ-ਆਧੁਨਿਕ ਡੈਪਥ, ਨੌਰਮਲਜ਼, ਪੋਜ਼ ਅਤੇ ਸੈਗਮੈਂਟੇਸ਼ਨ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਇਸ ਦਾ ਵਾਅਦਾ ਕਈ ਵਿਸ਼ੇਸ਼ ਨੈੱਟਵਰਕਾਂ ਦੇ ਸਮੂਹ ਨੂੰ ਇੱਕ ਪ੍ਰੋਂਪਟ-ਡਰਿਵਨ ਸਿਸਟਮ ਵਿੱਚ ਸਮੇਟਣ ਵਿੱਚ ਹੈ; ਇਸਦੀ ਅਗਲੀ ਪ੍ਰੀਖਿਆ ਇਹ ਹੋਵੇਗੀ ਕਿ ਕੀ ਉਹ ਵਾਅਦਾ ਸਿੰਥੈਟਿਕ ਲੈਬਾਂ ਤੋਂ ਬਾਹਰ ਦੀ ਅਨਿਸ਼ਚਿਤ ਦੁਨੀਆ ਵਿੱਚ ਪਹੁੰਚਣ 'ਤੇ ਟਿਕ ਸਕਦਾ ਹੈ।
