ਖੋਜਕਰਤਾਵਾਂ ਨੇ GraphVid ਨੂੰ ਪੇਸ਼ ਕੀਤਾ ਹੈ, ਜੋ ਇੱਕ ਵੀਡੀਓ-ਜਨਰੇਸ਼ਨ ਸਿਸਟਮ ਹੈ ਜੋ ਪਿਛਲੇ ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ ਇਸਦੇ Fréchet Inception Distance ਨੂੰ 39.9% ਅਤੇ Fréchet Video Distance ਨੂੰ 37.6% ਤੱਕ ਘਟਾ ਦਿੰਦਾ ਹੈ। ਹਕੀਕਤ (realism) ਅਤੇ ਮੋਸ਼ਨ ਫਿਡੈਲਿਟੀ (motion fidelity) ਵਿੱਚ ਇਹ ਵਾਧਾ ਉਨ੍ਹਾਂ ਸਾਰੇ ਲੋਕਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ ਜੋ ਰੋਬੋਟਿਕਸ ਸਿਮੂਲੇਟਰ, ਆਟੋਨੋਮਸ-ਡਰਾਈਵਿੰਗ ਟ੍ਰੇਨਿੰਗ ਸੂਟ, ਜਾਂ ਕੰਪਿਊਟਰ-ਜਨਰੇਟਡ ਐਨੀਮੇਸ਼ਨ ਬਣਾ ਰਹੇ ਹਨ।

ਮੌਜੂਦਾ ਵਿਧੀਆਂ ਕਿਉਂ ਅਸਫਲ ਰਹਿੰਦੀਆਂ ਹਨ

ਮੌਜੂਦਾ ਕੰਟਰੋਲੇਬਲ ਵੀਡੀਓ ਜਨਰੇਟਰ ਦੋ ਇਨਪੁੱਟਾਂ 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ। ਟੈਕਸਟ ਪ੍ਰੋਂਪਟ ਇੱਕ ਅਸਪਸ਼ਟ ਵੇਰਵਾ ਦਿੰਦੇ ਹਨ ਪਰ ਕਿਸੇ ਵਸਤੂ ਦੇ ਸਹੀ ਰਸਤੇ ਨੂੰ ਨਿਸ਼ਚਿਤ ਨਹੀਂ ਕਰ ਸਕਦੇ। ਟ੍ਰੈਜੈਕਟਰੀ ਟੂਲ (Trajectory tools) ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਹਰ ਅਦਾਕਾਰ ਲਈ ਪਿਕਸਲ-ਪੱਧਰ ਦਾ ਰਸਤਾ ਤਿਆਰ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦੇ ਹਨ, ਜੋ ਉਦੋਂ ਫੇਲ੍ਹ ਹੋ ਜਾਂਦਾ ਹੈ ਜਦੋਂ ਦ੍ਰਿਸ਼ਾਂ ਵਿੱਚ ਕਈ ਆਪਸੀ ਮੇਲ ਰੱਖਣ ਵਾਲੀਆਂ ਵਸਤੂਆਂ ਜਾਂ ਰੁਕਾਵਟਾਂ (occlusions) ਹੁੰਦੀਆਂ ਹਨ। ਇੰਜੀਨੀਅਰਾਂ ਨੂੰ ਇਰਾਦਾ ਕੀਤੇ ਗਏ ਮੋਸ਼ਨ ਨੂੰ ਬਣਾਉਣ ਨਾਲੋਂ ਟੁੱਟੇ ਹੋਏ ਟ੍ਰੈਕਸ ਨੂੰ ਠੀਕ ਕਰਨ ਵਿੱਚ ਜ਼ਿਆਦਾ ਸਮਾਂ ਲੱਗ ਜਾਂਦਾ ਹੈ।

GraphVid ਦਾ ਇੰਟਰੈਕਸ਼ਨ-ਗ੍ਰਾਫ (interaction-graph) ਪਹੁੰਚ

GraphVid ਹੱਥ ਨਾਲ ਬਣਾਏ ਗਏ ਰਸਤਿਆਂ ਦੀ ਜਗ੍ਹਾ ਇੱਕ ਉੱਚ-ਪੱਧਰੀ ਇੰਟਰੈਕਸ਼ਨ ਗ੍ਰਾਫ (interaction graph) ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ। ਹਰੇਕ ਪਿਕਸਲ ਨੂੰ ਮੈਪ ਕਰਨ ਦੀ ਬਜਾਏ, ਉਪਭੋਗਤਾ ਰਿਸ਼ਤੇ ਪਰਿਭਾਸ਼ਿਤ ਕਰਦਾ ਹੈ—"ਵਸਤੂ A, ਵਸਤੂ B ਦੇ ਨੇੜੇ ਆਉਂਦੀ ਹੈ", "ਵਸਤੂ C, ਵਸਤੂ D ਦਾ ਪਿੱਛਾ ਕਰਦੀ ਹੈ", "ਵਸਤੂ E, ਵਸਤੂ F ਨਾਲ ਟਕਰਾਉਂਦੀ ਹੈ"। ਮਾਡਲ ਇਸ ਗ੍ਰਾਫ ਨੂੰ ਇੱਕ ਬਲੂਪ੍ਰਿੰਟ ਵਜੋਂ ਪੜ੍ਹਦਾ ਹੈ ਅਤੇ ਰਿਲੇਸ਼ਨਲ ਸੰਕੇਤਾਂ ਨੂੰ ਇਕਸਾਰ ਮੋਸ਼ਨ ਅਤੇ ਦਿੱਖ ਵਿੱਚ ਬਦਲ ਦਿੰਦਾ ਹੈ। ਕੱਚੇ ਕੋਆਰਡੀਨੇਟਸ (raw coordinates) ਦੀ ਬਜਾਏ ਸਿਮੈਂਟਿਕਸ (semantics) 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰਕੇ, ਇਹ ਵਸਤੂਆਂ ਦਾ ਪਤਾ ਰੱਖਦਾ ਹੈ, ਭਾਵੇਂ ਉਹ ਇੱਕ ਦੂਜੇ ਦੇ ਪਿੱਛੇ ਗਾਇਬ ਹੋ ਜਾਣ।

ਟੀਮ ਨੇ ਇੱਕ ਸਮਰਪਿਤ ਟ੍ਰੇਨਿੰਗ ਸੈੱਟ, GraphVid-Bench ਬਣਾਇਆ ਹੈ, ਜੋ ਵੀਡੀਓ ਕਲਿੱਪਾਂ ਨੂੰ ਸੰਰਚਿਤ ਰਿਲੇਸ਼ਨਲ ਡੇਟਾ (structured relational data) ਨਾਲ ਜੋੜਦਾ ਹੈ। ਇਹ ਡੇਟਾ ਸੈੱਟ ਮਾਡਲ ਨੂੰ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਵੱਖ-ਵੱਖ ਇੰਟਰੈਕਸ਼ਨ ਪੈਟਰਨਾਂ ਦੇ ਤਹਿਤ ਕਈ ਵਸਤੂਆਂ ਇਕੱਠੀਆਂ ਕਿਵੇਂ ਹਿੱਲਦੀਆਂ ਹਨ, ਜਿਸ ਨਾਲ ਇਸਨੂੰ ਇੱਕ ਅਜਿਹੀ ਮੋਸ਼ਨ ਵੋਕੈਬਲਰੀ (motion vocabulary) ਮਿਲਦੀ ਹੈ ਜਿਸ ਨੂੰ ਇਹ ਇਨਫਰੈਂਸ (inference) ਸਮੇਂ ਦੁਬਾਰਾ ਜੋੜ ਸਕਦਾ ਹੈ।

ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਸੁਧਾਰ

ਮੈਟ੍ਰਿਕ (Metric) ਪਿਛਲੇ ਮਾਡਲ GraphVid
Fréchet Inception Distance (FID) ↓ 39.9 %
Fréchet Video Distance (FVD) ↓ 37.6 %
Peak Signal-to-Noise Ratio (PSNR) 9.87 15.98
Structural Similarity Index (SSIM) 0.38 0.61

ਘੱਟ FID ਅਤੇ FVD ਸਕੋਰਾਂ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਬਣਾਈਆਂ ਗਈਆਂ ਵੀਡੀਓਜ਼ ਵਧੇਰੇ ਅਸਲੀ ਲੱਗਦੀਆਂ ਹਨ ਅਤੇ ਫਰੇਮਾਂ ਵਿੱਚ ਮੋਸ਼ਨ ਵਧੇਰੇ ਸੁਚਾਰੂ ਰਹਿੰਦਾ ਹੈ। PSNR ਅਤੇ SSIM ਵਿੱਚ ਵਾਧਾ ਤਿੱਖੇ ਟੈਕਸਚਰ (textures) ਅਤੇ ਬਿਹਤਰ ਸੰਰਚਨਾਤਮਕ ਸੁਰੱਖਿਆ ਦਾ ਸੰਕੇਤ ਦਿੰਦਾ ਹੈ। ਇਕੱਠੇ ਮਿਲ ਕੇ, ਇਹ ਅੰਕੜੇ ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ GraphVid ਅਜਿਹੀਆਂ ਵੀਡੀਓਜ਼ ਤਿਆਰ ਕਰਦਾ ਹੈ ਜੋ ਅਸਲ ਫੁਟੇਜ ਦੇ ਕਾਫ਼ੀ ਨੇੜੇ ਹਨ।

ਕੁਸ਼ਲਤਾ ਅਤੇ ਵਿਹਾਰਕ ਪ੍ਰਭਾਵ

GraphVid ਪਹਿਲਾਂ ਦੇ ਤਰੀਕਿਆਂ ਦੇ ਮੁਕਾਬਲੇ ਘੱਟ ਪੈਰਾਮੀਟਰਾਂ ਅਤੇ ਘੱਟ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਨਾਲ ਇਹ ਪ੍ਰਾਪਤੀਆਂ ਹਾਸਲ ਕਰਦਾ ਹੈ। ਮਾਡਲ ਪਿਕਸਲ-ਪੱਧਰ ਦੀ ਡਾਇਨਾਮਿਕਸ ਨੂੰ ਯਾਦ ਰੱਖਣ ਦੀ ਬਜਾਏ ਦ੍ਰਿਸ਼ ਦੀ ਸੰਰਚਨਾ ਬਾਰੇ ਵਿਚਾਰ ਕਰਦਾ ਹੈ। AI ਇੰਜੀਨੀਅਰਾਂ ਲਈ, ਵਰਕਫਲੋ (workflow) ਮਿਹਨਤ ਵਾਲੇ ਰਸਤੇ ਬਣਾਉਣ ਤੋਂ ਰਿਲੇਸ਼ਨਲ ਡੇਟਾ ਡਿਜ਼ਾਈਨ ਕਰਨ ਵੱਲ ਬਦਲ ਜਾਂਦਾ ਹੈ—ਇੱਕ ਅਜਿਹਾ ਬਦਲਾਅ ਜੋ ਵਸਤੂਆਂ ਦੀ ਗਿਣਤੀ ਵਧਣ ਨਾਲ ਕੁਦਰਤੀ ਤੌਰ 'ਤੇ ਵਧਦਾ ਹੈ।

ਸੰਭਾਵੀ ਲਾਭਪਾਤਰੀਆਂ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ:

  • Robotics – ਸਿਮੂਲੇਟਡ ਵਾਤਾਵਰਣ ਹੁਣ ਮੈਨੂਅਲ ਟ੍ਰੈਜੈਕਟਰੀ ਸਕ੍ਰਿਪਟਿੰਗ ਤੋਂ ਬਿਨਾਂ ਅਸਲੀ ਵਸਤੂ ਇੰਟਰੈਕਸ਼ਨਾਂ ਨੂੰ ਦਰਸਾ ਸਕਦੇ ਹਨ।
  • Autonomous-driving – ਕਈ ਕਾਰਾਂ, ਪੈਦਲ ਚੱਲਣ ਵਾਲਿਆਂ ਅਤੇ ਸਾਈਕਲ ਸਵਾਰਾਂ ਵਾਲੇ ਟ੍ਰੈਫਿਕ ਸਥਿਤੀਆਂ ਨੂੰ ਉੱਚ-ਪੱਧਰੀ ਇੰਟਰੈਕਸ਼ਨ ਨਿਯਮਾਂ ਤੋਂ ਤਿਆਰ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਜੋ ਡੇਟਾ-ਔਗਮੈਂਟੇਸ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਤੇਜ਼ ਕਰਦਾ ਹੈ।
  • Animation – ਕਲਾਕਾਰ ਕਹਾਣੀ ਦੇ ਰਿਸ਼ਤਿਆਂ 'ਤੇ ਧਿਆਨ ਕੇਂਦਰਿਤ ਕਰ ਸਕਦੇ ਹਨ ਜਦੋਂ ਕਿ ਸਿਸਟਮ ਅੰਡਰਲਾਈਂਗ ਮੋਸ਼ਨ ਫਿਜ਼ਿਕਸ ਨੂੰ ਸੰਭਾਲਦਾ ਹੈ।

ਸਿੱਟਾ (Takeaway): ਵਸਤੂਆਂ ਦੇ ਰਿਸ਼ਤਿਆਂ ਨੂੰ ਮੁੱਖ ਕੰਟਰੋਲ ਸਿਗਨਲ ਵਜੋਂ ਵਰਤ ਕੇ, GraphVid ਵੀਡੀਓ ਜਨਰੇਸ਼ਨ ਨੂੰ ਸਿਰਜਣਹਾਰਾਂ ਲਈ ਵਧੇਰੇ ਸਹਿਜ ਅਤੇ ਅਸਲ ਦੁਨੀਆ ਦੇ ਮੋਸ਼ਨ ਦੇ ਪ੍ਰਤੀ ਵਧੇਰੇ ਵਫ਼ਾਦਾਰ ਬਣਾਉਂਦਾ ਹੈ, ਜੋ ਕੰਟਰੋਲੇਬਲ ਸਿੰਥੇਸਿਸ (controllable synthesis) ਲਈ ਇੱਕ ਨਵਾਂ ਰਸਤਾ ਦਿਖਾਉਂਦਾ ਹੈ।