संशोधकांनी GraphVid सादर केले आहे, ही एक व्हिडिओ-जनरेशन सिस्टम आहे जी मागील मॉडेल्सच्या तुलनेत तिचा Fréchet Inception Distance ३९.९% आणि Fréchet Video Distance ३७.६% ने कमी करते. वास्तववाद (realism) आणि मोशन फिडेलिटीमधील (motion fidelity) ही वाढ रोबोटिक्स सिम्युलेटर्स, ऑटोनॉमस-ड्रायव्हिंग ट्रेनिंग सूट्स किंवा कॉम्प्युटर-जनरेटेड ॲनिमेशन तयार करणाऱ्यांसाठी अत्यंत महत्त्वाची आहे.
सध्याच्या पद्धती अपुऱ्या का पडतात
सध्याचे नियंत्रणीय (controllable) व्हिडिओ जनरेटर्स दोन इनपुट्सवर अवलंबून असतात. टेक्स्ट प्रॉम्प्ट्स अस्पष्ट वर्णन देतात परंतु वस्तूचा नेमका मार्ग निश्चित करू शकत नाहीत. ट्रॅजेक्टरी टूल्स वापरकर्त्यांना प्रत्येक पात्रासाठी पिक्सेल-लेव्हलचा मार्ग रेखाटण्यास भाग पाडतात, जे दृश्यामध्ये अनेक परस्परसंवादी घटक किंवा अडथळे (occlusions) असल्यास कोलमडते. इंजिनिअर्सना अपेक्षित हालचाल तयार करण्यापेक्षा खराब झालेले ट्रॅक्स दुरुस्त करण्यात जास्त वेळ घालवावा लागतो.
GraphVid चा इंटरॲक्शन-ग्राफ दृष्टिकोन
GraphVid हाताने काढलेल्या मार्गांऐवजी हाय-लेव्हल इंटरॲक्शन ग्राफचा वापर करते. प्रत्येक पिक्सेल मॅप करण्याऐवजी, वापरकर्ता संबंध परिभाषित करतो—"वस्तू A वस्तू B कडे जाते", "वस्तू C वस्तू D चे अनुसरण करते", "वस्तू E वस्तू F शी धडकते". मॉडेल या ग्राफला ब्लूप्रिंट म्हणून वाचते आणि संबंधांमधील संकेतांचे सुसंगत हालचाल आणि स्वरूपात रूपांतर करते. केवळ कोऑर्डिनेट्सवर लक्ष केंद्रित करण्याऐवजी सिमेंटिक्सवर (semantics) लक्ष केंद्रित केल्यामुळे, वस्तू एकमेकांच्या मागे गेल्यावरही मॉडेल त्यांचा मागोवा घेऊ शकते.
टीमने GraphVid-Bench नावाचा एक समर्पित ट्रेनिंग सेट तयार केला आहे, जो व्हिडिओ क्लिप्सना स्ट्रक्चर्ड रिलॅशनल डेटाशी जोडतो. हा डेटासेट मॉडेलला विविध इंटरॲक्शन पॅटर्न अंतर्गत अनेक वस्तू एकत्र कशा हालचाल करतात हे दर्शवतो, ज्यामुळे त्याला एक 'मोशन व्होकॅब्युलरी' मिळते ज्याचा वापर ते इन्फरन्स (inference) वेळी पुन्हा करू शकते.
कामगिरीतील सुधारणा
| निकष (Metric) | मागील मॉडेल्स | GraphVid |
|---|---|---|
| Fréchet Inception Distance (FID) | – | ↓ 39.9 % |
| Fréchet Video Distance (FVD) | – | ↓ 37.6 % |
| Peak Signal-to-Noise Ratio (PSNR) | 9.87 | 15.98 |
| Structural Similarity Index (SSIM) | 0.38 | 0.61 |
कमी FID आणि FVD स्कोअरचा अर्थ असा आहे की तयार केलेले व्हिडिओ अधिक वास्तववादी दिसतात आणि फ्रेम्समध्ये हालचाल अधिक स्मूथ राहते. PSNR आणि SSIM मधील वाढ अधिक स्पष्ट टेक्सचर्स आणि उत्तम स्ट्रक्चरल प्रिझर्व्हेशन दर्शवते. एकत्रितपणे, हे आकडे दर्शवतात की GraphVid वास्तविक फुटेजच्या लक्षणीयरीत्या जवळ असलेले व्हिडिओ तयार करते.
कार्यक्षमता आणि व्यावहारिक प्रभाव
GraphVid मागील पद्धतींच्या तुलनेत कमी पॅरामीटर्स आणि कमी ट्रेनिंग डेटासह ही कामगिरी साध्य करते. मॉडेल पिक्सेल-लेव्हल डायनॅमिक्स लक्षात ठेवण्याऐवजी सीनच्या स्ट्रक्चरबद्दल तर्क करते. AI इंजिनिअर्ससाठी, वर्कफ्लो हा कष्टाच्या मार्ग रेखाटनाकडून रिलॅशनल डेटा डिझाइन करण्याकडे वळतो—वस्तूंची संख्या वाढल्यास हा बदल नैसर्गिकरित्या स्केल होतो.
संभाव्य लाभार्थी यामध्ये खालील घटकांचा समावेश होतो:
- रोबोटिक्स – सिम्युलेटेड वातावरण आता मॅन्युअल ट्रॅजेक्टरी स्क्रिप्टिंगशिवाय वास्तववादी वस्तूंच्या परस्परसंवादांचे प्रतिबिंब दर्शवू शकते.
- ऑटोनॉमस-ड्रायव्हिंग – अनेक कार, पादचारी आणि सायकलस्वारांसह ट्रॅफिक सिनेरिओ हाय-लेव्हल इंटरॲक्शन नियमांपासून तयार केले जाऊ शकतात, ज्यामुळे डेटा-ऑगमेंटेशन पाइपलाइनचा वेग वाढतो.
- ॲनिमेशन – कलाकार कथात्मक संबंधांवर लक्ष केंद्रित करू शकतात, तर सिस्टम मूळ मोशन फिजिक्स हाताळते.
निष्कर्ष: वस्तूंच्या संबंधांना प्राथमिक कंट्रोल सिग्नल म्हणून मानून, GraphVid व्हिडिओ जनरेशन निर्मात्यांसाठी अधिक सहज (intuitive) आणि वास्तविक जगातील हालचालींशी अधिक सुसंगत बनवते, जे नियंत्रणीय सिंथेसिससाठी (controllable synthesis) एक नवीन दिशा दर्शवते.
