शोधकर्ताओं ने GraphVid का अनावरण किया है, जो एक वीडियो-जेनरेशन सिस्टम है जो पिछले मॉडलों की तुलना में अपने Fréchet Inception Distance को 39.9% और Fréchet Video Distance को 37.6% तक कम कर देता है। यथार्थवाद (realism) और मोशन फिडेलिटी (motion fidelity) में यह वृद्धि उन सभी के लिए महत्वपूर्ण है जो रोबोटिक्स सिम्युलेटर, ऑटोनॉमस-ड्राइविंग ट्रेनिंग सूट, या कंप्यूटर-जेनरेटेड एनिमेशन बना रहे हैं।

मौजूदा तरीके क्यों कम पड़ जाते हैं

वर्तमान कंट्रोलेबल वीडियो जनरेटर दो इनपुट पर निर्भर करते हैं। टेक्स्ट प्रॉम्प्ट एक अस्पष्ट विवरण देते हैं लेकिन किसी वस्तु के सटीक पथ (path) को निर्धारित नहीं कर सकते। ट्रैजेक्टरी टूल्स उपयोगकर्ताओं को प्रत्येक पात्र के लिए पिक्सेल-स्तर का पथ स्केच करने के लिए मजबूर करते हैं, जो तब विफल हो जाता है जब दृश्यों में कई परस्पर क्रिया करने वाली संस्थाएं (entities) या रुकावटें (occlusions) होती हैं। इंजीनियरों को इच्छित मोशन बनाने की तुलना में टूटे हुए ट्रैक्स को ठीक करने में कहीं अधिक समय देना पड़ता है।

GraphVid का इंटरेक्शन-ग्राफ दृष्टिकोण

GraphVid हाथ से बनाए गए पथों के स्थान पर एक हाई-लेवल इंटरेक्शन ग्राफ का उपयोग करता है। प्रत्येक पिक्सेल को मैप करने के बजाय, उपयोगकर्ता संबंधों को परिभाषित करता है—"वस्तु A, वस्तु B के पास आती है", "वस्तु C, वस्तु D का अनुसरण करती है", "वस्तु E, वस्तु F से टकराती है"। मॉडल ग्राफ को एक ब्लूप्रिंट के रूप में पढ़ता है और रिलेशनल संकेतों को सुसंगत मोशन और दिखावट में बदल देता है। कच्चे निर्देशांकों (raw coordinates) के बजाय सिमेंटिक्स (semantics) पर ध्यान केंद्रित करके, यह वस्तुओं पर तब भी नज़र रखता है जब वे एक-दूसरे के पीछे गायब हो जाती हैं।

टीम ने एक समर्पित ट्रेनिंग सेट, GraphVid-Bench बनाया है, जो वीडियो क्लिप्स को स्ट्रक्चर्ड रिलेशनल डेटा के साथ जोड़ता है। यह डेटासेट मॉडल को दिखाता है कि विभिन्न इंटरेक्शन पैटर्न के तहत कई वस्तुएं एक साथ कैसे चलती हैं, जिससे इसे एक 'मोशन वोकैबुलरी' मिलती है जिसे यह इन्फरेंस (inference) के समय पुनर्संयोजित कर सकता है।

प्रदर्शन में सुधार

मेट्रिक पिछले मॉडल GraphVid
Fréchet Inception Distance (FID) ↓ 39.9 %
Fréchet Video Distance (FVD) ↓ 37.6 %
Peak Signal-to-Noise Ratio (PSNR) 9.87 15.98
Structural Similarity Index (SSIM) 0.38 0.61

कम FID और FVD स्कोर का मतलब है कि जेनरेट किए गए वीडियो अधिक वास्तविक दिखते हैं और मोशन फ्रेम्स के बीच अधिक सुचारू रहता है। PSNR और SSIM में उछाल तीखे टेक्सचर और बेहतर स्ट्रक्चरल प्रिजर्वेशन का संकेत देता है। कुल मिलाकर, ये आंकड़े दर्शाते हैं कि GraphVid वास्तविक फुटेज के काफी करीब वीडियो बनाता है।

दक्षता और व्यावहारिक प्रभाव

GraphVid पिछले दृष्टिकोणों की तुलना में कम पैरामीटर्स और कम ट्रेनिंग डेटा के साथ इन लाभों को प्राप्त करता है। मॉडल पिक्सेल-स्तर की डायनेमिक्स को याद करने के बजाय सीन स्ट्रक्चर के बारे में तर्क करता है। AI इंजीनियरों के लिए, वर्कफ़्लो थकाऊ पथ ड्राइंग से बदलकर रिलेशनल डेटा डिजाइन करने की ओर स्थानांतरित हो जाता है—एक ऐसा बदलाव जो वस्तुओं की संख्या बढ़ने पर स्वाभाविक रूप से स्केल होता है।

संभावित लाभार्थियों में शामिल हैं:

  • Robotics – सिम्युलेटेड वातावरण अब बिना मैन्युअल ट्रैजेक्टरी स्क्रिप्टिंग के वास्तविक वस्तु इंटरेक्शन को दर्शा सकते हैं।
  • Autonomous-driving – कई कारों, पैदल यात्रियों और साइकिल चालकों वाले ट्रैफिक परिदृश्यों को हाई-लेवल इंटरेक्शन नियमों से जेनरेट किया जा सकता है, जिससे डेटा-ऑग्मेंटेशन पाइपलाइन की गति बढ़ जाती है।
  • Animation – कलाकार कथात्मक संबंधों (narrative relationships) पर ध्यान केंद्रित कर सकते हैं जबकि सिस्टम अंतर्निहित मोशन फिजिक्स को संभालता है।

निष्कर्ष: वस्तु संबंधों को प्राथमिक कंट्रोल सिग्नल के रूप में मानकर, GraphVid वीडियो जेनरेशन को क्रिएटर्स के लिए अधिक सहज और वास्तविक दुनिया के मोशन के प्रति अधिक वफादार बनाता है, जो कंट्रोलेबल सिंथेसिस के लिए एक नई दिशा की ओर इशारा करता है।