ഗവേഷകർ GraphVid അവതരിപ്പിച്ചു, ഇത് മുൻപത്തെ മോഡലുകളെ അപേക്ഷിച്ച് അതിന്റെ Fréchet Inception Distance 39.9 % കുറയ്ക്കുകയും Fréchet Video Distance 37.6 % കുറയ്ക്കുകയും ചെയ്യുന്നു. റോബോട്ടിക്സ് സിമുലേറ്ററുകൾ, ഓട്ടോണമസ് ഡ്രൈവിംഗ് ട്രെയിനിംഗ് സ്യൂട്ടുകൾ, അല്ലെങ്കിൽ കമ്പ്യൂട്ടർ ജനറേറ്റഡ് ആനിമേഷൻ എന്നിവ നിർമ്മിക്കുന്നവർക്ക് ഈ യാഥാർത്ഥ്യബോധവും (realism) ചലനത്തിലെ കൃത്യതയും (motion fidelity) വളരെ പ്രധാനമാണ്.

നിലവിലുള്ള രീതികൾ എവിടെയാണ് പരാജയപ്പെടുന്നത്

നിലവിലുള്ള നിയന്ത്രിത വീഡിയോ ജനറേറ്ററുകൾ രണ്ട് ഇൻപുട്ടുകളെയാണ് ആശ്രയിക്കുന്നത്. ടെക്സ്റ്റ് പ്രോംപ്റ്റുകൾ അവ്യക്തമായ വിവരണങ്ങൾ നൽകുന്നുണ്ടെങ്കിലും ഒരു വസ്തുവിന്റെ കൃത്യമായ പാത നിർണ്ണയിക്കാൻ അവയ്ക്ക് കഴിയില്ല. ട്രാജക്റ്ററി ടൂളുകൾ ഓരോ കഥാപാത്രത്തിനും പിക്സൽ തലത്തിലുള്ള പാത വരയ്ക്കാൻ ഉപയോക്താക്കളെ നിർബന്ധിക്കുന്നു, എന്നാൽ ഒന്നിലധികം വസ്തുക്കൾ പരസ്പരം ഇടപഴകുന്നതോ അല്ലെങ്കിൽ ഒന്നിന് പിന്നിൽ മറ്റൊന്ന് മറയുന്നതോ ആയ രംഗങ്ങളിൽ ഇത് പരാജയപ്പെടുന്നു. ഉദ്ദേശിച്ച ചലനം സൃഷ്ടിക്കുന്നതിനേക്കാൾ കൂടുതൽ തവണ തകരാറിലായ പാതകൾ ശരിയാക്കാൻ എഞ്ചിനീയർമാർക്ക് ബുദ്ധിമുട്ടേണ്ടി വരുന്നു.

GraphVid-ന്റെ ഇന്ററാക്ഷൻ-ഗ്രാഫ് സമീപനം

GraphVid കൈകൊണ്ട് വരയ്ക്കുന്ന പാതകൾക്ക് പകരം ഒരു ഹൈ-ലെവൽ ഇന്ററാക്ഷൻ ഗ്രാഫ് ഉപയോഗിക്കുന്നു. ഓരോ പിക്സലും മാപ്പ് ചെയ്യുന്നതിന് പകരം, ഉപയോക്താവ് ബന്ധങ്ങൾ നിർവചിക്കുന്നു—"വസ്തു A, വസ്തു B-യോട് അടുക്കുന്നു", "വസ്തു C, വസ്തു D-യെ പിന്തുടരുന്നു", "വസ്തു E, വസ്തു F-മായി കൂട്ടിയിടിക്കുന്നു". ഈ ഗ്രാഫിനെ ഒരു ബ്ലൂപ്രിന്റായി വായിക്കുകയും ബന്ധങ്ങളെ വ്യക്തമായ ചലനമായും രൂപമായും മാറ്റുകയും ചെയ്യുന്നു. കോർഡിനേറ്റുകൾക്ക് പകരം സെമാന്റിക്സിന് (semantics) മുൻഗണന നൽകുന്നതിലൂടെ, വസ്തുക്കൾ ഒന്നിന് പിന്നിൽ മറ്റൊന്ന് മറയുന്ന സാഹചര്യത്തിലും അവയെ കൃത്യമായി ട്രാക്ക് ചെയ്യാൻ ഇതിന് സാധിക്കുന്നു.

വീഡിയോ ക്ലിപ്പുകളെ ഘടനാപരമായ റിലേഷണൽ ഡാറ്റയുമായി (relational data) ബന്ധിപ്പിക്കുന്ന GraphVid-Bench എന്ന പ്രത്യേക ട്രെയിനിംഗ് സെറ്റ് ടീം നിർമ്മിച്ചു. വിവിധ ഇന്ററാക്ഷൻ പാറ്റേണുകളിൽ ഒന്നിലധികം വസ്തുക്കൾ എങ്ങനെ ഒരുമിച്ച് നീങ്ങുന്നു എന്ന് ഈ ഡാറ്റാസെറ്റ് മോഡലിനെ കാണിച്ചുതരുന്നു, ഇത് ഇൻഫറൻസ് സമയത്ത് പുനർനിർമ്മിക്കാൻ കഴിയുന്ന ഒരു മോഷൻ വൊക്കാബുലറി (motion vocabulary) നൽകുന്നു.

പ്രകടനത്തിലെ നേട്ടങ്ങൾ

മാപിനകം (Metric) മുൻപത്തെ മോഡലുകൾ GraphVid
Fréchet Inception Distance (FID) ↓ 39.9 %
Fréchet Video Distance (FVD) ↓ 37.6 %
Peak Signal-to-Noise Ratio (PSNR) 9.87 15.98
Structural Similarity Index (SSIM) 0.38 0.61

കുറഞ്ഞ FID, FVD സ്കോറുകൾ എന്നാൽ നിർമ്മിക്കപ്പെട്ട വീഡിയോകൾ കൂടുതൽ യാഥാർത്ഥ്യബോധമുള്ളവയായിരിക്കും എന്നും ഫ്രെയിമുകൾക്കിടയിലുള്ള ചലനം കൂടുതൽ സുഗമമായിരിക്കും എന്നുമാണ് അർത്ഥം. PSNR, SSIM എന്നിവയിലെ വർദ്ധനവ് കൂടുതൽ വ്യക്തമായ ടെക്സ്ചറുകളും മികച്ച ഘടനാപരമായ നിലനിൽപ്പും സൂചിപ്പിക്കുന്നു. ഈ കണക്കുകൾ സൂചിപ്പിക്കുന്നത് GraphVid യഥാർത്ഥ ദൃശ്യങ്ങളോട് വളരെ അടുത്ത വീഡിയോകൾ നിർമ്മിക്കുന്നു എന്നാണ്.

കാര്യക്ഷമതയും പ്രായോഗിക സ്വാധീനവും

മുൻപത്തെ രീതികളേക്കാൾ കുറഞ്ഞ പാരാമീറ്ററുകളും കുറഞ്ഞ പരിശീലന ഡാറ്റയും ഉപയോഗിച്ചാണ് GraphVid ഈ നേട്ടങ്ങൾ കൈവരിക്കുന്നത്. പിക്സൽ തലത്തിലുള്ള ഡൈനാമിക്സ് മനഃപാഠമാക്കുന്നതിന് പകരം മോഡൽ രംഗത്തിന്റെ ഘടനയെക്കുറിച്ച് വിശകലനം ചെയ്യുന്നു. AI എഞ്ചിനീയർമാരെ സംബന്ധിച്ചിടത്തോളം, കഠിനമായ പാത വരയ്ക്കൽ എന്ന ജോലിയിൽ നിന്ന് റിലേഷണൽ ഡാറ്റ രൂപകൽപ്പന ചെയ്യുന്നതിലേക്ക് വർക്ക്ഫ്ലോ മാറുന്നു—വസ്തുക്കളുടെ എണ്ണം കൂടുമ്പോൾ ഇത് സ്വാഭാവികമായി വിപുലീകരിക്കാൻ സഹായിക്കുന്നു.

പ്രയോജനം ലഭിക്കാൻ സാധ്യതയുള്ളവർ:

  • റോബോട്ടിക്സ് (Robotics) – മാനുവൽ ട്രാജക്റ്ററി സ്ക്രിപ്റ്റിംഗ് ഇല്ലാതെ തന്നെ സിമുലേറ്റഡ് പരിതസ്ഥിതികളിൽ യഥാർത്ഥ വസ്തുക്കളുടെ ഇടപെടലുകൾ പ്രതിഫലിപ്പിക്കാൻ കഴിയും.
  • ഓട്ടോണമസ് ഡ്രൈവിംഗ് (Autonomous-driving) – ഒന്നിലധികം കാറുകൾ, കാൽനടയാത്രക്കാർ, സൈക്കിൾ യാത്രക്കാർ എന്നിവരുള്ള ട്രാഫിക് സാഹചര്യങ്ങൾ ഹൈ-ലെവൽ ഇന്ററാക്ഷൻ നിയമങ്ങളിൽ നിന്ന് നിർമ്മിക്കാൻ കഴിയും, ഇത് ഡാറ്റാ-ഓഗ്മെന്റേഷൻ പൈപ്പ്‌ലൈനുകൾ വേഗത്തിലാക്കുന്നു.
  • ആനിമേഷൻ (Animation) – സിസ്റ്റം അടിസ്ഥാനപരമായ ചലന ഭൗതികശാസ്ത്രം (motion physics) കൈകാര്യം ചെയ്യുമ്പോൾ കലാകാരന്മാർ കഥാപരമായ ബന്ധങ്ങളിൽ ശ്രദ്ധ കേന്ദ്രീകരിക്കാം.

ചുരുക്കത്തിൽ: വസ്തുക്കൾ തമ്മിലുള്ള ബന്ധങ്ങളെ പ്രധാന നിയന്ത്രണ സിഗ്നലായി പരിഗണിക്കുന്നതിലൂടെ, GraphVid വീഡിയോ നിർമ്മാണം സ്രഷ്ടാക്കൾക്ക് കൂടുതൽ ലളിതമാക്കുകയും യഥാർത്ഥ ലോക ചലനങ്ങളോട് കൂടുതൽ വിശ്വസ്തത പുലർത്തുകയും ചെയ്യുന്നു, ഇത് നിയന്ത്രിത സിന്തസിസിന് (controllable synthesis) പുതിയൊരു ദിശാബോധം നൽകുന്നു.