محققان از GraphVid رونمایی کردند؛ یک سیستم تولید ویدیو که فاصله فرشه اینسپشن (FID) را ۳۹.۹٪ و فاصله ویدئویی فرشه (FVD) را ۳۷.۶٪ نسبت به مدل‌های قبلی کاهش می‌دهد. این بهبود در واقع‌گرایی و دقت حرکت برای هر کسی که در حال ساخت شبیه‌سازهای رباتیک، مجموعه‌های آموزشی رانندگی خودکار یا انیمیشن‌های کامپیوتری است، اهمیت زیادی دارد.

چرا روش‌های موجود کارایی لازم را ندارند

مولدهای ویدیویی کنترل‌پذیر فعلی بر دو ورودی متکی هستند. دستورهای متنی (Text prompts) توصیفی مبهم ارائه می‌دهند اما نمی‌توانند مسیر دقیق یک شیء را مشخص کنند. ابزارهای مسیر‌یابی (Trajectory tools) کاربران را مجبور می‌کنند تا مسیر را در سطح پیکسل برای هر بازیگر ترسیم کنند، که این رویکرد در صحنه‌هایی با موجودیت‌های متقابل متعدد یا انسدادهای دید (occlusions) از کار می‌افتد. در نهایت، مهندسان بسیار بیشتر از آنکه مشغول خلق حرکت مورد نظر باشند، وقت خود را صرف اصلاح مسیرهای شکسته می‌کنند.

رویکرد گراف تعاملی GraphVid

GraphVid مسیرهای ترسیم‌شده با دست را با یک گراف تعاملی سطح بالا جایگزین می‌کند. کاربر به جای نقشه‌برداری از هر پیکسل، روابط را تعریف می‌کند؛ مثلاً «شیء A به شیء B نزدیک می‌شود»، «شیء C شیء D را دنبال می‌کند» یا «شیء E با شیء F برخورد می‌کند». مدل، گراف را به عنوان یک نقشه اولیه می‌خواند و نشانه‌های رابطه‌ای را به حرکت و ظاهر منسجم تبدیل می‌کند. با تمرکز بر معناشناسی (semantics) به جای مختصات خام، این مدل می‌تواند اشیاء را حتی زمانی که پشت یکدیگر پنهان می‌شوند، ردیابی کند.

تیم تحقیق یک مجموعه آموزشی اختصاصی به نام GraphVid-Bench ساخته است که کلیپ‌های ویدیویی را با داده‌های رابطه‌ای ساختاریافته جفت می‌کند. این مجموعه داده به مدل نشان می‌دهد که چگونه اشیاء متعدد تحت الگوهای تعاملی مختلف با هم حرکت می‌کنند و به آن یک «واژگان حرکتی» می‌بخشد که می‌تواند در زمان استنتاج (inference) آن‌ها را دوباره ترکیب کند.

بهبود عملکرد

معیار مدل‌های قبلی GraphVid
Fréchet Inception Distance (FID) ↓ 39.9 %
Fréchet Video Distance (FVD) ↓ 37.6 %
Peak Signal-to-Noise Ratio (PSNR) 9.87 15.98
Structural Similarity Index (SSIM) 0.38 0.61

امتیازات پایین‌تر در FID و FVD به این معناست که ویدیوهای تولید شده واقع‌گرایانه‌تر به نظر می‌رسند و حرکت در طول فریم‌ها روان‌تر باقی می‌ماند. جهش در PSNR و SSIM نشان‌دهنده بافت‌های شفاف‌تر و حفظ بهتر ساختار است. در مجموع، این اعداد نشان می‌دهند که GraphVid ویدیوهایی تولید می‌کند که به وضوح به فیلم‌های واقعی نزدیک‌تر هستند.

کارایی و تأثیر عملی

GraphVid با پارامترهای کمتر و داده‌های آموزشی محدودتر نسبت به رویکردهای قبلی، به این دستاوردها می‌رسد. این مدل به جای حفظ کردن دینامیک‌های سطح پیکسل، درباره ساختار صحنه استدلال می‌کند. برای مهندسان هوش مصنوعی، گردش کار از ترسیم طاقت‌فرسای مسیر به طراحی داده‌های رابطه‌ای تغییر می‌کند؛ تغییری که با افزایش تعداد اشیاء، به طور طبیعی مقیاس‌پذیر است.

ذینفعان بالقوه عبارتند از:

  • رباتیک – محیط‌های شبیه‌سازی شده اکنون می‌توانند تعاملات واقع‌گرایانه اشیاء را بدون اسکریپت‌نویسی دستیِ مسیر، منعکس کنند.
  • رانندگی خودکار – سناریوهای ترافیکی شامل چندین خودرو، عابر پیاده و دوچرخه‌سوار را می‌توان بر اساس قوانین تعاملی سطح بالا تولید کرد که باعث تسریع در خطوط لوله (pipelines) افزایش داده می‌شود.
  • انیمیشن – هنرمندان می‌توانند بر روابط روایی تمرکز کنند، در حالی که سیستم فیزیک حرکت زیربنایی را مدیریت می‌کند.

نکته کلیدی: GraphVid با در نظر گرفتن روابط بین اشیاء به عنوان سیگنال کنترلی اصلی، تولید ویدیو را برای سازندگان بصری‌تر و نسبت به حرکت‌های دنیای واقعی وفادارتر می‌کند و مسیر جدیدی را برای سنتز کنترل‌پذیر باز می‌کند.