Дослідники представили GraphVid — систему генерації відео, яка знижує показник Fréchet Inception Distance на 39,9% та Fréchet Video Distance на 37,6% порівняно з попередніми моделями. Підвищення реалізму та точності руху є критично важливим для розробників симуляторів робототехніки, комплексів для навчання автономного водіння або комп'ютерної анімації.

Чому існуючі методи є недостатніми

Сучасні керовані генератори відео покладаються на два типи вхідних даних. Текстові підказки (промпти) дають розпливчастий опис, але не можуть точно визначити траєкторію об'єкта. Інструменти траєкторій змушують користувачів малювати шлях на піксельному рівні для кожного об'єкта, що стає неможливим, коли в сценах є кілька взаємодіючих сутностей або перекриття (окклюзії). У результаті інженери витрачають на виправлення помилок у траєкторіях набагато більше часу, ніж на створення задуманого руху.

Підхід GraphVid на основі графів взаємодії

GraphVid замінює малювані вручну шляхи графом взаємодії високого рівня. Замість того, щоб описувати кожен піксель, користувач визначає взаємозв'язки: «об'єкт А наближається до об'єкта Б», «об'єкт С слідує за об'єктом D», «об'єкт E стикається з об'єктом F». Модель сприймає граф як креслення і перетворює реляційні підказки на узгоджений рух та зовнішній вигляд. Зосереджуючись на семантиці, а не на сирих координатах, вона відстежує об'єкти навіть тоді, коли вони зникають за іншими.

Команда створила спеціальний навчальний набір даних GraphVid-Bench, який поєднує відеокліпи зі структурованими реляційними даними. Цей набір даних показує моделі, як кілька об'єктів рухаються разом за різних сценаріїв взаємодії, надаючи їй «словник рухів», який вона може комбінувати під час інференсу.

Приріст продуктивності

Метрика Попередні моделі GraphVid
Fréchet Inception Distance (FID) ↓ 39,9 %
Fréchet Video Distance (FVD) ↓ 37,6 %
Peak Signal-to-Noise Ratio (PSNR) 9,87 15,98
Structural Similarity Index (SSIM) 0,38 0,61

Нижчі показники FID та FVD означають, що згенеровані відео виглядають реалістичніше, а рух між кадрами стає плавнішим. Зростання PSNR та SSIM свідчить про чіткіші текстури та краще збереження структури. У сукупності ці цифри демонструють, що GraphVid створює відео, які помітно ближчі до реальних зйомок.

Ефективність та практичний вплив

GraphVid досягає таких результатів, використовуючи менше параметрів і менше навчальних даних, ніж попередні підходи. Модель оперує структурою сцени, а не просто зазубрює динаміку на піксельному рівні. Для інженерів ШІ робочий процес змінюється: від кропіткого малювання шляхів до проектування реляційних даних — це зміна, яка природним чином масштабується зі збільшенням кількості об'єктів.

Потенційні вигодонабувачі включають:

  • Робототехніка — Симуляційні середовища тепер можуть відображати реалістичну взаємодію об'єктів без ручного написання скриптів траєкторій.
  • Автономне водіння — Сценарії дорожнього руху з багатьма автомобілями, пішоходами та велосипедистами можна генерувати на основі правил взаємодії високого рівня, що прискорює процеси розширення даних.
  • Анімація — Художники можуть зосередитися на наративних взаємозв'язках, тоді як система бере на себе фізику руху.

Підсумок: Розглядаючи взаємозв'язки між об'єктами як основний сигнал керування, GraphVid робить генерацію відео інтуїтивно зрозумілішою для творців і точнішою щодо реального руху, визначаючи новий напрямок для керованого синтезу.