Google DeepMind анонсувала GenCeption — модель, яка перетворює генератор тексту у відео на єдину фундаментальну модель для широкого спектра завдань комп'ютерного зору, використовуючи лише 7 500 синтетичних відео. Твердження просте: відеогенератор, який уже знає, як об'єкти рухаються та взаємодіють, можна перепрофілювати для прогнозування глибини, нормалей поверхні, масок сегментації та 3D-пози, не створюючи окрему мережу для кожного завдання.

Від фрагментованих конвеєрів зору до уніфікованої моделі

Великі мовні моделі стали універсальними, навчившись передбачати наступне слово. Дослідження в галузі комп'ютерного зору, навпаки, все ще покладаються на спеціалізовані системи — одну для сегментації, іншу для глибини, ще одну для пози. GenCeption долає цю фрагментарність. Текстовий запит (промпт) вказує моделі, який результат потрібно видати, і та сама архітектура з 14 мільярдами параметрів забезпечує карти глибини, карти нормалей, маски сегментації або прогнозування ключових точок. Розглядаючи кожен вихід як стандартне триканальне RGB-зображення, система підтримує однорідність конвеєра; для завдань, які природним чином не створюють зображень, дослідники додали невеликі навчальні модулі.

Навчання на крихітному синтетичному корпусі

Команда створила синтетичний набір даних у Blender, відрендеривши 7 500 коротких відео на основі 800 цифрових моделей людей, керованих 200 послідовностями захоплення руху. Традиційні моделі генерації відео, такі як D4RT або VGGT Omega, навчаються на мільйонах кліпів; GenCeption досягає порівнянної або кращої продуктивності, споживаючи від 1/7 до 1/500 від такого обсягу даних. Повідомлені результати бенчмарків включають:

  • Оцінку глибини на рівні зі спеціалізованими моделями, такими як DepthAnything 3.
  • Прогнозування нормалей поверхні, що перевершує NormalCrafter та Lotus-2.
  • Розпізнавання 3D-пози, що випереджає Genmo та TRAM.
  • Сегментацію за текстовими підказками, що відповідає сукупній потужності Meta’s SAM 3 та Gemini 3.5 Flash.

Автори стверджують, що генеративна ціль змушує мережу засвоювати геометрію та фізику сцени, що потім переноситься на подальші завдання сприйняття.

Архітектурні рішення для прискорення

GenCeption базується на відкритій відеомоделі Wan2.1 від Alibaba. Замість звичного дифузійного процесу, який уточнює кадри протягом багатьох ітерацій, дослідники переробили систему так, щоб вона видавала прогноз за один прямий прохід. Результат: модель обробляє 81-кадровий кліп приблизно за десять секунд на сучасному обладнанні. Розмір у 14 мільярдів параметрів залишається великим, але економія на навчанні та відмова від кількох спеціалізованих мереж забезпечують суттєве підвищення ефективності.

Чому спільноті AI варто звернути на це увагу

Якщо відеогенератор може слугувати «моделлю світу» — представленням, яке фіксує, як об'єкти займають простір і рухаються з часом, — то наступний стрибок у візуальному ШІ може відбутися завдяки масштабуванню генеративних можливостей, а не анотуванню дедалі більших наборів даних. Єдина модель, керована промптами, могла б спростити конвеєри розробки продуктів, скоротити інженерні витрати та знизити поріг входу для розробників, яким потрібні функції зору, але бракує ресурсів для навчання кількох спеціалізованих мереж.

Застереження та невирішені питання

Показники продуктивності отримані на синтетичних даних і наборах бенчмарків, які можуть не відображати хаотичність реальних відеозаписів. Узагальнення на умови неконтрольованого освітлення, погоди або руху камери залишається недоведеним. Десятисекундний інференс для 81-кадрового кліпа, хоча він і швидший за ітераційну дифузію, все ще далекий від режиму реального часу для робототехніки чи AR. Крім того, 14 мільярдів параметрів моделі вимагають значного обчислювального бюджету для розгортання, що може обмежити доступність поза межами добре фінансованих лабораторій.

За чим спостерігати далі

  • Валідація в реальних умовах: дослідження, що тестують GenCeption на відео з відеореєстраторів автомобілів, зйомці на телефон або сценах промислового інспектування.
  • Масштабування моделі: чи зможуть більші або ефективніше навчені версії скоротити затримку, зберігаючи ефективність використання даних.
  • Шляхи інтеграції: як хмарні провайдери або платформи edge-AI можуть надати єдиний API, який приймає текстовий опис завдання і повертає відповідний візуальний результат.
  • Альтернативні джерела навчання: зусилля щодо поєднання синтетичних кліпів із помірною кількістю реального відео для підвищення стійкості.

Висновок

GenCeption демонструє, що відеогенеративний рушій може одночасно виконувати роль багатозадачної базової моделі зору, забезпечуючи передові результати у визначенні глибини, нормалей, пози та сегментації, навчаючись на наборі даних, що на кілька порядків менший за ті, що використовуються в традиційних підходах. Його потенціал полягає в об'єднанні цілого «зоопарку» спеціалізованих мереж в єдину систему, керовану промптами; наступним випробуванням стане те, чи витримає цей потенціал перехід від синтетичних лабораторій до непередбачуваного зовнішнього світу.