Google DeepMind анонсировала GenCeption — модель, которая превращает генератор видео по тексту в единую базовую модель для широкого спектра задач компьютерного зрения, используя всего 7500 синтетических видео. Суть проста: видеогенератор, который уже «знает», как объекты движутся и взаимодействуют, можно перепрофилировать для предсказания глубины, нормалей поверхностей, масок сегментации и 3D-позы без необходимости создания отдельной сети для каждой задачи.
От фрагментированных конвейеров зрения к единой модели
Большие языковые модели стали универсальными, научившись предсказывать следующее слово. Исследования в области компьютерного зрения, напротив, все еще полагаются на специализированные системы: одна для сегментации, другая для глубины, третья для определения позы. GenCeption избавляет от этой разрозненности. Текстовый запрос указывает модели, какой результат нужно выдать, и одна и та же архитектура с 14 миллиардами параметров выдает карты глубины, карты нормалей, маски сегментации или предсказания ключевых точек. Рассматривая каждый выходной результат как стандартное трехканальное RGB-изображение, система сохраняет единообразие конвейера; для задач, которые естественным образом не создают изображения, исследователи добавили небольшие обучаемые модули.
Обучение на крошечном синтетическом корпусе
Команда создала синтетический набор данных в Blender, отрендерив 7500 коротких видеороликов на основе 800 цифровых моделей людей, управляемых 200 последовательностями захвата движений. Традиционные модели генерации видео, такие как D4RT или VGGT Omega, обучаются на миллионах клипов; GenCeption достигает сопоставимой или лучшей производительности, потребляя от одной седьмой до одной пятисотой от такого объема данных. Заявленные бенчмарки включают:
- Оценку глубины на уровне специализированных моделей, таких как DepthAnything 3.
- Предсказание нормалей поверхностей, превосходящее NormalCrafter и Lotus-2.
- Распознавание 3D-позы, превосходящее Genmo и TRAM.
- Сегментацию с языковой подсказкой, сопоставимую по эффективности с комбинацией SAM 3 от Meta и Gemini 3.5 Flash.
Авторы утверждают, что генеративная задача заставляет сеть усваивать геометрию и физику сцены, что затем переносится на последующие задачи восприятия.
Архитектурные оптимизации для скорости
GenCeption базируется на открытой видеомодели Wan2.1 от Alibaba. Вместо привычного процесса диффузии, который уточняет кадры за множество итераций, исследователи переработали систему так, чтобы она выдавала предсказание за один прямой проход. Результат: модель обрабатывает 81-кадровый клип примерно за десять секунд на текущем оборудовании. Размер в 14 миллиардов параметров остается внушительным, но экономия на обучении и отказ от множества специализированных сетей обеспечивают существенный прирост эффективности.
Почему сообществу ИИ стоит обратить на это внимание
Если видеогенератор может служить одновременно «моделью мира» — представлением, которое фиксирует, как объекты занимают пространство и движутся во времени, — то следующий скачок в визуальном ИИ может произойти за счет масштабирования генеративных возможностей, а не за счет аннотирования всё более крупных наборов данных. Единая модель, управляемая промптами, могла бы упростить производственные конвейеры, сократить инженерные расходы и снизить порог входа для разработчиков, которым нужны функции компьютерного зрения, но не хватает ресурсов для обучения множества специализированных сетей.
Оговорки и нерешенные вопросы
Показатели производительности получены на синтетических данных и наборах бенчмарков, которые могут не отражать хаотичность реальных видеозаписей. Способность к обобщению в условиях неконтролируемого освещения, погоды или движения камеры остается недоказанной. Инференс в десять секунд для 81-кадрового клипа, хотя и быстрее итеративной диффузии, все еще далек от реального времени, необходимого для робототехники или AR. Более того, 14 миллиардов параметров модели требуют значительного вычислительного бюджета для развертывания, что может ограничить доступность технологии за пределами хорошо финансируемых лабораторий.
За чем следить дальше
- Валидация в реальном мире: исследования, тестирующие GenCeption на видео с дорог, съемках на мобильные телефоны или сценах промышленного контроля.
- Масштабирование модели: смогут ли более крупные или более эффективно обученные версии сократить задержку, сохранив при этом эффективность использования данных.
- Пути интеграции: как облачные провайдеры или edge-AI платформы смогут предоставить единый API, который принимает текстовое описание задачи и возвращает соответствующий визуальный результат.
- Альтернативные источники обучения: попытки смешать синтетические клипы с умеренным количеством реального видео для повышения устойчивости.
Итог
GenCeption демонстрирует, что видеогенеративная модель может одновременно выступать в роли мультизадачной базовой модели компьютерного зрения, обеспечивая передовые результаты в определении глубины, нормалей, поз и сегментации, обучаясь при этом на наборе данных, который на несколько порядков меньше, чем при традиционных подходах. Его потенциал заключается в объединении множества специализированных сетей в единую систему, управляемую промптами; следующим испытанием станет проверка того, выдержит ли этот потенциал переход из синтетических лабораторий в непредсказуемый реальный мир.
