Gemini Omni от Google, доступная через новый интерфейс Google Vids, прошла практическое лабораторное тестирование, чтобы проверить, сможет ли ИИ сохранить стабильность одного и того же объекта (курьера) после трех последовательных видеоредактирований.

Почему этот тест важен

Инструменты генерации видео обещают, что любой желающий сможет менять фон, добавлять освещение или накладывать эффекты с помощью одной текстовой команды. Для создателя контента это обещание звучит просто: берете исходный клип, вводите «сделай так, чтобы ночью шел дождь» — и получаете готовый качественный ролик. Большинство пользователей не замечают скрытую цену «дрейфа» (drift) — постепенной потери внешности, позы или движений исходного объекта по мере того, как ИИ интерпретирует каждую новую инструкцию. Если лицо курьера слегка изменится после второго редактирования, финальный результат будет выглядеть непрофессионально и может потребовать дорогостоящей ручной доработки.

Эксперимент

Исходный клип — студийная съемка с неподвижной камеры: один человек в темно-синей ветровке, держащий в левой руке небольшую картонную коробку и делающий два шага в сторону камеры. Освещение было равномерным, фон — однотонным, а движение — простым.

Последовательность правок — три редактирования применялись одно за другим:

  1. Смена фона — замена студии на дождливую городскую улицу ночью.
  2. Корректировка освещения — добавление синего контурного света вокруг курьера и теплого свечения от витрины магазина.
  3. Слой атмосферы — добавление легких капель дождя и тонкой завесы пара.

Тест в режиме «прямого управления» (direct control) объединял все три инструкции в одном промпте, позволяя ИИ сгенерировать финальный клип за один проход.

Как оценивалась стабильность

Оценочный лист состоял из двенадцати критериев, сгруппированных по четырем темам:

  • Стабильность персонажа — лицо, волосы и одежда остаются идентичными.
  • Стабильность сцены — ракурс камеры и положение объекта остаются неизменными.
  • Точность редактирования — ИИ следует инструкции, не изменяя ничего лишнего.
  • Временное качество — отсутствие мерцания, искажений или дрожания во время движения.

Каждый клип оценивался на первом кадре, в середине двухшаговой походки и на финальном кадре. Система оценки выявила четкую закономерность.

Что говорят цифры

При последовательном наложении правок работа ИИ оценивалась по тому же оценочному листу. Контрольная группа с одним промптом получила аналогичную оценку.

Кто выигрывает, а кто проигрывает

Студии, которые могут позволить себе использовать один комплексный промпт, получают более плавный рабочий процесс. Разработчики систем генерации видео сталкиваются с серьезным инженерным препятствием — необходимостью поддерживать стабильное латентное представление объекта при последовательных преобразованиях.

Контраргумент

Some users argue incremental editing offers more creative control. By adjusting one element at a time, they can fine-tune each layer before moving on. The test shows that this flexibility costs visual fidelity. If a creator accepts minor subject changes for granular control, the current Gemini Omni workflow may still be viable.

За чем следить дальше

  • Усовершенствование моделей, которые будут фиксировать латентный код объекта в разных промптах.
  • Механизмы обратной связи, позволяющие авторам отмечать «дрейф» и запрашивать «перепривязку» (re-anchor) объекта.

Итог

Gemini Omni может создавать качественные многоэлементные видео, если подать полный набор инструкций сразу, но точность воспроизведения объекта снижается при последовательном наложении правок.