Google의 Gemini Omni는 새로운 Google Vids 인터페이스를 통해 접속할 수 있으며, 세 번의 연속적인 비디오 편집 후에도 단일 피사체(배달원)를 안정적으로 유지할 수 있는지 확인하기 위해 실습 실험실 테스트를 거쳤습니다.

이 테스트가 중요한 이유

생성형 비디오 도구는 텍스트 명령 하나만으로 누구나 배경을 바꾸고, 조명을 추가하거나 효과를 뿌릴 수 있다고 약속합니다. 크리에이터에게 이 약속은 간단합니다. 원본 클립으로 시작해 “밤에 비가 내리게 해줘”라고 입력하기만 하면 세련된 짧은 영상을 얻을 수 있다는 것입니다. 하지만 대부분의 사용자는 "드리프트(drift)"라는 숨겨진 비용을 보지 못합니다. 이는 AI가 새로운 명령을 해석할 때마다 원래 피사체의 외형, 포즈 또는 움직임이 점진적으로 손실되는 현상을 말합니다. 만약 두 번째 편집 후에 배달원의 얼굴이 미세하게 변한다면, 최종 결과물은 비전문적으로 보일 수 있으며 비용이 많이 드는 수동 보정 작업이 필요할 수도 있습니다.

실험 내용

기준 클립(Baseline clip) – 네이비색 바람막이를 입고 왼손에 작은 판지 상자를 든 한 사람이 카메라를 향해 두 걸음 걸어오는 정지 카메라 스튜디오 촬영본입니다. 조명은 균일했고, 배경은 단순했으며, 움직임도 간단했습니다.

편집 시퀀스 – 다음 세 가지 편집이 차례대로 적용되었습니다:

  1. 배경 교체 – 스튜디오를 비 내리는 밤의 도시 거리로 교체.
  2. 조명 조정 – 배달원 주변에 푸른색 림 라이트(rim light)를 추가하고 상점 창문에서 나오는 따뜻한 빛을 추가.
  3. 분위기 레이어 – 가벼운 빗방울과 얇은 증기 막을 추가.

"직접 제어(direct control)" 실행에서는 세 가지 명령을 하나의 프롬프트로 결합하여, AI가 한 번에 최종 클립을 생성하도록 했습니다.

일관성 측정 방식

점수표는 네 가지 테마로 그룹화된 12개의 기준을 바탕으로 구성되었습니다:

  • 캐릭터 안정성 – 얼굴, 머리카락, 의상이 동일하게 유지됨.
  • 장면 안정성 – 카메라 각도와 피사체의 위치가 고정됨.
  • 편집 정밀도 – AI가 다른 요소를 변경하지 않고 명령을 정확히 따름.
  • 시간적 품질 – 움직임 중에 깜빡임(flicker), 왜곡(warping) 또는 떨림(jitter)이 나타나지 않음.

각 클립은 첫 번째 프레임, 두 걸음 걷기의 중간 지점, 그리고 마지막 프레임에서 평가되었습니다. 점수 측정 결과 명확한 패턴이 나타났습니다.

수치가 말해주는 것

편집을 중첩하여 적용했을 때, AI는 점수표를 통해 평가되었습니다. 단일 프롬프트 제어 그룹도 동일한 평가를 받았습니다.

승자와 패자

단일하고 포괄적인 프롬프트를 사용할 수 있는 스튜디오는 더 매끄러운 워크플로우를 확보하게 됩니다. 반면, 생성형 비디오 시스템 개발자들은 명확한 엔지니어링 과제에 직면해 있습니다. 즉, 연속적인 변환 과정 전반에 걸쳐 피사체의 안정적인 잠재 표현(latent representation)을 유지해야 한다는 점입니다.

반론

일부 사용자들은 점진적인 편집이 더 많은 창의적 제어권을 제공한다고 주장합니다. 한 번에 하나의 요소만 조정함으로써, 다음 단계로 넘어가기 전에 각 레이어를 미세하게 조정할 수 있기 때문입니다. 하지만 이번 테스트는 이러한 유연성이 시각적 충실도(fidelity)를 희생시킨다는 것을 보여줍니다. 만약 크리에이터가 세밀한 제어를 위해 피사체의 미세한 변화를 수용한다면, 현재의 Gemini Omni 워크플로우는 여전히 유효할 수 있습니다.

향후 주목할 점

  • 프롬프트 간에 피사체의 잠재 코드(latent code)를 고정하는 모델 개선.
  • 크리에이터가 드리프트를 표시하고 피사체의 "재고정(re-anchor)"을 요청할 수 있는 사용자 피드백 루프.

핵심 요약

Gemini Omni는 완전한 명령 세트를 한 번에 입력받으면 세련된 다중 요소 비디오를 제작할 수 있지만, 편집을 중첩하여 적용할 경우 피사체의 충실도가 저하됩니다.