Google DeepMind는 단 7,500개의 합성 비디오만을 사용하여 텍스트-비디오 생성기를 다양한 비전 작업을 위한 단일 파운데이션 모델로 변환하는 GenCeption을 발표했습니다. 주장은 간단합니다. 물체가 어떻게 움직이고 상호작용하는지 이미 알고 있는 비디오 생성기를 활용하면, 각 작업마다 별도의 네트워크를 구축할 필요 없이 깊이(depth), 표면 법선(surface normals), 세그멘테이션 마스크(segmentation masks) 및 3D 포즈(3D pose)를 예측하도록 재용도화할 수 있다는 것입니다.

파편화된 비전 파이프라인에서 통합 모델로

거대 언어 모델(LLM)은 다음 단어를 예측하는 법을 배우면서 다재다능해졌습니다. 반면 컴퓨터 비전 연구는 여전히 세그멘테이션용, 깊이용, 포즈용 등 각각의 전문 시스템을 개별적으로 다루고 있습니다. GenCeption은 이러한 짜깁기 방식을 건너뜁니다. 텍스트 프롬프트를 통해 모델에 어떤 출력을 생성할지 지시하면, 동일한 140억 개의 파라미터를 가진 아키텍처가 깊이 맵, 법선 맵, 세그멘테이션 마스크 또는 키포인트 예측을 수행합니다. 모든 출력을 표준 3채널 RGB 이미지로 취급함으로써 시스템의 파이프라인을 균일하게 유지하며, 자연스럽게 이미지를 생성하지 않는 작업의 경우 연구진이 소규모의 학습 가능한 모듈을 추가했습니다.

아주 작은 합성 코퍼스로 학습

연구팀은 Blender를 사용하여 합성 데이터셋을 구축했으며, 200개의 모션 캡처 시퀀스로 구동되는 800개의 디지털 휴먼 모델로부터 7,500개의 짧은 비디오를 렌더링했습니다. D4RT 또는 VGGT Omega와 같은 기존 비디오 생성 모델은 수백만 개의 클립으로 학습하지만, GenCeption은 그 데이터의 7분의 1에서 500분의 1 사이만을 소비하면서도 대등하거나 더 나은 성능을 달성합니다. 보고된 벤치마크 결과는 다음과 같습니다:

  • DepthAnything 3와 같은 전문 모델과 대등한 깊이 추정 성능.
  • NormalCrafter 및 Lotus-2를 능가하는 표면 법선 예측 성능.
  • Genmo 및 TRAM을 넘어서는 3D 포즈 인식 성능.
  • Meta의 SAM 3 및 Gemini 3.5 Flash의 결합된 강점에 필적하는 언어 가이드 세그멘테이션 성능.

저자들은 생성 목적(generative objective)이 네트워크로 하여금 장면의 기하학적 구조와 물리 법칙을 내재화하도록 강제하며, 이것이 다운스트림 인지 작업으로 전이된다고 설명합니다.

속도를 위한 아키텍처적 지름길

GenCeption은 Alibaba의 오픈 소스 Wan2.1 비디오 모델을 기반으로 구축되었습니다. 여러 번의 반복을 통해 프레임을 정교화하는 일반적인 확산(diffusion) 프로세스 대신, 연구진은 단 한 번의 순전파(forward pass)로 예측값을 출력하도록 시스템을 재설계했습니다. 그 결과, 모델은 현재 하드웨어에서 약 10초 만에 81프레임 클립을 처리합니다. 140억 개의 파라미터 규모는 여전히 크지만, 학습 비용 절감과 다수의 작업별 네트워크 제거를 통해 상당한 효율성 이득을 얻었습니다.

AI 커뮤니티가 주목해야 하는 이유

비디오 생성기가 물체가 공간을 점유하고 시간에 따라 움직이는 방식을 포착하는 '월드 모델(world model)'의 역할을 겸할 수 있다면, 시각적 AI의 다음 도약은 점점 더 커지는 데이터셋을 주석 처리하는 것이 아니라 생성 능력을 확장하는 데서 올 수 있습니다. 프롬프트 기반의 단일 모델은 제품 파이프라인을 단순화하고, 엔지니어링 오버헤드를 줄이며, 비전 기능은 필요하지만 여러 전문 네트워크를 학습시킬 자원이 부족한 개발자들의 진입 장벽을 낮출 수 있습니다.

주의 사항 및 미해결 과제

성능 수치는 합성 데이터와 벤치마크 세트에서 도출된 것이므로, 실제 영상의 복잡하고 무질서한 환경을 반영하지 못할 수 있습니다. 통제되지 않은 조명, 날씨 또는 카메라 움직임에 대한 일반화 능력은 아직 검증되지 않았습니다. 81프레임 클립에 대한 10초의 추론 시간은 반복적인 확산 방식보다는 빠르지만, 로보틱스나 AR을 위한 실시간 수준에는 여전히 미치지 못합니다. 또한, 모델의 140억 개 파라미터는 배포 시 상당한 컴퓨팅 예산을 요구하며, 이는 자금력이 풍부한 연구실 이외의 접근성을 제한할 수 있습니다.

향후 주목할 점

  • 실세계 검증: 야외 주행 영상, 핸드헬드 휴대폰 영상 또는 산업용 검사 장면에서 GenCeption을 테스트하는 연구.
  • 모델 스케일링: 더 크거나 더 효율적으로 학습된 버전이 데이터 효율성을 유지하면서 지연 시간 격차를 줄일 수 있는지 여부.
  • 통합 경로: 클라우드 제공업체나 엣지 AI 플랫폼이 텍스트로 된 작업 설명을 입력받아 적절한 시각적 출력을 반환하는 단일 API를 어떻게 제공할 것인가.
  • 대안적 학습 소스: 견고성을 높이기 위해 합성 클립과 적은 양의 실제 비디오를 혼합하려는 시도.

시사점

GenCeption은 비디오 생성 엔진이 멀티태스크 비전 파운데이션 모델의 역할도 수행할 수 있음을 보여줍니다. 이 엔진은 전통적인 방식보다 수십 배 이상 작은 데이터셋을 학습하면서도 최첨단의 depth, normals, pose 및 segmentation 성능을 제공합니다. GenCeption의 가능성은 수많은 전문 네트워크를 하나의 프롬프트 기반 시스템으로 통합하는 데 있습니다. 이제 다음 시험대는 이러한 가능성이 합성 데이터 실험실을 넘어 예측 불가능한 실제 세계에서도 유효할지 여부입니다.