제목: Latent Identity Tuning을 통한 정밀한 얼굴 편집 가능
연구진이 Latent-Identity Tuning을 선보였습니다. 이 기술은 개발자가 피사체의 정체성을 그대로 유지하면서 텍스트-이미지 생성기(text-to-image generators) 내의 얼굴 특징을 편집할 수 있게 해주며, 별도의 추가 학습 없이도 작동합니다.
대부분의 확산 기반(diffusion-based) 텍스트-이미지 모델은 눈썹 모양을 바꾸거나, 코의 위치를 옮기거나, 눈 색깔을 변경하는 등 세부 사항을 수정하라는 요청을 받으면 인물의 닮은꼴(likeness)을 흐릿하게 만들거나 변형시킵니다. 이러한 문제는 모델이 얼굴을 밀집된 잠재 변수(latent variables) 세트로 인코딩하는 방식에서 비롯됩니다. 잠재 변수 중 하나만 건드려도 그 영향이 이미지 전체로 퍼져나가 정체성이 깨지는 경향이 있습니다.
LIT는 기존 모델의 동결된 인코더(frozen encoder)를 빌려와 잠재 공간(latent space)을 탐색함으로써 개별적인 얼굴 속성에 해당하는 방향을 찾아내어 이 문제를 우회합니다. 전체 네트워크를 재학습하거나 새로운 데이터를 입력하는 대신, 이 방법은 얼굴의 특정 부분을 제어하는 개별 잠재 토큰(latent tokens)을 분리합니다. 어떤 토큰은 눈썹 모양을 제어하고, 다른 토큰은 코의 구조를 제어할 수 있습니다. 개발자는 단일 토큰의 값만 조정함으로써 해당 특징을 미세하게 수정할 수 있으며, 이때 주변 토큰들이 나머지 초상화를 변함없이 유지해 줍니다.
이 접근 방식은 네 가지 실질적인 장점을 제공합니다:
- 정밀도 – 변경 사항이 대상 특징에만 국한되어 전체적인 외형을 보존합니다.
- 낮은 연산량 – 인코더가 동결되어 있어 새로운 학습 루프가 필요하지 않으므로 연산 부하가 최소화됩니다.
- 정체성 일관성 – 여러 이미지나 프롬프트에 걸쳐 동일 인물의 닮은꼴이 유지됩니다.
- 빠른 시장 출시 – 학습 과정을 생략함으로써 즉각적인 얼굴 조작이 필요한 애플리케이션의 개발 주기를 단축합니다.
즉각적인 혜택을 볼 수 있는 활용 사례로는 쇼핑객이 모델이 새로운 정체성을 만들어내지 않고도 자신의 얼굴에 안경이나 메이크업을 적용해 볼 수 있는 가상 피팅(virtual try-ons), 그리고 사용자가 표정, 나이, 눈 색깔 등을 실시간으로 미세 조정할 수 있는 아바타 생성 도구 등이 있습니다.
