비디오 이해(Video understanding)는 두 가지 어려운 질문을 동시에 던집니다. 프레임 안에 무엇이 있는가, 그리고 그것이 어디로 가는가? 컴퓨터 비전 시스템은 전통적으로 이 질문들에 하나씩 답해 왔습니다. 먼저 픽셀에서 객체를 분리해내는 세그멘테이션(segmentation)을 수행합니다. 그다음 시간의 흐름에 따라 해당 객체들을 연결하는 트래킹(tracking)을 수행합니다. 이러한 분리는 마찰을 일으킵니다. 첫 번째 단계의 오류가 두 번째 단계로 전이됩니다. 경계가 어긋나고, 정체성(identity)이 뒤바뀝니다. 사람이나 차량이 겹칠 때 전체 파이프라인이 멈춰버립니다.
멀티컷(multi-cut) 정식화(formulation)에 관한 최근 연구는 다른 길을 제시합니다. 두 모델을 사슬처럼 연결하는 대신, 세그멘테이션과 트래킹을 하나의 최적화 문제로 정의합니다. 그 결과 경계는 더 정교해지고, 정체성 전환은 줄어들며, 장면이 복잡해져도 파이프라인이 안정적으로 유지됩니다.
파이프라인의 문제점
대부분의 프로덕션 시스템은 탐지(detection)나 세그멘테이션을 먼저 실행한 다음, 그 출력을 트래킹 모듈로 전달합니다. 문제가 발생하는 지점은 바로 이 전달 과정입니다. 정지 영상으로 학습된 세그멘테이션 모델은 10번 프레임에서는 마스크가 약간 너무 크고, 11번 프레임에서는 약간 너무 작게 생성될 수 있습니다. 박스 중심점이나 임베딩 거리(embedding distance)만 살펴보는 트래커는 이 두 마스크가 동일한 객체에 속하는지 결정해야 합니다. 트래커는 경계가 잘못되었다고 세그멘터에게 되돌려 말할 방법이 없습니다. 두 시스템은 서로 소통하지 않습니다.
객체들이 상호작용할 때 이러한 분리는 큰 비용을 초래합니다. 보행자들이 서로 엇갈리며 지나가는 횡단보도나, 특정 부품을 잡기 위해 상자 더미 너머로 손을 뻗는 로봇 팔을 생각해 보십시오. 이런 순간에 전통적인 트래커들은 정체성을 유지하기 위해 모션 모델(motion models)이나 외형 특징(appearance features)에 의존합니다. 폐색(occlusion)이 몇 프레임 이상 지속되면 이러한 단서들은 무너집니다. 트래커는 동일한 객체에 대해 새로운 정체성을 만들어내거나, 다른 객체에 정체성을 잘못 부여합니다. 그동안 세그멘터는 레이블이 어긋났다는 사실을 전혀 모른 채 계속해서 마스크를 생성합니다. 이러한 어긋남을 바로잡으려면 과도한 후처리나 수동 어노테이션(manual annotation)이 필요한데, 이는 자동화의 목적을 퇴색시킵니다.
전통적인 모델들은 객체가 겹치는 바로 그 순간에 추적을 놓치는 경우가 많습니다. 이러한 오류는 무작위적인 것이 아니라 구조적인 문제입니다. 시간을 부차적인 요소로 취급하는 파이프라인은 연속성을 유지하는 데 어려움을 겪을 수밖에 없습니다.
멀티컷이 제공하는 가치
멀티컷 정식화는 세그멘테이션과 트래킹 사이의 벽을 허뭅니다. 단절된 마스크 시퀀스를 생성한 뒤 나중에 이를 이어 붙이는 대신, 이 방법은 시공간을 아우르는 그래프를 구축합니다. 모든 프레임의 모든 잠재적 객체 영역이 노드(node)가 됩니다. 에지(edge)는 단일 프레임 내에서뿐만 아니라 연속된 프레임 사이에서도 동일한 개체에 속할 수 있는 영역들을 연결합니다. 그런 다음 알고리즘은 해당 에지들을 자르는 최적의 방법을 찾아, 남은 연결 요소(connected components)들이 비디오를 통해 자연스럽게 움직이는 일관된 객체를 형성하도록 합니다.
결정이 전역적(global)이기 때문에, 15번 프레임에서의 경계 수정은 5번 프레임의 증거로부터 영향을 받을 수 있습니다. 두 사람이 경로를 교차할 때, 이 정식화는 속도에만 의존하여 추측할 필요가 없습니다. 외형, 모양, 움직임, 그리고 경계 일관성을 동시에 고려합니다. 마스크 품질과 트랙 품질이 동일한 목적 함수(objective) 아래에서 최적화됩니다. 솔버(solver)가 특정 정체성을 확정할 때, 이미 해당 픽셀들이 공간적으로 타당한지 확인을 마친 상태입니다. 이러한 결합(coupling) 덕분에 프레임워크는 파이프라인 방식에서는 무너졌을 폐색 상황에서도 복구할 수 있습니다.
시각적 데이터를 트래킹 로직에 직접 연결함으로써 피드백 루프가 완성됩니다. 세그멘테이션은 트래킹에 정보를 제공하고, 트래킹 제약 조건은 세그멘테이션을 정교하게 다듬습니다. 시스템이 더 이상 각 단계에서 고립된 채 추측하지 않기 때문에, 수동 수정이 줄어들고 더 정확한 결과를 얻을 수 있습니다.
실제 적용 사례
통합된 정식화의 이점은 단순히 이론에 그치지 않습니다. 이는 배포 과정에서 끊임없이 발생하는 세 가지 특정 영역에서 매우 중요합니다.
프레임 간 일관성. 스포츠 분석에서는 보폭이나 관절 각도와 같은 생체 역학적 지표를 신뢰성 있게 추출할 수 있도록 선수의 실루엣이 정밀하게 유지되어야 합니다. 세그멘테이션이 트래킹과 무관하게 흔들리면 결과적인 운동학(kinematics) 데이터에 노이즈가 발생합니다. 통합된 정식화는 선수의 윤곽을 전체 클립에 걸쳐 하나의 연속된 개체로 취급함으로써 이러한 흔들림을 제거합니다.
혼잡한 장면. 감시 및 인파 계수 애플리케이션은 사람들이 뭉쳐 있을 때 정확도가 떨어집니다. 개별 트래커는 종종 신원을 병합하거나 신체 사이의 틈에 유령 객체(phantom objects)를 생성하곤 합니다. 시각적 증거를 트래킹 로직에 직접 연결함으로써, multi-cut 방식은 혼잡한 장면에서도 객체의 신원을 더 잘 유지합니다. 바운딩 박스(bounding boxes)가 거의 완전히 겹치더라도 개별 객체는 명확하게 구분됩니다.
경계 무결성. 로보틱스에서 픽 앤 플레이스(pick-and-place) 시스템은 파지(grasp) 계획을 위해 정확한 객체 윤곽이 필요합니다. 시간적 맥락(temporal context)을 무시하는 세그멘테이션 모델은 배경의 일부를 포함하거나 물체의 모서리를 잘라낼 수 있습니다. 세그멘테이션과 트래킹이 단일 목적을 공유하면, 모델은 경계가 시간적으로 안정적이어야 한다는 것을 학습합니다. 그 결과 생성된 마스크는 실제 가장자리에 더 깔끔하게 맞물리며, 이는 파지 실패를 줄이고 보수적인 안전 마진의 필요성을 낮춰줍니다.
더 나은 파이프라인 구축하기
비디오 분석이나 로보틱스 분야에서 일하는 엔지니어에게 이러한 변화는 시스템 아키텍처 설계 방식에 구체적인 시사점을 제공합니다.
탐지(detection), 세그멘테이션(segmentation), 트래킹(tracking)을 컨베이어 벨트를 통해 텐서(tensor)를 전달하는 세 개의 별개 마이크로서비스로 생각하는 것을 멈추십시오. 대신 공동의 목적(joint objective)을 드러내는 프레임워크를 찾으십시오. 커스텀 파이프라인을 구축 중이라면, 그래프 구조가 동일한 손실 함수(loss) 내에서 공간적 유사성(spatial affinity)과 시간적 연속성(temporal continuity)을 모두 인코딩할 수 있는지 고려해 보십시오. 직접 전체 multi-cut 솔버(solver)를 구현하지 않더라도 이 원칙은 여전히 적용됩니다. 시간 경과에 따른 외형(appearance)을 프레임별 마스크의 품질과 다시 연결하는 제약 조건을 추가하십시오.
오클루전(occlusion) 상황에서 공격적으로 테스트하십시오. 단순한 패턴으로 움직이는 고립된 객체들이 담긴 데모 영상으로는 파이프라인 방식의 약점을 드러낼 수 없습니다. 타겟이 겹치거나, 오클루전 도중에 조명이 변하거나, 객체가 화면 밖에서 다시 들어오는 시퀀스를 수집하십시오. 이러한 순간들이 단순히 이어 붙인 파이프라인과 진정으로 통합된 파이프라인을 구분 짓는 지점입니다.
어노테이션(annotation) 전략을 신중하게 준비하십시오. 결합 모델은 순수 세그멘테이션 또는 순수 트래킹 데이터셋과는 다른 그라운드 트루스(ground truth) 구조를 필요로 하는 경우가 많습니다. 이미지당 픽셀 클래스뿐만 아니라 프레임 전반에 걸쳐 인스턴스 신원을 일관되게 라벨링해야 할 수도 있습니다. 초기에 이러한 라벨링에 투자하면 나중에 배포 과정에서의 수동 수정 작업을 줄임으로써 보상을 받을 수 있습니다.
핵심 요약
컴퓨팅 자원과 모델 용량이 부족했을 때는 세그멘테이션과 트래킹을 독립적인 작업으로 취급하는 것이 타당했습니다. 하지만 이제는 그렇지 않습니다. multi-cut 정식화(formulation)는 이 두 작업이 사실상 하나, 즉 시간이 지나도 지속되는 일관된 객체를 찾는 작업임을 보여줍니다. 이 두 작업을 함께 해결함으로써, 움직임을 반영하는 마스크와 형태를 반영하는 트랙을 얻을 수 있습니다. 그 결과, 프레임 간 오류를 줄이고 움직이는 객체 주변에 더 깔끔한 경계를 생성하며, 오클루전과 혼잡이라는 복잡한 현실 속에서도 정확성을 유지하는 비디오 이해 파이프라인을 구축할 수 있습니다.
