물리적 AI의 최전선이 거대한 병목 현상에 직면했습니다. 바로 고충실도의 실제 세계 훈련 데이터가 부족하다는 점입니다. 거대 언어 모델(LLM)은 인터넷의 텍스트를 스크래핑하며 성장했지만, 로보틱스는 훨씬 더 많은 비용이 드는 접근 방식이 필요합니다.
로보틱스의 데이터 부족 문제
휴머노이드와 창고 로봇이 인간의 정교함을 따라잡으려면 현재 존재하지 않는 수준의 데이터 규모가 필요합니다. Encord의 로봇 학습 책임자이자 OpenAI 로봇 연구소 출신 베테랑인 Vineeth Velmurugan은 돌파구를 마련하려면 YouTube 전체 비디오 코퍼스의 약 5배에 달하는 데이터셋이 필요하다고 말합니다.
텍스트는 풍부하며 스크래핑 비용도 무료입니다. 하지만 물리적 데이터는 제조되어야 합니다. 비디오만으로 학습할 경우 복잡한 조작에 필요한 고충실도를 놓치는 경우가 많습니다. 따라서 업계는 모델 아키텍처를 미세 조정하는 것에서 벗어나, 고품질의 주석(annotated)이 달린 물리적 데이터를 제조하는 훨씬 더 어려운 문제를 해결하는 방향으로 전환했습니다.
비디오를 넘어: 뇌파와 근육 신호 활용
Encord와 같은 스타트업은 로봇에게 더 깊은 맥락을 제공하기 위해 새로운 데이터 모달리티(modality)를 테스트하고 있습니다. 독일의 신경과학 스타트업 Zander Labs와의 파일럿 프로젝트에서 Encord는 운영자에게 뇌파 헤드셋을 착용하게 합니다. 신경 활동을 측정함으로써 연구자들은 의도, 오류 및 놀라움을 추론할 수 있기를 기대합니다.
Zander의 신경과학자 Lucas Gehrke는 뇌 활동을 추적하면 모델 제작자가 로봇이 어려운 작업을 수행할 때 정확히 언제 가장 강력한 계산 모델을 가동해야 하는지 알 수 있다고 말합니다.
Encord는 또한 다음과 같은 기술을 탐구합니다:
- 근전도(Electromyography, EMG): 팔뚝에 부착된 센서가 근육의 전기 신호를 포착하여, 머리에 장착된 카메라가 놓치기 쉬운 손 움직임의 3D 지도를 생성합니다.
- 리더-팔로워 리그(Leader-Follower Rigs): 한쪽이 인간 운영자를 모방하는 쌍을 이룬 로봇 팔로, 액체를 붓거나 포커 칩을 쌓는 것과 같은 정밀한 동작을 포착합니다.
- 고밀도 어노테이션(Dense Annotation): "오른손이 볼트를 조임"과 같은 라벨입니다. Velmurugan은 이러한 고밀도 어노테이션이 특정 작업 훈련을 위해 가공되지 않은 1인칭 시점(ego) 비디오보다 100배 더 가치 있다고 추정합니다.
물리적 AI의 경제적 현실
디지털 우선 AI에서 물리적 AI로 전환하면 머신러닝의 경제 구조가 뒤바뀝니다. LLM 연구소는 웹에서 데이터를 가져옴으로써 거의 제로에 가까운 한계 비용으로 모델을 구축했습니다. 반면 로봇 훈련 데이터를 생산하려면 하드웨어, 인간 운영자 및 정교한 어노테이션이 필요합니다. Encord는 고품질 데이터의 비용 효율성을 전달 가치보다 20배 더 높이는 것을 목표로 하지만, 그럼에도 대규모 로봇 함대를 위한 프로젝트는 수백만 달러 규모가 됩니다.
방대하고 풍부하게 주석이 달린 데이터셋을 먼저 생성하는 기업이 이더넷 케이블을 꽂는 것부터 물건을 집고 포장하는 것에 이르기까지 자율 조작 분야를 지배하게 될 것입니다. 비디오 전용 파이프라인에만 매달리는 기업은 경쟁사들이 인간의 몸과 뇌에서 더 풍부한 신호를 수집함에 따라 뒤처질 위험이 있습니다.
핵심 요약
- 데이터 제조 vs. 수집: 물리적 AI는 기존 인터넷 데이터를 스크래핑하는 LLM과 달리, 고충실도 데이터셋을 비싸고 수동으로 제조해야 합니다.
- 신경학적 모달리티: 뇌파와 EMG를 추가하면 로봇이 비디오만 사용할 때보다 인간의 의도, 오류 및 3D 손 움직임을 더 효과적으로 파악할 수 있습니다.
- 규모의 도전: 로보틱스 모델은 YouTube 아카이브 전체보다 훨씬 더 큰 데이터셋이 필요하며, 이제 데이터 생성은 주요 비즈니스 최전선이 되었습니다.
Encord는 독일의 신경과학 스타트업 Zander Labs와 함께 파일럿 프로젝트를 시작했습니다. 이 프로젝트는 운영자에게 뇌파 헤드셋과 팔뚝 EMG 센서를 착용하게 하여 물리적 AI를 위한 고충실도 훈련 데이터를 포착합니다. 이 파트너십은 YouTube 비디오 전체 볼륨의 5배에 달하는 규모의 데이터셋을 생성하는 것을 목표로 합니다. 연구자들은 로봇이 인간 수준의 정교함에 도달하기 위해 이 정도 규모가 필요하며, 이것이 로보틱스의 학습 방식을 재편할 수 있다고 말합니다.
로보틱스 데이터가 병목 현상인 이유
거대 언어 모델은 공개된 웹을 스크래핑하며 성장했습니다. 원재료가 풍부하고 저렴했기 때문입니다. 반면 물리적 AI는 제조되어야 하는 데이터가 필요합니다. 모든 움켜쥐기, 비틀기 또는 붓기 동작은 기록되고, 주석이 달리고, 그 동작을 만들어낸 힘 및 의도와 연결되어야 합니다. 일반적인 비디오는 복잡한 조작에 필요한 미세한 신호를 놓치는 경우가 많아, 오늘날의 모델과 공장, 창고 및 가정의 요구 사항 사이에 간극을 남깁니다.
Encord의 로봇 학습 책임자이자 전 OpenAI 로봇 연구소 베테랑인 Vineeth Velmurugan은 YouTube 비디오 코퍼스의 약 5배 크기에 달하는 데이터셋이 존재하기 전까지는 이 분야가 앞으로 나아가지 못할 것이라고 말합니다. 문제는 더 이상 모델 아키텍처가 아니라, 데이터를 어떻게 **제조(manufacture)**하느냐 하는 것입니다.
뇌파 및 근육 신호 추가
Encord-Zander 파일럿은 시각적 기록에 생체 신호를 추가함으로써 그 간극을 메우고자 합니다. 작업자는 뇌의 전기적 활동인 뇌전도(EEG)를 읽는 헤드셋을 착용하고, 팔뚝의 EMG 센서는 근육의 충격을 포착합니다. 목표는 의도, 놀람 또는 오류와 같은 정신 상태를 추론하고, 가공되지 않은 근육 활동을 비디오만으로는 포착할 수 없는 손 동작의 3차원 지도로 변환하는 것입니다.
Zander의 신경과학자인 Lucas Gehrke는 인간이 어려운 하위 작업을 언제 예상하는지 아는 것이 로봇이 적절한 순간에 가장 강력한 계산 모델을 할당할 수 있게 해준다고 설명합니다.
신경 데이터 외에도 Encord는 몇 가지 보완적인 기술을 테스트하고 있습니다:
- 근전도(EMG): 팔뚝의 센서가 근육 활성도를 실시간으로 읽어내어, 머리 장착형 카메라가 놓치기 쉬운 손가락 궤적을 정밀하게 재구성할 수 있게 합니다.
- 리더-팔로워 리그(Leader-follower rigs): 한 쌍의 로봇 팔이 협력하여 작동하며, 하나는 인간 작업자의 동작을 그대로 따라 합니다. 이는 액체를 붓거나 칩을 쌓는 것과 같이 밀리미터 단위의 오차가 중요한 섬세한 작업을 포착합니다.
- 밀집 어노테이션(Dense annotation): Velmurugan의 팀은 상위 수준의 동작만 라벨링하는 대신, “오른손으로 볼트를 조임”과 같은 세밀한 기술어를 추가합니다. 그는 이러한 세부 정보가 가공되지 않은 1인칭 시점(ego-centric) 비디오보다 특정 조작 기술을 훈련하는 데 약 100배 더 가치 있다고 추정합니다.
데이터 제조의 경제학
피지컬 AI(Physical AI)는 머신러닝의 재무적 계산 방식을 변화시킵니다. LLM 연구소들은 인터넷이 무한한 텍스트를 제공하기 때문에 거의 제로에 가까운 한계 비용으로 모델을 구축했습니다. 그러나 로봇 훈련 데이터를 생산하려면 하드웨어, 인간 작업자 및 정교한 어노테이션이 필요합니다. Encord의 내부 목표는 고품질 데이터를 고객에게 전달하는 가치보다 20배 더 비용 효율적으로 만드는 것이지만, 이러한 공격적인 효율성조차 대규모 로봇 군단을 위한 프로젝트에서는 여전히 수백만 달러 규모에 해당합니다.
이해관계는 명확합니다. 방대하고 풍부하게 어노테이션된 데이터셋을 먼저 생성할 수 있는 기업이 데이터 센터 바닥에서 이더넷 케이블을 연결하든 물류 센터에서 품목을 피킹하고 포장하든, 자율 조작(autonomous manipulation)이라는 신흥 시장을 지배하게 될 것입니다. 비디오 전용 파이프라인에 계속 의존하는 기업은 경쟁사가 인간의 신체와 뇌에서 더 풍부한 신호를 추출함에 따라 뒤처질 위험이 있습니다.
반론 및 미결 과제
모든 사람이 신경 신호가 빠진 조각이라고 확신하는 것은 아닙니다. 비판론자들은 특히 비디오와 힘-토크(force-torque) 센서만으로도 많은 산업 작업에서 이미 준수한 성능을 내는 상황에서, 추가적인 하드웨어 복잡성이 이점보다 더 클 수 있다고 주장합니다. 확장성 또한 또 다른 우려 사항입니다. 수천 명의 작업자에게 EEG 헤드셋과 EMG 장비를 갖추게 하는 것은 소규모 제조업체에게는 감당하기 어려운 비용이 될 수 있습니다.
데이터 생성 파이프라인은 여전히 노동 집약적입니다. 리더-팔로워 리그를 사용하더라도 진정으로 범용적인 로봇에 필요한 광범위한 작업을 포착하려면 여러 연구소와 공장에 걸친 지속적이고 조율된 노력이 필요할 것입니다. 시장은 점진적인 성능 향상이 초기 투자 비용을 정당화할 수 있을지 결정해야 할 것입니다.
향후 주목할 점
- 데이터 규모의 이정표: 유튜브 크기의 5배에 달하는 데이터셋을 보유했다는 Encord의 주장은 구체적인 벤치마크가 될 것입니다. 데이터가 공개되면 다른 경쟁사들은 이를 따라잡거나 넘어서야 할 명확한 목표를 갖게 될 것입니다.
- 하드웨어 채택률: EEG 및 EMG 장치가 데이터 수집 리그의 표준으로 자리 잡는 속도는 이 접근 방식이 실험적 파일럿 단계를 넘어 확장될 수 있는지를 보여주는 지표가 될 것입니다.
- 비용 지표: Encord가 약속한 20배의 비용 우위를 입증할 수 있다면, 모델 설계보다는 '데이터 제조'에 집중하는 새로운 진입자들의 물결을 일으킬 수 있습니다.
- 성능 격차
