Xiaomi-Robotics-1, 로봇 공학에서 모델 크기보다 데이터 양이 더 중요하다는 것을 입증하다

Xiaomi는 로봇 학습의 패러다임을 연산 능력(compute power) 증대에서 대규모 데이터 스케일링으로 전환하는 획기적인 파운데이션 모델인 Xiaomi-Robotics-1을 공개했습니다. 독특한 데이터 수집 방식을 활용함으로써, 이 모델은 생소한 환경과 복잡한 조작 작업에서 전례 없는 적응력을 보여줍니다.

핸드헬드 그리퍼를 통한 데이터 병목 현상 해결

로봇 공학의 주요 과제는 항상 "데이터 병목 현상"이었습니다. 즉, 비싸고 고정된 로봇 팔 없이 방대한 양의 고품질 상호작용 데이터를 수집하는 것이 매우 어려웠다는 점입니다. Xiaomi는 카메라가 장착된 휴대용 핸드헬드 그리퍼를 활용하여 이 문제를 우회했습니다.

로봇을 직접 프로그래밍하는 대신, 작업자가 이 핸드헬드 장치를 사용하여 주방, 사무실, 공장 등 1,700개 이상의 다양한 환경에서 조작 작업을 기록했습니다. 이 접근 방식을 통해 무려 100,000시간에 달하는 동작 녹화 데이터를 확보했습니다. 라벨링 문제를 해결하기 위해 Xiaomi는 AI 모델을 도입하여 각 동작 세그먼트에 대한 텍스트 설명을 자동으로 생성했으며, 단 2주 만에 전체 데이터셋의 라벨링을 완료했습니다.

스케일링 법칙: 연산보다 데이터

Xiaomi-Robotics-1 연구의 핵심 기술적 통찰은 단순히 모델 크기나 연산량을 늘리는 것보다 더 많은 학습 데이터를 제공하는 것이 훨씬 더 높은 성능 향상을 가져온다는 점입니다. 모델이 커지면 예측 오류가 줄어들기는 하지만, 학습 데이터의 양이 증가함에 따라 생소한 환경에서 로봇의 성공률은 25%에서 75%로 급증했습니다.

이는 파라미터 수를 늘리는 것보다 데이터를 추가하는 것이 더 큰 가치를 제공하는 컴퓨터 비전 분야의 트렌드와 일맥상통합니다. Xiaomi에게 이는 범용 로봇 AI(General Purpose Robot AI)로 가는 길이 단순히 더 큰 신경망을 구축하는 것이 아니라, 데이터셋의 다양성과 규모에 달려 있음을 의미합니다.

독보적인 적응력과 벤치마크 성능

Xiaomi-Robotics-1은 음성 또는 서면 명령을 따르고 최소한의 미세 조정(fine-tuning)만으로 새로운 작업에 적응하도록 설계되었습니다. 테스트에서 이 모델은 세탁물 넣기, 프린터에 종이 넣기, 여행 가방 싸기 등 복잡한 동작 과제를 수행했습니다.

결과는 결정적이었습니다:

  • 신속한 적응: 10시간 미만의 작업 특화 학습만으로 모델은 75%의 성공률을 달성했으며, 이는 단 40%에 그친 경쟁사 Physical Intelligence를 크게 앞지른 수치입니다.
  • 벤치마크 압도: 이 모델은 특히 학습되지 않은 복합 작업에서 RoboCasa365 리더보드를 큰 차이로 선두하고 있습니다.
  • RoboDojo 성능: Xiaomi-Robotics-1은 RoboDojo 벤치마크에서 2위 모델보다 약 58% 높은 점수를 기록했습니다.

또한 이 모델은 기존의 강체(rigid) 로봇 시스템이 다루기 어려워했던 종이와 같이 부드럽고 변형 가능한 재질을 다루는 데 탁월한 능력을 보여주었습니다.

로봇 산업의 새로운 방향

Xiaomi의 접근 방식은 다른 업계 거물들과는 다른 길을 걷고 있습니다. Nvidia가 합성 데이터 생성을 통해 로봇 데이터 문제를 연산 문제로 전환하려 하고, BAAI의 Orca 모델이 라벨링되지 않은 비디오로부터 학습을 시도하는 반면, Xiaomi는 자동화된 대규모 라벨링 동작 데이터에 집중하고 있습니다.

Xiaomi가 GitHub와 Hugging Face에 모델과 코드를 공개할 준비를 함에 따라 업계의 이목이 집중되고 있습니다. 이러한 발전은 로봇 공학의 다음 개척지가 가장 강력한 칩을 가진 이들이 아니라, 가장 다양하고 잘 라벨링된 동작 데이터셋을 가진 이들에 의해 결정될 것임을 시사합니다.

핵심 요약

  • 데이터 중심 스케일링: 학습 데이터 양을 늘리는 것이 모델 크기나 연산량을 늘리는 것보다 로봇의 성공률 향상에 더 효과적임이 입증되었습니다.
  • 혁신적인 수집 방식: 핸드헬드 그리퍼를 통해 전용 로봇 없이도 1,700개 환경에서 100,000시간의 동작 데이터를 축적할 수 있었습니다.
  • 높은 일반화 능력: 이 모델은 10시간 미만의 추가 학습만으로도 새로운 작업에서 75%의 성공률을 달성할 수 있습니다.