Google DeepMind의 RT-2, Stanford-Toyota의 OpenVLA, NVIDIA의 GR00T, Hugging Face의 LeRobot, 그리고 Physical Intelligence의 Pi-Zero는 시각적 입력, 언어 명령, 모터 동작을 단일 모델로 연결하는 능력을 로봇에게 부여합니다. 이러한 기능은 수동으로 코딩된 단계별 시퀀스를 "보고 수행하는(see-and-do)" 동작으로 대체하여, 더 빠른 개발과 로봇 공학에 대한 더 폭넓은 접근을 약속합니다.

시각-언어-행동(VLA)이 중요한 이유

로봇 공학의 역사 대부분 동안, 엔지니어들은 로봇의 각 관절 움직임을 지시하는 명시적인 스크립트를 작성했습니다. 새로운 범주의 시각-언어-행동(Vision-Language-Action, VLA) 모델은 로봇을 대화형 에이전트처럼 취급합니다. 카메라가 이미지를 스트리밍하고 사용자가 요청을 말하거나 입력하면, 모델은 이를 수행하는 데 필요한 모터 명령을 출력합니다.

주목받는 5가지 모델

  • RT-2 (Google DeepMind) – 가공되지 않은 시각 스트림을 인간의 언어와 연결하여, 로봇이 보고 있는 것을 설명하고 음성 지시에 따라 행동할 수 있게 합니다.
  • OpenVLA (Stanford + Toyota) – 어떤 개발자든 자신의 하드웨어에 모델을 연결할 수 있도록 하는 오픈 소스 출시 버전입니다.
  • GR00T (NVIDIA) – 휴머노이드 플랫폼을 위해 구축되었으며, 장면을 추론하고 저수준(low-level) 모터 명령을 생성합니다.
  • LeRobot (Hugging Face) – 로봇 개발자를 위한 모델 학습 및 통합 속도를 높여주는 데이터 저장소와 도구 세트를 제공합니다.
  • Pi-Zero (Physical Intelligence) – 단일 "두뇌"를 서로 다른 로봇 본체에 재사용할 수 있다고 주장하며, 다양한 하드웨어에 대한 소프트웨어 스택을 단순화합니다.

데이터, 시뮬레이션 및 드리프트 문제

다섯 모델 모두 방대한 데이터셋에 의존하며, 실제 환경에서의 데이터 수집은 비용이 많이 들고 위험하기 때문에 대부분 시뮬레이션 환경에서 가져옵니다. 이러한 의존성은 "sim-to-real" 드리프트(drift)를 유발합니다. 즉, 완벽한 가상 세계에서 학습된 동작이 노이즈가 있는 센서, 불균일한 조명 또는 예상치 못한 장애물에 직면했을 때 제대로 작동하지 않을 수 있습니다.