디지털 전용 AI의 시대가 진화하고 있습니다. 스타트업들이 소프트웨어 지능과 물리적 실행 사이의 간극을 메우기 위해 움직이고 있기 때문입니다. 전 Meta AI 연구원들이 설립한 새로운 벤처 기업 Perceptron은 기계가 현실 세계를 탐색하고 상호작용할 수 있도록 설계된 프런티어 비전 모델을 개발하며 이 흐름을 주도하고 있습니다.
이분법을 깨다: 범용 모델 vs. 특화 모델
수년 동안 산업 자동화는 기술적 교착 상태에 빠져 있었습니다. 개발자들은 모든 인스턴스마다 값비싼 전용 클라우드 GPU가 필요한 거대한 범용 파운데이션 모델을 선택하거나, 인지 또는 제어는 처리할 수 있지만 두 가지 모두를 수행할 능력은 부족한 좁고 특화된 모델 중 하나를 선택해야만 했습니다.
Meta의 Fundamental AI Research (FAIR) 부문 출신인 Perceptron의 공동 창립자 Armen Aghajanyan과 Akshat Shrivastava는 새로운 모델인 Isaac 0.5를 통해 이 문제를 해결하고자 합니다. 단일하고 반복적인 작업을 위해 설계된 기존 소프트웨어와 달리, Isaac 0.5는 범용 모델입니다. 이 모델은 로봇에게 "인지, 추론 및 행동(perceive, reason, and act)" 능력을 부여하여, 특정 동작에 맞춰 하드코딩되는 대신 다양한 환경에 적응할 수 있도록 합니다.
물리적 지능의 메커니즘
Perceptron의 접근 방식이 가진 복잡성을 이해하려면 패키지 분류와 같은 표준적인 창고 작업을 살펴보아야 합니다. 로봇은 단순히 "상자를 집어 드는 것"이 아닙니다. 먼저 라벨을 읽고, 주변 환경을 매핑하기 위한 공간 분석을 수행하며, 최적의 집기 순서를 결정하고, 물리적 궤적을 계획해야 합니다.
Isaac 0.5는 이러한 다단계 인지 프로세스를 관리하도록 설계되었습니다. 이 모델은 다양한 환경과 시나리오를 인식할 수 있도록 100만 시간의 일반 비디오 데이터를 학습하며 대규모로 훈련되었습니다. 물리적 숙련도를 마스터하기 위해, 이 회사는 "에고 비디오(ego video, 웨어러블 카메라를 통한 1인칭 시점)"와 UMI 비디오(반복적인 인간 행동 녹화본)를 활용하여 움직임이 어떻게 작업 완료로 이어지는지를 AI에게 가르쳤습니다. Shrivastava는 이러한 수준의 "알고리즘 연금술(algorithmic alchemy)"을 달성하기 위해 이미지, 텍스트, 비디오 및 로봇 궤적을 아우르는 페타바이트 규모의 데이터셋을 구축했다고 언급했습니다.
오픈 웨이트 전략 및 시장 확장
투명성과 개발자 채택을 장려하기 위한 조치로, Perceptron은 Isaac 0.5를 오픈 웨이트(open-weight) 모델로 공개합니다. 이를 통해 연구자와 엔지니어는 모델의 파라미터와 학습 자료를 검토할 수 있으며, 이는 예측 가능성이 무엇보다 중요한 고위험 산업 환경에 AI를 통합하는 데 있어 매우 중요한 단계입니다.
Bessemer Venture Partners가 주도한 2,100만 달러 규모의 펀딩 라운드를 지원받은 Perceptron은 다양한 분야를 위한 지능 계층(intelligence layer)으로 자리매김하고 있습니다. 주요 초점은 물류 및 제조에 맞춰져 있지만, 회사는 보안, 모빌리티, 심지어 미디어 및 엔터테인먼트 분야에서도 즉각적인 응용 가능성을 보고 있습니다. 유연한 지능 계층을 제공함으로써, Perceptron은 전 세계 산업 현장에서 시각 유도 로봇(vision-guided robots)이 작동하는 방식을 변화시키는 것을 목표로 합니다.
핵심 요약
- 간극 해소: Isaac 0.5는 범용적인 "인지, 추론 및 행동" 프레임워크를 제공함으로써, 리소스 집약적인 범용 모델과 제한적인 특화 모델 사이의 선택 문제를 해결하는 것을 목표로 합니다.
- 대규모 학습 규모: 이 모델은 에고-센트릭(ego-centric) 및 UMI 비디오를 포함한 100만 시간의 비디오 데이터를 활용하여 로봇에게 복잡한 공간 및 수동 작업을 가르칩니다.
- 오픈 웨이트 접근성: Isaac 0.5를 오픈 웨이트로 공개함으로써, Perceptron은 프런티어 비전 AI가 산업 워크플로우에 더 깊이 검토되고 빠르게 통합될 수 있도록 합니다.
Perceptron은 로봇에게 통합된 "인지-추론-행동" 두뇌를 제공할 것을 약속하는 오픈 웨이트 비전 모델인 Isaac 0.5를 공개했습니다. 이 스타트업은 Bessemer Venture Partners가 주도한 2,100만 달러의 투자를 유치했으며, 이 모델을 물류, 제조 및 기타 물리적 자동화 시장을 위한 즉시 적용 가능한 지능 계층으로 포지셔닝하고 있습니다.
이번 출시가 중요한 이유
산업용 로봇은 오랫동안 트레이드오프(trade-off) 상황에 놓여 있었습니다. 거대한 범용 파운데이션 모델을 배포하면 매번 클라우드 GPU에 접속하는 비용을 지불해야 하고, 좁고 작업 특화된 비전 시스템을 고수하면 환경이 변할 때 유연성을 잃게 됩니다. Isaac 0.5는 인스턴스별 클라우드 컴퓨팅 없이도 인지, 계획 및 제어를 처리할 수 있는 하나의 모델로서, 그 중간 지점을 공략하고 있습니다.
오늘날 로봇 두뇌의 문제점
일반적인 창고 로봇은 단순히 상자를 집어 올리는 것 이상의 일을 수행합니다. 라벨을 읽고, 어지럽게 놓인 물건들 사이에서 아이템의 위치를 파악하며, 최적의 피킹 순서를 결정하고, 충돌 없는 암(arm) 궤적을 실시간으로 계산해야 합니다. 기존 솔루션들은 대개 이러한 단계들을 별도의 소프트웨어 구성 요소로 나눕니다. 즉, 라벨을 위한 경량 탐지기, 동작을 위한 수동 설계된 플래너, 그리고 실행을 위한 규칙 기반 컨트롤러로 분리되어 있습니다. 이러한 분리는 통합 오버헤드를 발생시키며, 새로운 제품, 포장 스타일 또는 레이아웃이 등장했을 때 로봇의 적응 능력을 제한합니다.
Isaac 0.5가 격차를 줄이려는 방법
Meta FAIR 연구원 출신인 Perceptron의 공동 창립자 Armen Aghajanyan과 Akshat Shrivastava는 Isaac 0.5를 단일 엔드 투 엔드(end-to-end) 네트워크로 구축했습니다. 이 모델은 다양한 실내외 장면을 아우르는 약 100만 시간 분량의 일반 비디오 데이터로 학습되었습니다. 결정적으로, 학습 세트에는 웨어러블 카메라로 촬영한 1인칭 시점 영상인 “ego video”와 반복적인 인간의 행동을 기록한 “UMI video”가 포함되어 있습니다. Perceptron은 로봇 궤적 데이터와 결합된 시각적 스트림을 네트워크에 입력함으로써, 모델이 시각적 단서가 어떻게 물리적 동작으로 전환되는지를 학습한다고 주장합니다.
이 회사는 자사의 데이터셋이 페타바이트 규모의 이미지, 텍스트, 비디오 및 로봇 궤적을 아우른다고 밝히고 있습니다. 이러한 방대한 데이터는 Isaac 0.5가 별도의 제어 모듈 없이도 새로운 물체를 인식하고, 어포던스(affordance, 어떻게 잡을 수 있는지)를 추론하며, 동작 계획을 생성할 수 있는 능력을 갖추도록 설계되었습니다.
오픈 웨이트(Open-weight) 모델: 투명성과 실용성의 만남
API만 제공하는 대부분의 상용 AI 서비스와 달리, Perceptron은 Isaac 0.5를 오픈 웨이트 방식으로 출시합니다. 엔지니어들은 파라미터를 검토하거나, 자체 데이터를 사용하여 네트워크를 미세 조정(fine-tune)하거나, 모델을 엣지 하드웨어에 직접 임베딩할 수 있습니다.
