Qwen-Drive-1.0은 인지, 계획, 언어를 단일 모델로 결합하여, 자율주행 차량 엔지니어들에게 음성이나 텍스트 명령을 따르는 능력을 희생하지 않으면서도 더 깔끔한 스택을 제공할 것을 약속합니다. 이 통합 아키텍처는 자동차가 "왜 회전했어?"라는 질문에 답하거나 "다음 출구로 나가"라는 명령을 수행할 수 있는 능력을 유지하면서도 개발 복잡성을 줄일 수 있습니다.
통합 파운데이션이 중요한 이유
오늘날 대부분의 자율주행 소프트웨어는 별개의 모듈들이 모인 콜라주 형태입니다. 카메라와 라이다 데이터를 분석하는 비전 시스템, 경로를 결정하는 플래너, 그리고 사용자 명령이나 설명을 처리하는 언어 인터페이스가 그것입니다. 각 구성 요소는 개별적으로 학습되기 때문에, 비전이나 계획 부분이 손실(loss) 함수를 지배하게 되면 언어 구성 요소가 종종 흐려지는 현상이 발생합니다. 그 결과, 주행은 가능하지만 자연어를 안정적으로 이해하거나 생성하지 못하는 차량이 만들어집니다.
Qwen-Drive-1.0은 3D 인지, 시각적 질의응답(VQA), 모션 플래닝이라는 세 가지 작업을 동시에 단일 백본(backbone)으로 학습시켜 이러한 파편화 문제를 해결합니다. 주행 데이터셋을 일반적인 비전-언어 코퍼스와 혼합함으로써, 이 모델은 시각 및 행동 학습을 수행하면서도 언어적 지식을 유지합니다. 이러한 "멀티모달 파운데이션"은 많은 다운스트림 애플리케이션의 기반이 되는 대규모 언어 모델(LLM)의 트렌드를 반영하면서도, 안전한 주행에 필요한 공간 추론 능력을 추가했습니다.
모델 평가 방법
연구진은 오픈 루프(open-loop)와 클로즈드 루프(closed-loop) 테스트를 모두 수행했습니다. 오픈 루프 시나리오에서 시스템은 기록된 센서 스트림을 처리하고 환경에 영향을 주지 않은 채 예측값을 생성했습니다. 반면 클로즈드 루프 실험에서는 실제로 시뮬레이션된 차량을 제어했습니다. 이러한 설정 전반에서 Qwen-Drive-1.0의 모션 플래닝 성능은 주행에만 집중하는 전문 모델과 대등한 수준을 보였습니다. 동시에 VQA 구성 요소는 장면(scene)에 대한 질의에 답변함으로써, 통합 학습 후에도 언어 능력이 유지됨을 입증했습니다.
남은 과제
현재의 연구는 완전한 센서 스위트를 갖추기에는 아직 부족합니다. 고해상도 라이다 입력과 장거리 예측은 고속도로 주행에 필수적이지만, 현재 학습 세트에는 포함되어 있지 않습니다. 또한 인지 기능이 제한된 데이터셋 컬렉션에 의존하고 있어, 다양한 날씨, 조명 및 교통 상황에 대한 일반화 가능성에 의문이 제기됩니다. 모델이 실제 환경의 고대역폭 센서 스트림에서 성능을 입증하기 전까지, 엔지니어들은 검증된 기존 파이프라인을 교체하기를 주저할 것입니다.
이 접근 방식이 확장될 경우 변화할 점
만약 단일 파운데이션이 인지-계획-언어 스택 전체를 처리할 수 있다면, 자동차 개발 팀은 복잡하게 얽힌 개별 모듈의 오케스트레이션을 버릴 수 있습니다. 이는 통합 노력을 줄이고, 모듈 간 통신으로 인한 지연 시간을 단축하며, 업데이트를 단순화할 것입니다. 예를 들어, 플래너를 재학습시키지 않고도 새로운 언어 기능을 추가할 수 있습니다. 자율주행을 위한 벤치마크 세트 또한 기존의 안전 및 효율성 점수와 더불어 언어 중심의 지표를 추가하는 방향으로 진화해야 할 것입니다.
반론: 전문화된 모델의 역할은 여전히 존재한다
전문 모델은 방대한 도메인 특화 데이터로 미세 조정(fine-tuning)할 수 있기 때문에 뛰어난 성능을 발휘합니다. 통합 모델은 라이다 전용 인지 네트워크나 수십억 마일의 주행 로그로 학습된 플래너의 절대적인 최고 성능을 따라잡는 데 어려움을 겪을 수 있습니다. 안전이 직결된 기능의 경우, 규제 기관과 제조업체는 계속해서 별도로 검증된 전용 구성 요소를 요구할 수도 있습니다.
향후 주목해야 할 점
향후 출시될 버전에서는 Qwen-Drive-1.0이 고해상도 라이다를 수용하고 장기 예측(long-horizon forecasting)을 수행할 수 있는지 여부가 밝혀져야 합니다. 특히 다양한 도시 환경에서의 실제 도로 테스트는 이 통합 접근 방식의 진정한 시험대가 될 것입니다. 만약 이러한 테스트가 성공한다면, 업계는 언어를 자율주행 차량의 핵심 요소로 취급하는 멀티모달 파운데이션으로의 전환을 맞이하게 될 것입니다.
