Qwen-Drive-1.0 kết hợp nhận thức, lập kế hoạch và ngôn ngữ vào một mô hình duy nhất, hứa hẹn mang đến cho các kỹ sư xe tự hành một hệ thống gọn nhẹ hơn mà không làm mất đi khả năng tuân theo các hướng dẫn bằng lời nói hoặc văn bản. Kiến trúc thống nhất này có thể cắt giảm sự phức tạp trong phát triển trong khi vẫn giúp xe có thể trả lời câu hỏi “tại sao bạn lại rẽ?” hoặc tuân lệnh “hãy đi vào lối ra tiếp theo”.

Tại sao một nền tảng thống nhất lại quan trọng

Hầu hết các phần mềm tự lái hiện nay là một tập hợp các mô-đun riêng biệt: một hệ thống thị giác phân tích dữ liệu camera và lidar, một bộ lập kế hoạch quyết định quỹ đạo, và một giao diện ngôn ngữ xử lý các lệnh hoặc giải thích của người dùng. Mỗi phần được huấn luyện một cách độc lập, vì vậy thành phần ngôn ngữ thường bị lệch khi các phần thị giác hoặc lập kế hoạch chiếm ưu thế trong hàm mất mát (loss). Kết quả là một phương tiện có thể điều hướng nhưng lại thất bại trong việc hiểu hoặc tạo ra ngôn ngữ tự nhiên một cách đáng tin cậy.

Qwen-Drive-1.0 giải quyết sự phân mảnh này bằng cách huấn luyện một khung xương (backbone) duy nhất cho ba tác vụ cùng một lúc—nhận thức 3D, trả lời câu hỏi dựa trên hình ảnh (VQA) và lập kế hoạch chuyển động. Bằng cách kết hợp các tập dữ liệu lái xe với các kho ngữ liệu ngôn ngữ-thị giác tổng quát, mô hình vẫn giữ được kiến thức ngôn ngữ trong khi học cách quan sát và hành động. “Nền tảng đa phương thức” này phản ánh xu hướng của các mô hình ngôn ngữ lớn vốn đóng vai trò là cơ sở cho nhiều ứng dụng hạ nguồn, nhưng nó bổ sung thêm khả năng suy luận không gian cần thiết để điều hướng an toàn.

Mô hình đã được đánh giá như thế nào

Các nhà nghiên cứu đã chạy mô hình qua cả các bài kiểm tra vòng lặp hở (open-loop) và vòng lặp kín (closed-loop). Trong các kịch bản vòng lặp hở, hệ thống xử lý các luồng cảm biến đã được ghi lại và đưa ra các dự đoán mà không ảnh hưởng đến môi trường; trong các thử nghiệm vòng lặp kín, nó thực sự điều khiển một phương tiện mô phỏng. Trong các thiết lập này, hiệu suất lập kế hoạch chuyển động của Qwen-Drive-1.0 tương đương với các mô hình chuyên dụng chỉ tập trung vào việc lái xe. Đồng thời, thành phần VQA của nó đã trả lời được các câu hỏi về bối cảnh, cho thấy khả năng ngôn ngữ vẫn được duy trì sau quá trình huấn luyện chung.

Những rào cản còn lại

Công trình hiện tại vẫn chưa đạt đến một bộ cảm biến đầy đủ. Các đầu vào lidar độ phân giải cao và dự đoán tầm xa—cả hai đều cực kỳ quan trọng khi lái xe trên đường cao tốc—đều vắng mặt trong tập huấn luyện. Khả năng nhận thức cũng dựa trên một bộ dữ liệu hạn chế, đặt ra câu hỏi về khả năng tổng quát hóa đối với các điều kiện thời tiết, ánh sáng và giao thông đa dạng. Cho đến khi mô hình chứng minh được khả năng trên các luồng cảm biến băng thông cao trong thế giới thực, các kỹ sư sẽ còn ngần ngại trong việc thay thế các quy trình đã được kiểm chứng.

Điều gì có thể thay đổi nếu phương pháp này được mở rộng

Nếu một nền tảng duy nhất có thể xử lý toàn bộ ngăn xếp nhận thức-lập kế hoạch-ngôn ngữ, các đội ngũ phát triển ô tô có thể loại bỏ sự điều phối phức tạp của các mô-đun riêng biệt. Điều đó sẽ giảm bớt nỗ lực tích hợp, cắt giảm độ trễ từ việc giao tiếp giữa các mô-đun và đơn giản hóa việc cập nhật: một khả năng ngôn ngữ mới có thể được thêm vào mà không cần huấn luyện lại bộ lập kế hoạch. Các bộ tiêu chuẩn đánh giá (benchmark) cho lái xe tự hành cũng sẽ cần phải phát triển, bổ sung các chỉ số tập trung vào ngôn ngữ bên cạnh các điểm số về an toàn và hiệu quả truyền thống.

Quan điểm ngược lại: sự chuyên biệt hóa vẫn có chỗ đứng

Các mô hình chuyên dụng vượt trội vì chúng có thể được tinh chỉnh trên dữ liệu khổng lồ và đặc thù của lĩnh vực. Một mô hình thống nhất có thể gặp khó khăn trong việc đạt được hiệu suất đỉnh cao tuyệt đối của một mạng nhận thức chỉ sử dụng lidar hoặc một bộ lập kế hoạch được huấn luyện trên hàng tỷ dặm nhật ký lái xe. Đối với các chức năng quan trọng về an toàn, các cơ quan quản lý và nhà sản xuất có thể sẽ tiếp tục yêu cầu các thành phần chuyên dụng và được xác thực chuyên sâu.

Điều cần theo dõi tiếp theo

Các phiên bản tương lai nên cho thấy liệu Qwen-Drive-1.0 có thể tiếp nhận lidar độ phân giải cao và thực hiện dự báo tầm xa hay không. Các thử nghiệm đường bộ trong thế giới thực, đặc biệt là trong các môi trường đô thị đa dạng, sẽ là bài kiểm tra thực tế cho phương pháp tiếp cận thống nhất này. Nếu các thử nghiệm đó thành công, ngành công nghiệp có thể chứng kiến một sự chuyển dịch hướng tới các nền tảng đa phương thức, nơi ngôn ngữ được coi là một thành phần quan trọng hàng đầu trong xe tự hành.