Mô hình HyWorldVLA mới của BYD đã đạt 90,59 PDMS trên bộ tiêu chuẩn NAVSIM v1, một kỷ lục giúp gã khổng lồ xe điện Trung Quốc ghi dấu ấn trên bản đồ các mô hình nền tảng lái xe tự hành. PDMS đo lường khả năng lập kế hoạch lộ trình an toàn và hiệu quả của một hệ thống; điểm số càng cao đồng nghĩa với hành vi tự lái càng mượt mà và đáng tin cậy hơn.

Tại sao chỉ số này lại quan trọng

NAVSIM v1 là một bộ mô phỏng được sử dụng rộng rãi nhằm kiểm tra khả năng dự đoán và hành động của mô hình trong các tình huống giao thông phức tạp. Việc đạt được 90,59 PDMS đã vượt qua mọi con số được báo cáo trước đó, cho thấy HyWorldVLA có thể dự đoán các sự kiện trên đường với độ chính xác tương đương với các hệ thống giai đoạn đầu từ những tên tuổi lớn.

Kiến trúc tạo nên sự đột phá

HyWorldVLA kết hợp hai phương pháp vốn thường tách biệt:

  • Dự đoán cấp độ pixel (Pixel-level prediction) – mô hình duy trì một bản đồ thị giác chi tiết về môi trường xung quanh, bảo tồn các manh mối tinh vi như vạch kẻ đường và cử chỉ của người đi bộ.
  • Suy luận cấp độ tiềm ẩn (Latent-level reasoning) – nó nén cảnh quan thành một biểu diễn bậc cao hơn có thể được chiếu xa vào tương lai, cho phép lập kế hoạch dài hạn.

Các mô hình pixel thuần túy vượt trội về chi tiết nhưng đòi hỏi khả năng tính toán khổng lồ, khiến chúng không khả thi cho xe thương mại. Các mô hình tiềm ẩn (latent) thuần túy chạy nhanh hơn nhưng lại loại bỏ các sắc thái thị giác có thể ảnh hưởng đến sự an toàn. Thiết kế lai của BYD tuyên bố sẽ mang lại những gì tốt nhất của cả hai thế giới, cung cấp các dự đoán phong phú hơn mà không tốn kém chi phí phần cứng quá mức.

Hệ thống tuân theo mô hình Vision-Language-Action (VLA). Đầu tiên, nó "tưởng tượng" các khung hình tương lai (thị giác), sau đó chuyển đổi các khung hình đó thành các mô tả bằng văn bản hoặc ký hiệu (ngôn ngữ), và cuối cùng ánh xạ câu chuyện đó thành các lệnh điều khiển xe cụ thể (hành động). Trong thực tế, mô hình dự báo cách giao thông sẽ diễn biến và sử dụng dự báo đó để lái, tăng tốc hoặc phanh.

Những ai sẽ được hưởng lợi

BYD là nhà sản xuất xe điện lớn nhất thế giới. Việc tích hợp HyWorldVLA vào đội xe của mình sẽ giúp công ty tiếp cận với một lượng dữ liệu lái xe thực tế chưa từng có. Vòng lặp đó — huấn luyện trên dữ liệu đội xe, triển khai các mô hình đã cập nhật — có thể đẩy nhanh khả năng tự lái của BYD và thu hẹp khoảng cách với Tesla, Waymo và Huawei, những đơn vị vốn đã vận hành các đội xe tự hành lớn.

Những điều còn chưa chắc chắn

Báo cáo công khai không đề cập đến kích thước của mô hình và lượng dữ liệu huấn luyện được sử dụng, làm dấy lên những câu hỏi về khả năng mở rộng và chi phí. Mặc dù phương pháp tiếp cận lai hứa hẹn chi phí suy luận thấp hơn so với mô hình pixel thuần túy, nó vẫn làm tăng độ phức tạp so với thiết kế tiềm ẩn thuần túy. Các kỹ sư ô tô sẽ phải xác minh liệu những cải thiện về hiệu suất có xứng đáng với bất kỳ chi phí bổ sung nào về chip hay phần mềm hay không.

Những điều cần theo dõi tiếp theo

  • Triển khai sản xuất – BYD vẫn chưa công bố lộ trình tích hợp HyWorldVLA vào các dòng xe tiêu dùng hoặc thương mại. Một chương trình thí điểm tại một thị trường hạn chế sẽ là bước đi đầu tiên hợp lý.
  • Cập nhật bộ tiêu chuẩn – NAVSIM v1 có khả năng sẽ được thay thế bởi các bộ tiêu chuẩn mới hơn, tập trung vào các khía cạnh khác nhau của khả năng tự hành (ví dụ: thời tiết bất lợi, lái xe ban đêm). Hiệu suất của HyWorldVLA trong các bài kiểm tra đó sẽ cho thấy độ bền bỉ của nó.
  • Phản ứng cạnh tranh – Nếu điểm số của BYD chuyển hóa thành độ tin cậy trên đường thực tế, các đối thủ có thể đẩy nhanh nghiên cứu mô hình lai của riêng họ để tránh bị tụt hậu.

Điểm mấu chốt là: Điểm số kỷ lục của BYD cho thấy một mô hình vision-language-action lai giữa pixel và latent có thể mang lại chất lượng lập kế hoạch vốn trước đây chỉ dành cho các phòng thí nghiệm AI chuyên dụng. Liệu lợi thế đó có tồn tại được khi chuyển từ môi trường mô phỏng sang đường phố thực tế hay không sẽ quyết định liệu BYD có thực sự tái định hình lĩnh vực lái xe tự hành hay không.