RT-2 của Google DeepMind, OpenVLA của Stanford-Toyota, GR00T của NVIDIA, LeRobot của Hugging Face và Pi-Zero của Physical Intelligence mang lại cho robot khả năng liên kết đầu vào hình ảnh, lệnh ngôn ngữ và các hành động cơ học trong một mô hình duy nhất. Khả năng đó thay thế các chuỗi bước được lập trình thủ công bằng hành vi "nhìn và làm" (see-and-do), hứa hẹn giúp phát triển nhanh hơn và tiếp cận rộng rãi hơn với lĩnh vực robot.

Tại sao mô hình thị giác-ngôn ngữ-hành động lại quan trọng

Trong phần lớn lịch sử ngành robot, các kỹ sư thường viết các kịch bản rõ ràng để chỉ dẫn cho robot từng chuyển động khớp một. Thế hệ mô hình Thị giác-Ngôn ngữ-Hành động (VLA) mới coi robot như một tác nhân hội thoại: camera truyền hình ảnh, người dùng nói hoặc nhập yêu cầu, và mô hình sẽ đưa ra các lệnh điều khiển động cơ cần thiết để thực hiện yêu cầu đó.

Năm mô hình tiêu biểu hiện nay

  • RT-2 (Google DeepMind) – Kết nối các luồng hình ảnh thô với ngôn ngữ con người, cho phép robot mô tả những gì nó thấy và hành động theo các hướng dẫn bằng lời nói.
  • OpenVLA (Stanford + Toyota) – Một bản phát hành mã nguồn mở cho phép bất kỳ nhà phát triển nào cũng có thể tích hợp mô hình vào phần cứng riêng của họ.
  • GR00T (NVIDIA) – Được xây dựng cho các nền tảng robot hình người, mô hình này có khả năng suy luận về bối cảnh và tạo ra các lệnh điều khiển động cơ cấp thấp.
  • LeRobot (Hugging Face) – Cung cấp kho lưu trữ dữ liệu và bộ công cụ giúp đẩy nhanh quá trình huấn luyện và tích hợp mô hình cho các nhà phát triển robot.
  • Pi-Zero (Physical Intelligence) – Cho rằng một "bộ não" duy nhất có thể được tái sử dụng trên các thân robot khác nhau, giúp đơn giản hóa các ngăn xếp phần mềm cho các loại phần cứng đa dạng.

Dữ liệu, mô phỏng và vấn đề sai lệch (drift)

Cả năm mô hình đều dựa vào các tập dữ liệu khổng lồ, hầu hết trong số đó đến từ môi trường mô phỏng vì việc thu thập trong thế giới thực rất tốn kém và rủi ro. Sự phụ thuộc này tạo ra sự sai lệch "sim-to-real": các hành vi được học trong thế giới ảo hoàn hảo có thể gặp trục trặc khi đối mặt với cảm biến bị nhiễu, ánh sáng không đều hoặc các chướng ngại vật bất ngờ.