Fei-Fei Li và Yunzhu Li đã chia sẻ trong một podcast gần đây của a16z rằng World Labs đang triển khai một quy trình "real-to-sim-to-real", cho phép robot học các tác vụ không gian trong các bản sao kỹ thuật số (digital twins) có độ trung thực cao trước khi chúng thực sự chạm vào sàn nhà vật lý. Cách tiếp cận này giúp cắt giảm chi phí và rủi ro trong việc thu thập dữ liệu huấn luyện robot, một rào cản vốn đã khiến nhiều dự án tự động hóa bị mắc kẹt trong phòng thí nghiệm.

Tại sao robot cần nhiều hơn là ngôn ngữ

Các mô hình ngôn ngữ lớn có thể quét toàn bộ internet để lấy văn bản, nhưng một robot không thể chỉ đơn giản là xem video và sao chép những gì nó thấy. Để di chuyển qua một kho hàng hoặc dọn dẹp một phòng khách sạn, robot phải hiểu được hình học ba chiều, các đặc tính bề mặt và các quy luật vật lý của việc đẩy, nâng và xếp chồng. Đó là những thành phần của "trí tuệ không gian" (spatial intelligence), và chúng rất khó để thu thập ở quy mô lớn trong thế giới thực.

Nút thắt cổ chai về dữ liệu

Việc thu thập dữ liệu robot trong thế giới thực diễn ra chậm chạp, tốn kém và đôi khi nguy hiểm. Một sự cố nhỏ cũng có thể làm hỏng phần cứng, làm ngừng dây chuyền sản xuất hoặc thậm chí gây thương tích cho con người. Chính vì vậy, hầu hết các đội ngũ robot học đều dựa vào các bộ dữ liệu nhỏ được xây dựng thủ công, vốn không bao quát được sự đa dạng của các môi trường hàng ngày.

World Labs đã vượt qua nút thắt này bằng cách xây dựng các thế giới kỹ thuật số đồng nhất. Hệ thống SceniX của họ ánh xạ một không gian vật lý vào một môi trường mô phỏng giúp bảo toàn hình học (hình dạng của tường và các vật thể), diện mạo (kết cấu, màu sắc, ánh sáng) và vật lý (cách các vật thể di chuyển khi bị đẩy). Robot sẽ thực hành trong bản sao ảo đó, sau đó các chính sách (policies) tương tự sẽ được chuyển đổi ngược lại môi trường thực tế.

Các mô hình video là chưa đủ

Một số nhà nghiên cứu lập luận rằng các trình tạo video độ phân giải cao có thể thay thế cho mô phỏng vật lý. Những mô hình đó có thể tạo ra các khung hình hợp lý từ góc nhìn của robot, nhưng chúng thiếu tính vật lý nhất quán. Nếu một video mô phỏng cho thấy một chiếc cốc biến mất sau khi bị đẩy, một robot được huấn luyện trên đoạn phim đó sẽ học sai mối quan hệ nhân quả. Quy trình của World Labs nhấn mạnh vào các thế giới duy trì được sự mạch lạc theo thời gian, không gian và sự tương tác, đảm bảo rằng "trí nhớ cơ bắp" của robot khớp với vật lý của thế giới thực.

Nhắm mục tiêu vào các không gian bán cấu trúc

Đội ngũ không hướng tới việc tạo ra các trợ lý hình người đi dạo trong phòng khách vào ngày mai. Thay vào đó, họ tập trung vào các môi trường bán cấu trúc, nơi bố cục đủ dễ đoán để bản sao kỹ thuật số có thể đạt độ chính xác, nhưng cũng đủ đa dạng để đòi hỏi khả năng lập luận không gian thực thụ. Các ví dụ bao gồm:

  • Kho hàng nơi hàng hóa được lưu trữ trên kệ và pallet
  • Nhà hàng với bàn, ghế và nhân viên đang di chuyển
  • Khách sạn với hành lang, phòng nghỉ và xe đẩy dịch vụ
  • Các khu công nghiệp với máy móc, băng chuyền và rào chắn an toàn

Đây là những nơi mà các doanh nghiệp đã và đang yêu cầu tự động hóa. Một cuộc khảo sát gần đây được trích dẫn trong podcast cho thấy một phần ba các tác vụ robot được yêu cầu liên quan đến việc dọn dẹp—những công việc lặp đi lặp lại, khó chịu mà con người rất muốn bàn giao cho máy móc.

Thành công trông như thế nào

Lộ trình của World Labs phụ thuộc vào việc chứng minh quy trình này trong các ngành cụ thể trong hai năm tới. Nếu một robot có thể di chuyển một pallet lặp đi lặp lại trong một kho hàng mô phỏng và sau đó thực hiện điều tương tự trong một cơ sở thực tế mà không cần huấn luyện lại, mô hình đó đã chứng minh được rằng "mô phỏng đáng tin cậy dẫn đến robot đáng tin cậy". Sự tin cậy đó có thể mở ra các hợp đồng lớn hơn và chứng minh cho khoản đầu tư ban đầu vào việc tạo ra các bản sao kỹ thuật số.

Điều cần theo dõi tiếp theo

  • Các dự án thí điểm trong ngành – Những đợt triển khai đầu tiên tại các kho hàng hoặc khách sạn sẽ tiết lộ liệu quy trình này có thể xử lý được các trường hợp biên (edge cases) hỗn loạn vốn chỉ xuất hiện tại hiện trường hay không.

Ý tưởng cốt lõi rất đơn giản: cho robot một không gian tổng duyệt hoàn hảo trước khi chúng bước lên sân khấu. Nếu World Labs có thể biến buổi tổng duyệt đó thành một màn trình diễn nhất quán, thì vấn đề khó khăn nhất trong robot học—dạy máy móc hiểu và hành động trong thế giới vật lý—có thể cuối cùng sẽ có một giải pháp thực tế.