Ranh giới của AI vật lý đang vấp phải một nút thắt cổ chai khổng lồ: chúng ta đang thiếu dữ liệu huấn luyện thực tế với độ trung thực cao. Các Mô hình Ngôn ngữ Lớn (LLM) phát triển nhờ việc thu thập văn bản từ internet; trong khi đó, ngành robot cần một cách tiếp cận tốn kém hơn nhiều.

Vấn đề khan hiếm dữ liệu trong ngành robot

Để robot hình người và robot kho bãi có thể đạt được sự khéo léo như con người, chúng cần một quy mô dữ liệu mà hiện tại đơn giản là chưa tồn tại. Vineeth Velmurugan, trưởng bộ phận học máy robot của Encord và là chuyên gia kỳ cựu tại phòng thí nghiệm robot của OpenAI, cho biết một bước đột phá đòi hỏi một bộ dữ liệu có quy mô lớn gấp khoảng năm lần toàn bộ kho video của YouTube.

Văn bản thì dồi dào và có thể thu thập miễn phí. Dữ liệu vật lý thì phải được sản xuất. Việc huấn luyện chỉ dựa trên video thường thiếu độ trung thực cần thiết cho các thao tác phức tạp. Do đó, ngành công nghiệp đã chuyển dịch từ việc tinh chỉnh kiến trúc mô hình sang giải quyết vấn đề khó khăn hơn nhiều: sản xuất dữ liệu vật lý chất lượng cao và được chú thích kỹ lưỡng.

Vượt xa video: Sử dụng sóng não và tín hiệu cơ bắp

Các startup như Encord đang thử nghiệm các phương thức dữ liệu mới để cung cấp cho robot bối cảnh sâu sắc hơn. Trong một dự án thí điểm với startup thần kinh học Zander Labs của Đức, Encord trang bị cho những người vận hành các thiết bị đeo sóng não. Bằng cách đo lường hoạt động thần kinh, các nhà nghiên cứu hy vọng có thể suy luận được ý định, lỗi và sự ngạc nhiên.

Lucas Gehrke, một nhà thần kinh học tại Zander, cho biết việc theo dõi hoạt động não bộ cho phép những người xây dựng mô hình biết chính xác khi nào robot nên kích hoạt các mô hình tính toán mạnh mẽ nhất của nó cho một nhiệm vụ khó khăn.

Encord cũng khám phá:

  • Điện cơ đồ (EMG): Các cảm biến được đeo vào cẳng tay để thu thập các tín hiệu điện trong cơ bắp, tạo ra một bản đồ 3D của các chuyển động tay mà camera gắn trên đầu thường bỏ lỡ.
  • Hệ thống cánh tay robot cặp (Leader-Follower Rigs): Các cánh tay robot được ghép đôi, trong đó một cánh tay mô phỏng hành động của người vận hành, ghi lại các thao tác chính xác như rót chất lỏng hoặc xếp chồng các chip poker.
  • Chú thích dày đặc (Dense Annotation): Các nhãn như "tay phải siết chặt bu lông". Velmurugan ước tính rằng kiểu chú thích dày đặc này có giá trị gấp 100 lần so với video góc nhìn thứ nhất (ego video) thô để huấn luyện các tác vụ cụ thể.

Thực tế kinh tế của AI vật lý

Việc chuyển đổi từ AI ưu tiên kỹ thuật số sang AI vật lý đã làm đảo lộn bài toán kinh tế của học máy. Các phòng thí nghiệm LLM xây dựng mô hình với chi phí biên gần như bằng không bằng cách khai thác từ web. Việc sản xuất dữ liệu huấn luyện robot đòi hỏi phần cứng, người vận hành và quá trình chú thích cực kỳ tỉ mỉ. Encord đặt mục tiêu làm cho dữ liệu chất lượng cao có hiệu quả chi phí gấp 20 lần so với giá trị mà nó mang lại, tuy nhiên ngay cả điều đó cũng chuyển hóa thành các dự án trị giá hàng triệu đô la cho các đội robot lớn.

Những công ty tạo ra được các bộ dữ liệu khổng lồ và được chú thích phong phú trước tiên sẽ thống trị khả năng thao tác tự động—từ việc cắm cáp Ethernet đến việc lấy và đóng gói hàng hóa. Những công ty bám lấy các quy trình chỉ dựa trên video sẽ có nguy cơ bị tụt lại phía sau khi các đối thủ thu thập được các tín hiệu phong phú hơn từ cơ thể và não bộ con người.

Các điểm chính cần lưu ý

  • Sản xuất dữ liệu so với Thu thập dữ liệu: AI vật lý đòi hỏi việc sản xuất thủ công các bộ dữ liệu độ trung thực cao với chi phí đắt đỏ, không giống như LLM vốn thu thập dữ liệu có sẵn trên internet.
  • Các phương thức thần kinh học: Việc bổ sung sóng não và EMG cho phép robot nắm bắt ý định, lỗi của con người và các chuyển động tay 3D hiệu quả hơn so với chỉ dùng video.
  • Thách thức về quy mô: Các mô hình robot cần một bộ dữ liệu lớn hơn nhiều so với toàn bộ kho lưu trữ của YouTube; việc tạo dữ liệu hiện là ranh giới kinh doanh chính.

Encord đã bắt đầu một dự án thí điểm với startup thần kinh học Zander Labs của Đức, trang bị cho những người vận hành các thiết bị đeo sóng não và cảm biến EMG ở cẳng tay để thu thập dữ liệu huấn luyện độ trung thực cao cho AI vật lý. Sự hợp tác này nhằm mục đích tạo ra một bộ dữ liệu đủ lớn để cạnh tranh với quy mô gấp năm lần tổng lượng video trên YouTube—một quy mô mà các nhà nghiên cứu cho rằng là cần thiết để robot đạt được sự khéo léo ở cấp độ con người và có thể định hình lại cách robot học tập.

Tại sao dữ liệu robot là một nút thắt cổ chai

Các mô hình ngôn ngữ lớn phát triển bằng cách thu thập dữ liệu từ web mở; nguyên liệu thô rất dồi dào và rẻ tiền. Ngược lại, AI vật lý cần dữ liệu phải được sản xuất. Mỗi lần cầm nắm, xoay hoặc rót đều phải được ghi lại, chú thích và liên kết với các lực cũng như ý định đã tạo ra nó. Video thông thường thường bỏ lỡ các tín hiệu tinh tế cần thiết cho các thao tác phức tạp, tạo ra khoảng cách giữa các mô hình hiện nay và các yêu cầu của nhà máy, kho bãi và gia đình.

Vineeth Velmurugan, trưởng bộ phận học máy robot của Encord và là cựu chuyên gia tại phòng thí nghiệm robot của OpenAI, cho biết lĩnh vực này sẽ không tiến triển cho đến khi tồn tại một bộ dữ liệu có quy mô lớn gấp khoảng năm lần kho video của YouTube. Vấn đề không còn nằm ở kiến trúc mô hình; mà là cách sản xuất dữ liệu.

Thêm sóng não và tín hiệu cơ bắp

Dự án thí điểm Encord-Zander cố gắng lấp đầy khoảng trống đó bằng cách bổ sung các tín hiệu sinh lý vào bản ghi hình ảnh. Người vận hành đeo thiết bị đầu đọc điện não đồ (EEG) – hoạt động điện của não bộ – trong khi các cảm biến EMG trên cẳng tay ghi lại các xung cơ. Mục tiêu là suy luận các trạng thái tinh thần như ý định, sự ngạc nhiên hoặc sai sót, và chuyển đổi hoạt động cơ bắp thô thành một bản đồ ba chiều về chuyển động của bàn tay mà chỉ riêng video không thể ghi lại được.

Lucas Gehrke, một nhà thần kinh học tại Zander, giải thích rằng việc biết khi nào con người dự đoán một nhiệm vụ phụ khó khăn sẽ cho phép robot phân bổ các mô hình tính toán mạnh mẽ nhất của nó vào đúng thời điểm.

Ngoài dữ liệu thần kinh, Encord còn thử nghiệm một số kỹ thuật bổ trợ:

  • Điện cơ đồ (EMG): Các cảm biến trên cẳng tay tạo ra kết quả đọc trực tiếp về sự kích hoạt cơ, cho phép tái tạo chính xác quỹ đạo của các ngón tay mà các camera gắn trên đầu thường bỏ lỡ.
  • Hệ thống leader-follower: Một cặp cánh tay robot hoạt động song song, một cánh tay mô phỏng các chuyển động của người vận hành. Điều này giúp ghi lại các nhiệm vụ tinh vi—như rót chất lỏng, xếp chồng các chip—nơi mà các sai số ở quy mô milimét là rất quan trọng.
  • Chú thích dày đặc (Dense annotation): Thay vì chỉ dán nhãn các hành động ở cấp độ cao, nhóm của Velmurugan đính kèm các mô tả chi tiết như “tay phải siết chặt bu lông”. Ông ước tính chi tiết này có giá trị cao hơn khoảng 100 lần trong việc huấn luyện một kỹ năng thao tác cụ thể so với video góc nhìn thứ nhất (ego-centric) thô.

Kinh tế học của việc sản xuất dữ liệu

Physical AI làm thay đổi các tính toán tài chính của học máy. Các phòng thí nghiệm LLM xây dựng các mô hình với chi phí biên gần như bằng không vì internet cung cấp văn bản vô tận. Tuy nhiên, việc sản xuất dữ liệu huấn luyện robot đòi hỏi phần cứng, người vận hành và quá trình chú thích tỉ mỉ. Mục tiêu nội bộ của Encord là làm cho dữ liệu chất lượng cao có hiệu quả về chi phí gấp 20 lần so với giá trị mà nó mang lại cho khách hàng, nhưng ngay cả mức hiệu quả quyết liệt đó vẫn chuyển hóa thành các dự án trị giá hàng triệu đô la cho các đội robot quy mô lớn.

Các rủi ro và cơ hội là rất rõ ràng: những công ty có thể tạo ra các bộ dữ liệu khổng lồ, được chú thích phong phú trước tiên sẽ thống trị thị trường mới nổi về thao tác tự động—cho dù đó là việc cắm cáp Ethernet trên sàn trung tâm dữ liệu hay lấy và đóng gói hàng hóa trong trung tâm phân phối. Những bên tiếp tục dựa vào các quy trình chỉ có video sẽ có nguy cơ bị tụt hậu khi các đối thủ khai thác được các tín hiệu phong phú hơn từ cơ thể và não bộ con người.

Các quan điểm phản biện và câu hỏi mở

Không phải ai cũng bị thuyết phục rằng các tín hiệu thần kinh là mảnh ghép còn thiếu. Các nhà phê bình lập luận rằng sự phức tạp bổ sung của phần cứng có thể lớn hơn lợi ích mang lại, đặc biệt là khi video kết hợp với các cảm biến lực-mô-men xoắn (force-torque sensors) đã mang lại hiệu suất khá tốt cho nhiều tác vụ công nghiệp. Khả năng mở rộng là một mối quan tâm khác: việc trang bị thiết bị đeo EEG và hệ thống EMG cho hàng nghìn người vận hành có thể là quá tốn kém đối với các nhà sản xuất nhỏ hơn.

Quy trình tạo dữ liệu vẫn đòi hỏi nhiều nhân lực. Ngay cả với các hệ thống leader-follower, việc nắm bắt được phạm vi rộng lớn của các nhiệm vụ cần thiết cho một robot thực sự đa năng sẽ đòi hỏi nỗ lực phối hợp và duy trì liên tục giữa nhiều phòng thí nghiệm và nhà máy. Thị trường sẽ phải quyết định liệu những cải thiện hiệu suất tăng thêm có xứng đáng với khoản đầu tư ban đầu hay không.

Những điều cần theo dõi tiếp theo

  • Các cột mốc về khối lượng dữ liệu: Tuyên bố của Encord về một bộ dữ liệu lớn gấp năm lần YouTube sẽ là một tiêu chuẩn cụ thể. Khi được công bố, các đối thủ khác sẽ có một mục tiêu rõ ràng để theo kịp hoặc vượt qua.
  • Tỷ lệ áp dụng phần cứng: Tốc độ mà các thiết bị EEG và EMG trở thành tiêu chuẩn trong các hệ thống thu thập dữ liệu sẽ cho thấy liệu phương pháp này có thể mở rộng quy mô vượt ra ngoài các dự án thí điểm thực nghiệm hay không.
  • Các chỉ số chi phí: Nếu Encord có thể chứng minh được lợi thế chi phí gấp 20 lần như đã hứa, nó có thể thúc đẩy một làn sóng những người mới gia nhập thị trường, tập trung vào “sản xuất dữ liệu” thay vì thiết kế mô hình.
  • Khoảng cách hiệu suất