Google DeepMind đã chính thức bước vào một kỷ nguyên mới của AI hiện thân (embodied AI) với việc ra mắt Gemini Robotics 2, một mô hình thị giác-ngôn ngữ-hành động (VLA) tiên tiến. Công nghệ đột phá này được thiết kế để đóng vai trò như một lớp trí tuệ vạn năng, cho phép robot điều hướng và tương tác với thế giới vật lý trên nhiều nền tảng phần cứng khác nhau.

Sự trỗi dậy của các mô hình Thị giác-Ngôn ngữ-Hành động (VLA)

Trọng tâm của thông báo này là sự chuyển dịch hướng tới các mô hình VLA tinh vi. Khác với lập trình robot truyền thống vốn dựa trên các chỉ dẫn cứng nhắc và được định nghĩa trước, Gemini Robotics 2 tích hợp khả năng nhận diện hình ảnh, xử lý ngôn ngữ và kiểm soát hành động trong thời gian thực. Sự cộng hưởng này cho phép robot không chỉ "nhìn" thấy một vật thể và "hiểu" một câu lệnh bằng lời nói, mà còn thực hiện được các chuyển động vật lý chính xác cần thiết để tương tác với vật thể đó.

Kiến trúc mới của DeepMind cực kỳ linh hoạt, được thiết kế để có thể mở rộng trên nhiều dạng hình thái khác nhau. Mô hình này có khả năng điều khiển mọi thứ, từ các cánh tay robot chuyên dụng trên bàn làm việc dùng trong sản xuất cho đến các robot hình người toàn thân phức tạp. Khả năng này gợi mở về một tương lai nơi một trí tuệ nền tảng duy nhất có thể được chuyển đổi sang các phần cứng khác nhau, giúp giảm đáng kể rào cản trong việc triển khai robot tiên tiến vào các môi trường không thể dự đoán trước.

Gemini Robotics ER 2: Thúc đẩy khả năng Suy luận Hiện thân (Embodied Reasoning)

Bổ trợ cho mô hình VLA là sự ra mắt của Gemini Robotics ER 2, một mô hình được thiết kế chuyên biệt cho "suy luận hiện thân" (embodied reasoning). Trong khi các mô hình VLA tập trung vào vòng lặp giữa nhận thức và hành động, ER 2 lại tập trung vào quá trình ra quyết định nhận thức cấp cao—hiểu được các sắc thái vật lý của môi trường và xác định trình tự hành động tối ưu để đạt được mục tiêu.

Gemini Robotics ER 2 kế thừa mô hình Gemini Robotics ER 1.6 được phát hành vào tháng 4, đánh dấu một bước nhảy vọt đáng kể về khả năng suy luận. Bằng cách đóng vai trò như một hệ thống điều khiển cấp cao, ER 2 cho phép robot vượt ra khỏi các tác vụ lặp đi lặp lại đơn giản để hướng tới việc giải quyết các vấn đề phức tạp trong môi trường thực tế. Đối với các nhà phát triển muốn tích hợp các khả năng này, ER 2 đã có sẵn thông qua Google AI Studio.

Tại sao điều này lại quan trọng đối với bối cảnh AI

Việc phát triển Gemini Robotics 2 đại diện cho một bước tiến then chốt trong nỗ lực hướng tới Robot Đa năng (General Purpose Robotics). Trong nhiều năm, ngành công nghiệp này đã phải vật lộn với sự "mong manh" (brittleness)—xu hướng robot bị lỗi khi đối mặt với những thay đổi nhỏ trong môi trường. Bằng cách áp dụng các quy luật mở rộng (scaling laws) và logic dựa trên transformer của dòng Gemini vào chuyển động vật lý, DeepMind đang nỗ lực giải quyết vấn đề về khả năng thích ứng.

Nếu thành công, cách tiếp cận "lớp trí tuệ" này có thể tách biệt trí tuệ phần mềm khỏi kỹ thuật phần cứng. Điều này sẽ cho phép đẩy nhanh đáng kể việc triển khai robot, vì các nhà phát triển có thể tập trung vào việc tinh chỉnh các bộ truyền động vật lý (actuators) trong khi dựa vào các mô hình đã được đào tạo sẵn và mạnh mẽ của Google để xử lý các logic phức tạp về chuyển động và suy luận không gian.

Các điểm chính cần lưu ý

  • Khả năng tương thích vạn năng: Gemini Robotics 2 là một mô hình VLA có khả năng điều khiển các phần cứng đa dạng, từ các cánh tay nhỏ gọn trên bàn làm việc đến các robot hình người phức tạp.
  • Tăng cường khả năng suy luận: Gemini Robotics ER 2 mới cung cấp khả năng "suy luận hiện thân" tiên tiến, đóng vai trò là bộ điều khiển nhận thức cấp cao cho việc ra quyết định vật lý.
  • Khả năng tiếp cận cho nhà phát triển: Google đang mở rộng các công cụ này cho hệ sinh thái, với ER 2 có sẵn trong Google AI Studio và quyền truy cập sớm vào Gemini Robotics 2 thông qua danh sách chờ.

Tóm lại

Gemini Robotics 2 và mô-đun ER 2 đi kèm đại diện cho một bước đi cụ thể hướng tới một bộ não AI vạn năng cho robot, hợp nhất nhận thức, ngôn ngữ và kiểm soát vào một hệ thống duy nhất có thể đào tạo được. Cách tiếp cận này có thể làm giảm đáng kể chi phí và sự phức tạp khi triển khai các robot tinh vi.