Google DeepMind telah resmi memasuki era baru AI embodied dengan peluncuran Gemini Robotics 2, sebuah model vision-language-action (VLA) yang mutakhir. Teknologi terobosan ini dirancang untuk berfungsi sebagai lapisan kecerdasan universal, yang memungkinkan robot untuk menavigasi dan berinteraksi dengan dunia fisik di berbagai platform perangkat keras.
Kebangkitan Model Vision-Language-Action (VLA)
Inti dari pengumuman ini adalah pergeseran menuju model VLA yang canggih. Berbeda dengan pemrograman robotika tradisional yang mengandalkan instruksi kaku yang telah ditentukan sebelumnya, Gemini Robotics 2 mengintegrasikan pengenalan gambar, pemrosesan bahasa, dan kontrol tindakan secara real-time. Sinergi ini memungkinkan robot tidak hanya untuk "melihat" sebuah objek dan "memahami" perintah verbal, tetapi juga mengeksekusi gerakan fisik presisi yang diperlukan untuk berinteraksi dengan objek tersebut.
Arsitektur baru DeepMind sangatlah serbaguna, dirancang untuk berskala di berbagai faktor bentuk (form factor). Model ini mampu mengendalikan segalanya, mulai dari lengan robot meja khusus yang digunakan dalam manufaktur hingga robot humanoid seluruh tubuh yang kompleks. Kemampuan ini menunjukkan masa depan di mana satu kecerdasan dasar dapat dipindahkan ke perangkat keras yang berbeda, sehingga secara signifikan menurunkan hambatan dalam menerapkan robotika canggih di lingkungan yang tidak terprediksi.
