RT-2 dari Google DeepMind, OpenVLA dari Stanford-Toyota, GR00T dari NVIDIA, LeRobot dari Hugging Face, dan Pi-Zero dari Physical Intelligence memberikan kemampuan kepada robot untuk menghubungkan input visual, perintah bahasa, dan tindakan motorik dalam satu model tunggal. Kemampuan tersebut menggantikan urutan langkah yang dikodekan secara manual dengan perilaku "lihat-dan-lakukan" (see-and-do), yang menjanjikan pengembangan yang lebih cepat dan akses yang lebih luas ke dunia robotika.
Mengapa vision-language-action itu penting
Sepanjang sebagian besar sejarah robotika, para insinyur menulis skrip eksplisit yang memberi tahu robot setiap gerakan sendi. Kelas baru model Vision-Language-Action (VLA) memperlakukan robot seperti agen percakapan: kamera mengalirkan gambar, pengguna berbicara atau mengetik permintaan, dan model tersebut mengeluarkan perintah motorik yang diperlukan untuk memenuhinya.
Lima model utama saat ini
- RT-2 (Google DeepMind) – Menghubungkan aliran visual mentah ke bahasa manusia, memungkinkan robot untuk mendeskripsikan apa yang dilihatnya dan bertindak berdasarkan instruksi lisan.
- OpenVLA (Stanford + Toyota) – Rilis sumber terbuka (open-source) yang memungkinkan pengembang mana pun memasang model tersebut ke perangkat keras mereka sendiri.
- GR00T (NVIDIA) – Dibangun untuk platform humanoid, model ini melakukan penalaran tentang adegan dan menghasilkan perintah motorik tingkat rendah.
- LeRobot (Hugging Face) – Menyediakan repositori data dan perangkat alat (toolset) yang mempercepat pelatihan dan integrasi model bagi pengembang robot.
- Pi-Zero (Physical Intelligence) – Menyatakan bahwa satu "otak" tunggal dapat digunakan kembali di berbagai tubuh robot yang berbeda, menyederhanakan tumpukan perangkat lunak (software stacks) untuk perangkat keras yang bervariasi.
Data, simulasi, dan masalah drift
Kelima model tersebut mengandalkan kumpulan data masif, yang sebagian besar berasal dari lingkungan simulasi karena pengumpulan di dunia nyata memakan biaya tinggi dan berisiko. Ketergantungan tersebut menciptakan "sim-to-real drift": perilaku yang dipelajari di dunia virtual yang sempurna mungkin gagal saat menghadapi sensor yang berisik, pencahayaan yang tidak merata, atau rintangan yang tidak terduga.
