RT-2 daripada Google DeepMind, OpenVLA daripada Stanford-Toyota, GR00T daripada NVIDIA, LeRobot daripada Hugging Face dan Pi-Zero daripada Physical Intelligence memberikan robot keupayaan untuk menghubungkan input visual, arahan bahasa dan tindakan motor dalam satu model tunggal. Keupayaan tersebut menggantikan urutan langkah yang dikodkan secara manual dengan tingkah laku “lihat-dan-buat”, menjanjikan pembangunan yang lebih pantas dan akses yang lebih luas kepada robotik.
Mengapa visi-bahasa-tindakan itu penting
Sepanjang sebahagian besar sejarah robotik, jurutera menulis skrip eksplisit yang memberitahu robot setiap pergerakan sendi. Kelas baharu model Vision-Language-Action (VLA) melayan robot seperti ejen perbualan: kamera menyalurkan imej, pengguna bercakap atau menaip permintaan, dan model tersebut mengeluarkan arahan motor yang diperlukan untuk melaksanakannya.
Lima model utama yang ada
- RT-2 (Google DeepMind) – Menghubungkan aliran visual mentah kepada bahasa manusia, membolehkan robot menerangkan apa yang dilihatnya dan bertindak berdasarkan arahan lisan.
- OpenVLA (Stanford + Toyota) – Satu keluaran sumber terbuka yang membolehkan mana-mana pembangun menyambungkan model tersebut ke dalam perkakasan mereka sendiri.
- GR00T (NVIDIA) – Dibina untuk platform humanoid, ia membuat penaakulan tentang suasana dan menjana arahan motor tahap rendah.
- LeRobot (Hugging Face) – Menyediakan repositori data dan set alatan yang mempercepatkan latihan model dan integrasi bagi pembangun robot.
- Pi-Zero (Physical Intelligence) – Menyatakan bahawa satu “otak” tunggal boleh digunakan semula merentasi pelbagai badan robot yang berbeza, memudahkan timbunan perisian untuk perkakasan yang pelbagai.
Data, simulasi dan masalah hanyutan (drift)
Kelima-lima model ini bergantung kepada set data yang besar, yang kebanyakannya datang daripada persekitaran simulasi kerana pengumpulan data dunia nyata adalah mahal dan berisiko. Pergantungan tersebut mewujudkan “hanyutan sim-ke-real” (sim-to-real drift): tingkah laku yang dipelajari dalam dunia maya yang sempurna mungkin gagal apabila berhadapan dengan sensor yang bising, pencahayaan yang tidak sekata atau halangan yang tidak dijangka.
