Google DeepMind चे RT-2, Stanford-Toyota चे OpenVLA, NVIDIA चे GR00T, Hugging Face चे LeRobot आणि Physical Intelligence चे Pi-Zero हे रोबोट्सना एकाच मॉडेलमध्ये व्हिज्युअल इनपुट, भाषिक आदेश आणि मोटर कृती (motor actions) जोडण्याची क्षमता देतात. ही क्षमता हाताने कोड केलेल्या स्टेप सिक्वेन्सची जागा "पहा आणि करा" (see-and-do) या वर्तणुकीने घेते, ज्यामुळे रोबोटिक्सच्या जलद विकासाचे आणि व्यापक प्रवेशाचे आश्वासन मिळते.
व्हिजन-लँग्वेज-ॲक्शन (vision-language-action) का महत्त्वाचे आहे
रोबोटिक्सच्या बहुतांश इतिहासात, इंजिनिअर्सनी स्पष्ट स्क्रिप्ट्स लिहिल्या होत्या ज्या रोबोटला प्रत्येक सांध्याच्या हालचालीबद्दल (joint movement) सांगत असत. व्हिजन-लँग्वेज-ॲक्शन (VLA) मॉडेल्सचा नवीन प्रकार रोबोटला एका संवादात्मक एजंटप्रमाणे (conversational agent) मानतो: कॅमेरा एक इमेज स्ट्रीम करतो, वापरकर्ता विनंती बोलतो किंवा टाईप करतो आणि मॉडेल ती पूर्ण करण्यासाठी आवश्यक असलेले मोटर कमांड्स देते.
सध्या उपलब्ध असलेली पाच मॉडेल्स
- RT-2 (Google DeepMind) – कच्च्या व्हिज्युअल स्ट्रीम्सना मानवी भाषेशी जोडते, ज्यामुळे रोबोट त्याला जे दिसते त्याचे वर्णन करू शकतो आणि तोंडी सूचनांवर कृती करू शकतो.
- OpenVLA (Stanford + Toyota) – एक ओपन-सोर्स रिलीज आहे ज्यामुळे कोणताही डेव्हलपर हे मॉडेल त्यांच्या स्वतःच्या हार्डवेअरमध्ये जोडू शकतो.
- GR00T (NVIDIA) – ह्युमनॉइड प्लॅटफॉर्मसाठी बनवलेले हे मॉडेल, दृश्याचा विचार करते आणि लो-लेव्हल मोटर कमांड्स तयार करते.
- LeRobot (Hugging Face) – डेटा रिपॉझिटरी आणि टूलसेट पुरवते ज्यामुळे रोबोट डेव्हलपर्ससाठी मॉडेल ट्रेनिंग आणि इंटिग्रेशनचा वेग वाढतो.
- Pi-Zero (Physical Intelligence) – सांगते की एकच "मेंदू" (brain) वेगवेगळ्या रोबोट बॉडीजमध्ये पुन्हा वापरला जाऊ शकतो, ज्यामुळे विविध हार्डवेअरसाठी सॉफ्टवेअर स्टॅक्स सोपे होतात.
डेटा, सिम्युलेशन आणि ड्रिफ्टची समस्या
ही पाचही मॉडेल्स प्रचंड डेटासेटवर अवलंबून आहेत, ज्यातील बहुतेक डेटा सिम्युलेटेड वातावरणातून येतो कारण वास्तविक जगातील डेटा गोळा करणे खर्चिक आणि जोखमीचे असते. या अवलंबित्वामुळे "सिम-टू-रिअल" (sim-to-real) ड्रिफ्ट निर्माण होतो: परिपूर्ण आभासी जगात शिकलेले वर्तन गोंगाट करणारे सेन्सर्स, असमान प्रकाश किंवा अनपेक्षित अडथळ्यांचा सामना करताना चुकण्याची शक्यता असते.
