Google DeepMind-ന്റെ RT-2, Stanford-Toyota-യുടെ OpenVLA, NVIDIA-യുടെ GR00T, Hugging Face-ന്റെ LeRobot, Physical Intelligence-ന്റെ Pi-Zero എന്നിവ ഒരു സിംഗിൾ മോഡലിലൂടെ വിഷ്വൽ ഇൻപുട്ട്, ഭാഷാപരമായ നിർദ്ദേശങ്ങൾ, മോട്ടോർ ആക്ഷനുകൾ എന്നിവയെ ബന്ധിപ്പിക്കാൻ റോബോട്ടുകളെ പ്രാപ്തമാക്കുന്നു. ഈ കഴിവ് ഓരോ ഘട്ടവും കോഡ് ചെയ്ത് നൽകുന്ന രീതിക്ക് പകരം "കാണുക, പ്രവർത്തിക്കുക" (see-and-do) എന്ന രീതി കൊണ്ടുവരുന്നു; ഇത് റോബോട്ടിക്സ് മേഖലയിലെ വികസനം വേഗത്തിലാക്കാനും കൂടുതൽ ആളുകളിലേക്ക് ഇത് എത്തിക്കാനും സഹായിക്കും.
എന്തുകൊണ്ടാണ് വിഷൻ-ലാംഗ്വേജ്-ആക്ഷൻ (vision-language-action) പ്രധാനമാകുന്നത്
റോബോട്ടിക്സിന്റെ ചരിത്രത്തിൽ ഭൂരിഭാഗം കാലവും, ഓരോ ജോയിന്റ് ചലനങ്ങളെക്കുറിച്ചും റോബോട്ടിന് നിർദ്ദേശം നൽകുന്നതിനായി എഞ്ചിനീയർമാർ പ്രത്യേക സ്ക്രിപ്റ്റുകൾ എഴുതുകയായിരുന്നു പതിവ്. പുതിയ തരം വിഷൻ-ലാംഗ്വേജ്-ആക്ഷൻ (VLA) മോഡലുകൾ ഒരു റോബോട്ടിനെ ഒരു സംഭാഷണ ഏജന്റ് (conversational agent) പോലെയാണ് പരിഗണിക്കുന്നത്: ഒരു ക്യാമറ ചിത്രം പകർത്തി നൽകുന്നു, ഉപയോക്താവ് ഒരു അഭ്യർത്ഥന പറയുകയോ ടൈപ്പ് ചെയ്യുകയോ ചെയ്യുന്നു, തുടർന്ന് ആ അഭ്യർത്ഥന നിറവേറ്റുന്നതിന് ആവശ്യമായ മോട്ടോർ കമാൻഡുകൾ ഈ മോഡൽ നൽകുന്നു.
നിലവിലുള്ള അഞ്ച് പ്രധാന മോഡലുകൾ
- RT-2 (Google DeepMind) – വിഷ്വൽ സ്ട്രീമുകളെ മനുഷ്യഭാഷയുമായി ബന്ധിപ്പിക്കുന്നു, ഇത് റോബോട്ടിന് താൻ കാണുന്നത് വിവരിക്കാനും നൽകുന്ന നിർദ്ദേശങ്ങൾക്കനുസരിച്ച് പ്രവർത്തിക്കാനും സഹായിക്കുന്നു.
- OpenVLA (Stanford + Toyota) – ഏതൊരു ഡെവലപ്പർക്കും ഈ മോഡൽ സ്വന്തം ഹാർഡ്വെയറിൽ ഉപയോഗിക്കാൻ സാധിക്കുന്ന ഒരു ഓപ്പൺ സോഴ്സ് റിലീസ് ആണിത്.
- GR00T (NVIDIA) – ഹ്യൂമനോയിഡ് പ്ലാറ്റ്ഫോമുകൾക്കായി നിർമ്മിച്ച ഇത്, ചുറ്റുമുള്ള സാഹചര്യങ്ങൾ വിശകലനം ചെയ്യുകയും ലോ-ലെവൽ മോട്ടോർ കമാൻഡുകൾ നിർമ്മിക്കുകയും ചെയ്യുന്നു.
- LeRobot (Hugging Face) – റോബോട്ട് ഡെവലപ്പർമാർക്ക് മോഡൽ ട്രെയിനിംഗും ഇന്റഗ്രേഷനും വേഗത്തിലാക്കാൻ ആവശ്യമായ ഡാറ്റാ റിപ്പോസിറ്ററിയും ടൂൾസെറ്റും ഇത് നൽകുന്നു.
- Pi-Zero (Physical Intelligence) – വ്യത്യസ്ത റോബോട്ട് ശരീരങ്ങളിൽ ഉപയോഗിക്കാൻ കഴിയുന്ന ഒരു ഏകീകൃത "തലച്ചോറ്" (brain) സാധ്യമാണെന്ന് ഇത് വ്യക്തമാക്കുന്നു, ഇത് വിവിധ ഹാർഡ്വെയറുകൾക്കായുള്ള സോഫ്റ്റ്വെയർ സ്ടാക്കുകളെ ലളിതമാക്കുന്നു.
ഡാറ്റ, സിമുലേഷൻ, ഡ്രിഫ്റ്റ് പ്രശ്നം (drift problem)
ഈ അഞ്ച് മോഡലുകളും വൻതോതിലുള്ള ഡാറ്റാസെറ്റുകളെയാണ് ആശ്രയിക്കുന്നത്, ഇതിൽ ഭൂരിഭാഗവും സിമുലേറ്റഡ് എൻവയോൺമെന്റുകളിൽ നിന്നുള്ളതാണ്; കാരണം യഥാർത്ഥ ലോകത്ത് നിന്ന് ഡാറ്റ ശേഖരിക്കുന്നത് ചിലവേറിയതും അപകടസാധ്യതയുള്ളതുമാണ്. ഈ ആശ്രയത്വം ഒരു "സിം-ടു-റിയൽ" (sim-to-real) ഡ്രിഫ്റ്റ് സൃഷ്ടിക്കുന്നു: കൃത്യമായ വെർച്വൽ ലോകങ്ങളിൽ നിന്ന് പഠിച്ച പെരുമാറ്റങ്ങൾ, സെൻസറുകളിലെ തകരാറുകൾ (noisy sensors), അസമമായ വെളിച്ചം അല്ലെങ്കിൽ അപ്രതീക്ഷിതമായ തടസ്സങ്ങൾ എന്നിവ നേരിടുമ്പോൾ പരാജയപ്പെട്ടേക്കാം.
