Google DeepMind యొక్క RT-2, Stanford-Toyota యొక్క OpenVLA, NVIDIA యొక్క GR00T, Hugging Face యొక్క LeRobot మరియు Physical Intelligence యొక్క Pi-Zero అనేవి ఒకే మోడల్లో విజువల్ ఇన్పుట్, లాంగ్వేజ్ కమాండ్స్ మరియు మోటార్ చర్యలను అనుసంధానించే సామర్థ్యాన్ని రోబోట్లకు అందిస్తాయి. ఈ సామర్థ్యం హ్యాండ్-కోడెడ్ స్టెప్ సీక్వెన్స్ల స్థానంలో "చూసి-చేయడం" (see-and-do) అనే ప్రవర్తనను ప్రవేశపెడుతుంది, ఇది రోబోటిక్స్ రంగంలో వేగవంతమైన అభివృద్ధిని మరియు విస్తృతమైన ప్రాప్యతను అందిస్తుంది.
విజన్-లాంగ్వేజ్-యాక్షన్ ఎందుకు ముఖ్యం
రోబోటిక్స్ చరిత్రలో చాలా కాలం పాటు, ఇంజనీర్లు రోబోట్ యొక్క ప్రతి కీళ్ల కదలికను తెలియజేసే స్పష్టమైన స్క్రిప్ట్లను రాసేవారు. కొత్త తరహా విజన్-లాంగ్వేజ్-యాక్షన్ (VLA) మోడల్స్ రోబోట్ను ఒక సంభాషణా ఏజెంట్లా (conversational agent) పరిగణిస్తాయి: కెమెరా ఒక చిత్రాన్ని స్ట్రీమ్ చేస్తుంది, వినియోగదారుడు ఒక అభ్యర్థనను మాట్లాడుతాడు లేదా టైప్ చేస్తాడు, మరియు ఆ అభ్యర్థనను నెరవేర్చడానికి అవసరమైన మోటార్ కమాండ్లను మోడల్ అందిస్తుంది.
ప్రస్తుతం అందుబాటులో ఉన్న ఐదు మోడల్స్
- RT-2 (Google DeepMind) – ఇది ముడి విజువల్ స్ట్రీమ్స్ను మానవ భాషతో అనుసంధానిస్తుంది, తద్వారా రోబోట్ తాను చూస్తున్న దానిని వివరించగలదు మరియు చెప్పబడిన ఆదేశాల ప్రకారం పనిచేయగలదు.
- OpenVLA (Stanford + Toyota) – ఇది ఒక ఓపెన్-సోర్స్ విడుదల, దీని ద్వారా ఏ డెవలపర్నైనా ఈ మోడల్ను వారి స్వంత హార్డ్వేర్కు అనుసంధానించడానికి అనుమతిస్తుంది.
- GR00T (NVIDIA) – ఇది హ్యూమనాయిడ్ ప్లాట్ఫారమ్ల కోసం రూపొందించబడింది, ఇది చుట్టుపక్కల దృశ్యాన్ని విశ్లేషించి, లో-లెవల్ మోటార్ కమాండ్లను ఉత్పత్తి చేస్తుంది.
- LeRobot (Hugging Face) – ఇది రోబోట్ డెవలపర్ల కోసం మోడల్ శిక్షణ మరియు ఇంటిగ్రేషన్ను వేగవంతం చేసే డేటా రిపోజిటరీ మరియు టూల్సెట్ను అందిస్తుంది.
- Pi-Zero (Physical Intelligence) – ఒకే "మెదడు"ను వివిధ రకాల రోబోట్ శరీరాలకు తిరిగి ఉపయోగించవచ్చని ఇది చెబుతుంది, తద్వారా విభిన్న హార్డ్వేర్ల కోసం సాఫ్ట్వేర్ స్టాక్లను సరళీకరిస్తుంది.
డేటా, సిమ్యులేషన్ మరియు డ్రిఫ్ట్ సమస్య
ఈ ఐదు మోడల్స్ భారీ డేటాసెట్లపై ఆధారపడి ఉంటాయి, వీటిలో చాలా వరకు సిమ్యులేటెడ్ వాతావరణాల నుండి వస్తాయి, ఎందుకంటే నిజ ప్రపంచంలో డేటాను సేకరించడం ఖరీదైనది మరియు ప్రమాదకరమైనది. ఈ ఆధారపడటం వల్ల "సిమ్-టు-రియల్" (sim-to-real) డ్రిఫ్ట్ ఏర్పడుతుంది: పరిపూర్ణమైన వర్చువల్ ప్రపంచాలలో నేర్చుకున్న ప్రవర్తనలు, నాయిస్ ఉన్న సెన్సార్లు, అసమానమైన వెలుతురు లేదా ఊహించని అడ్డంకులను ఎదుర్కొన్నప్పుడు విఫలమయ్యే అవకాశం ఉంది.
