Google DeepMind యొక్క RT-2, Stanford-Toyota యొక్క OpenVLA, NVIDIA యొక్క GR00T, Hugging Face యొక్క LeRobot మరియు Physical Intelligence యొక్క Pi-Zero అనేవి ఒకే మోడల్‌లో విజువల్ ఇన్‌పుట్, లాంగ్వేజ్ కమాండ్స్ మరియు మోటార్ చర్యలను అనుసంధానించే సామర్థ్యాన్ని రోబోట్‌లకు అందిస్తాయి. ఈ సామర్థ్యం హ్యాండ్-కోడెడ్ స్టెప్ సీక్వెన్స్‌ల స్థానంలో "చూసి-చేయడం" (see-and-do) అనే ప్రవర్తనను ప్రవేశపెడుతుంది, ఇది రోబోటిక్స్ రంగంలో వేగవంతమైన అభివృద్ధిని మరియు విస్తృతమైన ప్రాప్యతను అందిస్తుంది.

విజన్-లాంగ్వేజ్-యాక్షన్ ఎందుకు ముఖ్యం

రోబోటిక్స్ చరిత్రలో చాలా కాలం పాటు, ఇంజనీర్లు రోబోట్ యొక్క ప్రతి కీళ్ల కదలికను తెలియజేసే స్పష్టమైన స్క్రిప్ట్‌లను రాసేవారు. కొత్త తరహా విజన్-లాంగ్వేజ్-యాక్షన్ (VLA) మోడల్స్ రోబోట్‌ను ఒక సంభాషణా ఏజెంట్‌లా (conversational agent) పరిగణిస్తాయి: కెమెరా ఒక చిత్రాన్ని స్ట్రీమ్ చేస్తుంది, వినియోగదారుడు ఒక అభ్యర్థనను మాట్లాడుతాడు లేదా టైప్ చేస్తాడు, మరియు ఆ అభ్యర్థనను నెరవేర్చడానికి అవసరమైన మోటార్ కమాండ్‌లను మోడల్ అందిస్తుంది.

ప్రస్తుతం అందుబాటులో ఉన్న ఐదు మోడల్స్

  • RT-2 (Google DeepMind) – ఇది ముడి విజువల్ స్ట్రీమ్స్‌ను మానవ భాషతో అనుసంధానిస్తుంది, తద్వారా రోబోట్ తాను చూస్తున్న దానిని వివరించగలదు మరియు చెప్పబడిన ఆదేశాల ప్రకారం పనిచేయగలదు.
  • OpenVLA (Stanford + Toyota) – ఇది ఒక ఓపెన్-సోర్స్ విడుదల, దీని ద్వారా ఏ డెవలపర్‌నైనా ఈ మోడల్‌ను వారి స్వంత హార్డ్‌వేర్‌కు అనుసంధానించడానికి అనుమతిస్తుంది.
  • GR00T (NVIDIA) – ఇది హ్యూమనాయిడ్ ప్లాట్‌ఫారమ్‌ల కోసం రూపొందించబడింది, ఇది చుట్టుపక్కల దృశ్యాన్ని విశ్లేషించి, లో-లెవల్ మోటార్ కమాండ్‌లను ఉత్పత్తి చేస్తుంది.
  • LeRobot (Hugging Face) – ఇది రోబోట్ డెవలపర్‌ల కోసం మోడల్ శిక్షణ మరియు ఇంటిగ్రేషన్‌ను వేగవంతం చేసే డేటా రిపోజిటరీ మరియు టూల్‌సెట్‌ను అందిస్తుంది.
  • Pi-Zero (Physical Intelligence) – ఒకే "మెదడు"ను వివిధ రకాల రోబోట్ శరీరాలకు తిరిగి ఉపయోగించవచ్చని ఇది చెబుతుంది, తద్వారా విభిన్న హార్డ్‌వేర్‌ల కోసం సాఫ్ట్‌వేర్ స్టాక్‌లను సరళీకరిస్తుంది.

డేటా, సిమ్యులేషన్ మరియు డ్రిఫ్ట్ సమస్య

ఈ ఐదు మోడల్స్ భారీ డేటాసెట్‌లపై ఆధారపడి ఉంటాయి, వీటిలో చాలా వరకు సిమ్యులేటెడ్ వాతావరణాల నుండి వస్తాయి, ఎందుకంటే నిజ ప్రపంచంలో డేటాను సేకరించడం ఖరీదైనది మరియు ప్రమాదకరమైనది. ఈ ఆధారపడటం వల్ల "సిమ్-టు-రియల్" (sim-to-real) డ్రిఫ్ట్ ఏర్పడుతుంది: పరిపూర్ణమైన వర్చువల్ ప్రపంచాలలో నేర్చుకున్న ప్రవర్తనలు, నాయిస్ ఉన్న సెన్సార్లు, అసమానమైన వెలుతురు లేదా ఊహించని అడ్డంకులను ఎదుర్కొన్నప్పుడు విఫలమయ్యే అవకాశం ఉంది.