Google DeepMind નું RT-2, Stanford-Toyota નું OpenVLA, NVIDIA નું GR00T, Hugging Face નું LeRobot અને Physical Intelligence નું Pi-Zero રોબોટ્સને એક જ મોડેલમાં વિઝ્યુઅલ ઇનપુટ, લેંગ્વેજ કમાન્ડ્સ અને મોટર એક્શન્સને જોડવાની ક્ષમતા આપે છે. આ ક્ષમતા હેન્ડ-કોડેડ સ્ટેપ સિક્વન્સને બદલે "જુઓ-અને-કરો" (see-and-do) પ્રકારના વર્તન દ્વારા બદલે છે, જે ઝડપી વિકાસ અને રોબોટિક્સ સુધી વ્યાપક પહોંચનું વચન આપે છે.

વિઝન-લેંગ્વેજ-એક્શન શા માટે મહત્વનું છે

રોબોટિક્સના મોટાભાગના ઇતિહાસમાં, એન્જિનિયરો સ્પષ્ટ સ્ક્રિપ્ટ્સ લખતા હતા જે રોબોટને દરેક સાંધાના હલનચલન (joint movement) વિશે જણાવતી હતી. વિઝન-લેંગ્વેજ-એક્શન (VLA) મોડેલ્સનો નવો વર્ગ રોબોટને વાતચીત કરતા એજન્ટ (conversational agent) તરીકે જુએ છે: કેમેરા દ્વારા ઇમેજ સ્ટ્રીમ થાય છે, વપરાશકર્તા વિનંતી બોલે છે અથવા ટાઇપ કરે છે, અને મોડેલ તેને પૂર્ણ કરવા માટે જરૂરી મોટર કમાન્ડ્સ આપે છે.

હાલમાં ઉપલબ્ધ પાંચ મોડેલ્સ

  • RT-2 (Google DeepMind) – કાચા વિઝ્યુઅલ સ્ટ્રીમ્સને માનવ ભાષા સાથે જોડે છે, જેનાથી રોબોટ તે શું જુએ છે તેનું વર્ણન કરી શકે છે અને બોલાયેલા નિર્દેશો પર કાર્ય કરી શકે છે.
  • OpenVLA (Stanford + Toyota) – એક ઓપન-સોર્સ રિલીઝ જે કોઈપણ ડેવલપરને આ મોડેલને તેમના પોતાના હાર્ડવેરમાં પ્લગ કરવાની સુવિધા આપે છે.
  • GR00T (NVIDIA) – હ્યુમનોઇડ પ્લેટફોર્મ્સ માટે બનાવવામાં આવ્યું છે, તે દ્રશ્ય વિશે તર્ક કરે છે અને લો-લેવલ મોટર કમાન્ડ્સ જનરેટ કરે છે.
  • LeRobot (Hugging Face) – ડેટા રિપોઝિટરી અને ટૂલસેટ પૂરા પાડે છે જે રોબોટ ડેવલપર્સ માટે મોડેલ ટ્રેનિંગ અને ઇન્ટિગ્રેશનને ઝડપી બનાવે છે.
  • Pi-Zero (Physical Intelligence) – જણાવે છે કે એક જ "મગજ" (brain) નો ઉપયોગ વિવિધ રોબોટ બોડીઝમાં ફરીથી કરી શકાય છે, જે વિવિધ હાર્ડવેર માટે સોફ્ટવેર સ્ટેક્સને સરળ બનાવે છે.

ડેટા, સિમ્યુલેશન અને ડ્રિફ્ટની સમસ્યા

પાંચેય મોડેલ્સ વિશાળ ડેટાસેટ્સ પર આધારિત છે, જેમાંથી મોટાભાગના સિમ્યુલેટેડ વાતાવરણમાંથી આવે છે કારણ કે વાસ્તવિક દુનિયામાંથી ડેટા એકત્રિત કરવો ખર્ચાળ અને જોખમી છે. આ નિર્ભરતા "sim-to-real" ડ્રિફ્ટ પેદા કરે છે: સંપૂર્ણ વર્ચ્યુઅલ દુનિયામાં શીખેલા વર્તનો નોઈઝી સેન્સર્સ, અસમાન લાઇટિંગ અથવા અણધાર્યા અવરોધોનો સામનો કરતી વખતે નિષ્ફળ જઈ શકે છે.