ஃபெய்-ஃபெய் லி (Fei-Fei Li) மற்றும் யுன்சு லி (Yunzhu Li) ஆகியோர் சமீபத்திய a16z பாட்காஸ்டில், World Labs ஒரு “real-to-sim-to-real” வழிமுறையை (pipeline) அறிமுகப்படுத்துவதாகக் கூறினர். இது ரோபோக்கள் ஒரு நிஜமான தரையைத் தொடுவதற்கு முன்பே, உயர் துல்லியமான டிஜிட்டல் ட்வின்ஸ் (digital twins) மூலம் இடஞ்சார்ந்த பணிகளைக் (spatial tasks) கற்றுக்கொள்ள அனுமதிக்கிறது. இந்த அணுகுமுறை ரோபோ பயிற்சித் தரவுகளைச் சேகரிப்பதற்கான செலவு மற்றும் அபாயத்தைக் குறைக்கிறது; இது பல தானியங்கித் திட்டங்களை ஆய்வகத்திலேயே முடக்கி வைத்திருந்த ஒரு தடையாகும்.
ரோபோக்களுக்கு மொழியைத் தாண்டிய அறிவு ஏன் தேவை
பெரிய மொழி மாதிரிகளால் (Large language models) இணையத்திலுள்ள அனைத்து உரையையும் சேகரிக்க முடியும், ஆனால் ஒரு ரோபோ வெறும் வீடியோக்களைப் பார்த்து அதில் காண்பதை அப்படியே நகலெடுக்க முடியாது. ஒரு கிடங்கிற்குள் (warehouse) நகர அல்லது ஒரு ஹோட்டல் அறையைச் சுத்தம் செய்ய, ஒரு ரோபோ முப்பரிமாண வடிவியல் (three-dimensional geometry), மேற்பரப்புப் பண்புகள் (surface properties) மற்றும் தள்ளுதல், தூக்குதல் மற்றும் அடுக்கி வைத்தல் போன்ற இயற்பியல் விதிகளைப் புரிந்துகொள்ள வேண்டும். இவைதான் “இடஞ்சார்ந்த நுண்ணறிவின்” (spatial intelligence) கூறுகள், மேலும் இவற்றை நிஜ உலகில் பெரிய அளவில் சேகரிப்பது கடினம்.
தரவுத் தடை (The data bottleneck)
நிஜ உலக ரோபோ தரவுகளைச் சேகரிப்பது மெதுவானது, செலவு மிக்கது மற்றும் சில நேரங்களில் ஆபத்தானது. ஒரு சிறிய தவறு கூட வன்பொருளை (hardware) சேதப்படுத்தலாம், உற்பத்தித் தொடரை நிறுத்தலாம் அல்லது ஒரு மனிதத் தொழிலாளியை காயப்படுத்தலாம். இதன் காரணமாக, பெரும்பாலான ரோபோட்டிக்ஸ் குழுக்கள் அன்றாடச் சூழல்களின் பன்முகத்தன்மையை உள்ளடக்காத சிறிய, கைவினைத் தரவுத் தொகுப்புகளை (hand-crafted datasets) மட்டுமே நம்பியிருக்கின்றன.
World Labs ஒருங்கிணைக்கப்பட்ட டிஜிட்டல் உலகங்களை உருவாக்குவதன் மூலம் இந்தத் தடையைத் தவிர்க்கிறது. அவர்களின் SceniX அமைப்பு ஒரு இயற்பியல் இடத்தைப் படியெடுத்து, அதன் வடிவியல் (சுவர்கள் மற்றும் பொருட்களின் வடிவம்), தோற்றம் (அமைப்பு, நிறங்கள், ஒளி அமைப்பு) மற்றும் இயற்பியல் (பொருட்களைத் தள்ளும்போது அவை எவ்வாறு நகர்கின்றன) ஆகியவற்றைத் தக்கவைக்கும் ஒரு உருவகப்படுத்துதலாக (simulation) மாற்றுகிறது. ரோபோ அந்த மெய்நிகர் நகலில் பயிற்சி பெறுகிறது, பின்னர் அதே கொள்கைகள் (policies) நிஜச் சூழலுக்கு மாற்றப்படுகின்றன.
வீடியோ மாதிரிகள் போதுமானவை அல்ல
உயர் தெளிவுத்திறன் கொண்ட வீடியோ ஜெனரேட்டர்கள் (video generators) இயற்பியல் உருவகப்படுத்துதலுக்குப் பதிலாகப் பயன்படலாம் என்று சில ஆராய்ச்சியாளர்கள் வாதிடுகின்றனர். அந்த மாதிரிகளால் ஒரு ரோபோவின் பார்வையில் இருந்து நம்பத்தகுந்த காட்சிகளை உருவாக்க முடியும், ஆனால் அவற்றுக்கு நிலையான இயற்பியல் அறிவு இல்லை. ஒரு உருவகப்படுத்தப்பட்ட வீடியோவில், ஒரு கோப்பையைத் தள்ளிய பிறகு அது மறைந்து போவது போன்ற காட்சி இருந்தால், அந்த வீடியோவைக் கொண்டு பயிற்சி பெற்ற ரோபோ தவறான காரண-காரியத் தொடர்பைக் (cause-and-effect relationship) கற்றுக்கொள்ளும். World Labs-இன் வழிமுறை, காலம், இடம் மற்றும் தொடர்புகளுக்கு இடையே சீரான தன்மையுடன் இருக்கும் உலகங்களை வலியுறுத்துகிறது, இதன் மூலம் ரோபோவின் “தசை நினைவாற்றல்” (muscle memory) நிஜ உலக இயற்பியலோடு ஒத்துப்போவதை உறுதி செய்கிறது.
பகுதி-கட்டமைக்கப்பட்ட இடங்களை இலக்கு வைத்தல்
இந்தத் குழு நாளை ஒரு வரவேற்பறையில் உலாவிக் கொண்டிருக்கும் மனித உருவ உதவியாளர்களை (humanoid assistants) உருவாக்குவதை நோக்கமாகக் கொண்டிருக்கவில்லை. மாறாக, ஒரு டிஜிட்டல் ட்வின் துல்லியமாக இருப்பதற்குத் தேவையான கணிப்புத்தன்மையுடன் கூடிய, அதே சமயம் உண்மையான இடஞ்சார்ந்த பகுத்தறிவை (spatial reasoning) கோரும் மாறுபட்ட தன்மையுள்ள பகுதி-கட்டமைக்கப்பட்ட சூழல்களில் (semi-structured environments) அவர்கள் கவனம் செலுத்துகின்றனர். உதாரணங்கள்:
- அலமாரிகள் மற்றும் பலகைகளில் (pallets) பொருட்கள் சேமிக்கப்படும் கிடங்குகள்
- மேஜைகள், நாற்காலிகள் மற்றும் நகரும் பணியாளர்களைக் கொண்ட உணவகங்கள்
- தாழ்வாரங்கள், அறைகள் மற்றும் சேவை வண்டிகளைக் கொண்ட ஹோட்டல்கள்
- இயந்திரங்கள், கன்வேயர்கள் (conveyors) மற்றும் பாதுகாப்புத் தடுப்புகள் கொண்ட தொழில்முறை இடங்கள்
வணிக நிறுவனங்கள் ஏற்கனவே தானியங்கி முறைகளைக் கோரும் இடங்கள் இவைதான். பாட்காஸ்டில் குறிப்பிடப்பட்ட சமீபத்திய ஆய்வின்படி, கோரப்படும் ரோபோ பணிகளில் மூன்றில் ஒரு பங்கு சுத்தம் செய்வதைச் சார்ந்தது—இது மனிதர்கள் இயந்திரங்களிடம் ஒப்படைக்க விரும்பும் மீண்டும் மீண்டும் செய்ய வேண்டிய, விரும்பத்தகாத வேலையாகும்.
வெற்றி எப்படி இருக்கும்
World Labs-இன் அடுத்தகட்டத் திட்டம் (roadmap), அடுத்த இரண்டு ஆண்டுகளில் குறிப்பிட்ட தொழில்துறைகளில் இந்த வழிமுறையை நிரூபிப்பதில் உள்ளது. ஒரு ரோபோ உருவகப்படுத்தப்பட்ட கிடங்கில் ஒரு பலகையைத் (pallet) திரும்பத் திரும்ப நகர்த்த முடிகிறது மற்றும் மறுபயிற்சி இன்றி நிஜமான வசதியிலும் அதையே செய்ய முடிகிறது என்றால், “நம்பகமான உருவகப்படுத்துதல், நம்பகமான ரோபோக்களுக்கு வழிவகுக்கும்” என்பதை அந்த மாதிரி நிரூபித்துள்ளது என்று அர்த்தம். அந்த நம்பகத்தன்மை பெரிய ஒப்பந்தங்களைப் பெறவும், டிஜிட்டல் ட்வின் உருவாக்கத்திற்கான ஆரம்ப முதலீட்டை நியாயப்படுத்தவும் உதவும்.
அடுத்து கவனிக்க வேண்டியவை
- தொழில்துறை முன்னோடித் திட்டங்கள் (Industry pilots) – கிடங்குகள் அல்லது ஹோட்டல்களில் மேற்கொள்ளப்படும் முதல் சில பயன்பாடுகள், நடைமுறையில் மட்டுமே தோன்றும் சிக்கலான விளிம்பு நிலைச் சூழல்களை (edge cases) இந்த வழிமுறை கையாள முடியுமா என்பதை வெளிப்படுத்தும்.
இதன் அடிப்படை யோசனை எளிமையானது: ரோபோக்கள் மேடைக்கு வருவதற்கு முன், அவற்றுக்கு ஒரு சிறந்த பயிற்சித் தளத்தை (rehearsal space) வழங்குவது. World Labs அந்தப் பயிற்சியை நிலையான செயல்பாடாக மாற்ற முடிந்தால், ரோபோட்டிக்ஸில் உள்ள மிகக் கடினமான சிக்கலான—இயந்திரங்கள் இயற்பியல் உலகத்தைப் புரிந்துகொண்டு செயல்படக் கற்றுக்கொள்வது—இதற்கு இறுதியாக ஒரு நடைமுறைத் தீர்வு கிடைக்கக்கூடும்.
