இயற்பியல் AI துறையின் எல்லை ஒரு மிகப்பெரிய தடையைச் சந்திக்கிறது: நமக்குத் தேவையான உயர்தர, நிஜ உலகப் பயிற்சித் தரவுகள் (high-fidelity, real-world training data) நம்மிடம் இல்லை. Large Language Models இணையத்தில் உள்ள உரைகளைத் திரட்டுவதன் மூலம் வளர்ந்தன; ஆனால் ரோபாட்டிக்ஸ் (robotics) துறைக்கு மிக அதிகச் செலவு பிடிக்கும் அணுகுமுறை தேவைப்படுகிறது.
ரோபாட்டிக்ஸில் தரவுத் தட்டுப்பாட்டுப் பிரச்சினை
மனித உருவ ரோபோக்கள் (humanoid robots) மற்றும் கிடங்கு ரோபோக்கள் (warehouse robots) மனிதர்களின் கைத்திறனுக்கு இணையாகச் செயல்பட, தற்போது இல்லாத அளவிலான ஒரு மிகப்பெரிய தரவுத் தொகுப்பு தேவைப்படுகிறது. Encord நிறுவனத்தின் ரோபோ கற்றல் துறைத் தலைவர் மற்றும் OpenAI-ன் ரோபோ ஆய்வகத்தின் மூத்த நிபுணரான வினீத் வேல்முருகன் கூறுகையில், ஒரு மிகப்பெரிய முன்னேற்றத்திற்கு YouTube-ன் ஒட்டுமொத்த வீடியோ தொகுப்பைப் போல ஐந்து மடங்கு பெரிய தரவுத் தொகுப்பு தேவை என்று கூறுகிறார்.
உரைத் தரவுகள் (Text) ஏராளமாக உள்ளன மற்றும் அவற்றை எளிதாகத் திரட்ட முடியும். ஆனால், இயற்பியல் தரவுகளை (Physical data) உற்பத்தி செய்ய வேண்டும். வீடியோ மூலம் மட்டும் பயிற்சி அளிப்பது, சிக்கலான செயல்பாடுகளுக்குத் தேவையான துல்லியத்தை (fidelity) வழங்குவதில் பெரும்பாலும் தோல்வியடைகிறது. எனவே, இந்தத் துறை தற்போது மாடல் கட்டமைப்பை (model architecture) மேம்படுத்துவதிலிருந்து மாறி, உயர்தரமான, குறிக்கப்பட்ட (annotated) இயற்பியல் தரவுகளை உற்பத்தி செய்யும் கடினமான சவாலைத் தீர்ப்பதில் கவனம் செலுத்தி வருகிறது.
வீடியோவைத் தாண்டி: மூளை அலைகள் மற்றும் தசை சிக்னல்களைப் பயன்படுத்துதல்
Encord போன்ற ஸ்டார்ட்அப்கள் ரோபோக்களுக்கு ஆழமான சூழலைப் புரிந்துகொள்ள புதிய தரவு முறைகளை (data modalities) சோதித்து வருகின்றன. ஜெர்மனியின் நரம்பியல் ஸ்டார்ட்அப் நிறுவனமான Zander Labs உடன் இணைந்து மேற்கொள்ளப்படும் ஒரு முன்னோடித் திட்டத்தில், Encord இயக்குபவர்களுக்கு மூளை அலைத் தலைக்கவசங்களை (brain-wave headsets) வழங்குகிறது. நரம்புச் செயல்பாடுகளை அளவிடுவதன் மூலம், ஒருவரின் நோக்கம் (intent), தவறு மற்றும் ஆச்சரியம் ஆகியவற்றை ஆராய்ச்சியாளர்கள் கண்டறிய முடியும் என்று நம்புகின்றனர்.
Zander நிறுவனத்தின் நரம்பியல் விஞ்ஞானியான லூகாஸ் கெர்க்கே கூறுகையில், மூளைச் செயல்பாட்டைக் கண்காணிப்பதன் மூலம், ஒரு கடினமான பணிக்காக ரோபோ எப்போது தனது மிகவும் சக்திவாய்ந்த கணக்கீட்டு மாடல்களைப் (computational models) பயன்படுத்த வேண்டும் என்பதை மாடல் உருவாக்குபவர்கள் துல்லியமாகத் தெரிந்துகொள்ள முடியும் என்கிறார்.
Encord மேலும் இவற்றை ஆராய்கிறது:
- Electromyography (EMG): முன்கையில் பொருத்தப்படும் சென்சார்கள் தசைகளில் உள்ள மின் சிக்னல்களைப் பதிவு செய்கின்றன. இது தலைக்கவச கேமராக்களால் கவனிக்க முடியாத கை அசைவுகளின் 3-D வரைபடத்தை உருவாக்குகிறது.
- Leader-Follower Rigs: இணைக்கப்பட்ட ரோபோடிக் கைகள், இதில் ஒன்று மனித இயக்குபவரைப் போலவே செயல்படும். திரவங்களை ஊற்றுவது அல்லது போக்கர் சிப்களை அடுக்கி வைப்பது போன்ற துல்லியமான செயல்களை இது பதிவு செய்கிறது.
- Dense Annotation: "வலது கை போல்ட்டை இறுக்குகிறது" போன்ற விரிவான குறிப்புகள். குறிப்பிட்ட பணிகளுக்கான பயிற்சியில், இந்த அடர்த்தியான குறிப்புகள் (dense annotation) சாதாரண வீடியோக்களை விட 100 மடங்கு அதிக மதிப்பு வாய்ந்தவை என்று வேல்முருகன் மதிப்பிடுகிறார்.
இயற்பியல் AI-ன் பொருளாதார யதார்த்தம்
டிஜிட்டல் சார்ந்த AI-லிருந்து இயற்பியல் AI-க்கு மாறுவது, மெஷின் லேர்னிங் (machine learning) பொருளாதாரத்தையே மாற்றியமைக்கிறது. LLM ஆய்வகங்கள் இணையத்திலிருந்து தரவுகளைப் பெறுவதன் மூலம் மிகக் குறைந்த செலவில் மாடல்களை உருவாக்கின. ஆனால், ரோபோ பயிற்சித் தரவுகளைத் தயாரிப்பதற்கு வன்பொருள் (hardware), மனித இயக்குபவர்கள் மற்றும் நுணுக்கமான குறிப்பீடு (annotation) ஆகியவை தேவைப்படுகின்றன. உயர்தரத் தரவுகளை அதன் மதிப்பை விட 20 மடங்கு செலவு குறைந்ததாக மாற்ற Encord இலக்கு வைத்துள்ளது, இருப்பினும் பெரிய அளவிலான ரோபோ கூட்டமைப்புகளுக்கு (robot fleets) இது பல மில்லியன் டாலர் மதிப்பிலான திட்டங்களாகவே அமைகிறது.
மிகப்பெரிய மற்றும் விரிவான குறிப்புகளைக் கொண்ட தரவுத் தொகுப்புகளை முதலில் உருவாக்கும் நிறுவனங்கள், ஈதர்நெட் கேபிள்களை இணைப்பது முதல் பொருட்களைத் தேர்ந்தெடுத்துப் பேக் செய்வது வரையிலான தன்னாட்சி செயல்பாடுகளில் (autonomous manipulation) ஆதிக்கம் செலுத்தும். வீடியோக்களை மட்டுமே நம்பியிருக்கும் நிறுவனங்கள், போட்டியாளர்கள் மனித உடல் மற்றும் மூளையிலிருந்து அதிகத் தரவுகளைப் பெறும் நிலையில் பின்தங்கும் அபாயம் உள்ளது.
முக்கியக் குறிப்புகள்
- தரவு உற்பத்தி vs. சேகரிப்பு: இணையத் தரவுகளைத் திரட்டும் LLM-களைப் போலன்றி, இயற்பியல் AI-க்கு அதிகத் துல்லியமான தரவுத் தொகுப்புகளை விலையுயர்ந்த முறையில் மனித முயற்சியுடன் உற்பத்தி செய்ய வேண்டியுள்ளது.
- நரம்பியல் முறைகள்: மூளை அலைகள் மற்றும் EMG ஆகியவற்றைச் சேர்ப்பதன் மூலம், வீடியோக்களை விட மனிதனின் நோக்கம், தவறு மற்றும் 3-D கை அசைவுகளை ரோபோக்களால் சிறப்பாகப் புரிந்துகொள்ள முடியும்.
- அளவின் சவால்: ரோபாட்டிக்ஸ் மாடல்களுக்கு YouTube ஆவணத்தை விடப் பெரிய தரவுத் தொகுப்பு தேவைப்படுகிறது; தரவு உற்பத்தியே இப்போது முதன்மையான வணிக எல்லையாக உள்ளது.
இயற்பியல் AI-க்கான உயர்தரப் பயிற்சித் தரவுகளைப் பெற, இயக்குபவர்களுக்கு மூளை அலைத் தலைக்கவசங்கள் மற்றும் முன்கை EMG சென்சார்களை வழங்கும் ஒரு முன்னோடித் திட்டத்தை Encord, ஜெர்மனியின் நரம்பியல் ஸ்டார்ட்அப் நிறுவனமான Zander Labs உடன் தொடங்கியுள்ளது. இந்தத் கூட்டாண்மை, YouTube வீடியோக்களின் மொத்த அளவை விட ஐந்து மடங்கு பெரிய தரவுத் தொகுப்பை உருவாக்குவதை நோக்கமாகக் கொண்டுள்ளது. ரோபோக்கள் மனிதத் திறனை அடைய இந்த அளவிலான தரவு தேவை என்றும், இது ரோபாட்டிக்ஸ் கற்றல் முறையையே மாற்றியமைக்கும் என்றும் ஆராய்ச்சியாளர்கள் கூறுகின்றனர்.
ரோபாட்டிக்ஸ் தரவு ஏன் ஒரு தடையாக உள்ளது
Large language models இணையத்திலிருந்து தரவுகளைத் திரட்டுவதன் மூலம் வளர்ந்தன; அந்த மூலப்பொருள் ஏராளமாகவும் மலிவாகவும் இருந்தது. ஆனால், இதற்கு நேர்மாறாக, இயற்பியல் AI-க்கு உற்பத்தி செய்யப்பட்ட தரவுகள் தேவைப்படுகின்றன. ஒவ்வொரு பிடி (grasp), திருப்புதல் (twist) அல்லது ஊற்றுதல் (pour) போன்ற செயல்களும் பதிவு செய்யப்பட்டு, குறிக்கப்பட்டு, அவற்றைச் செய்த விசைகள் மற்றும் நோக்கங்களுடன் இணைக்கப்பட வேண்டும். சாதாரண வீடியோக்கள் சிக்கலான செயல்பாடுகளுக்குத் தேவையான நுணுக்கமான குறிப்புகளைத் தருவதில்லை, இது இன்றைய மாடல்களுக்கும் தொழிற்சாலைகள், கிடங்குகள் மற்றும் வீடுகளின் தேவைகளுக்கும் இடையே ஒரு இடைவெளியை ஏற்படுத்துகிறது.
Encord நிறுவனத்தின் ரோபோ கற்றல் துறைத் தலைவர் மற்றும் முன்னாள் OpenAI ரோபோ ஆய்வக நிபுணரான வினீத் வேல்முருகன் கூறுகையில், YouTube வீடியோ தொகுப்பைப் போல ஐந்து மடங்கு பெரிய தரவுத் தொகுப்பு உருவாகும் வரை இந்தத் துறை முன்னேறாது என்கிறார். பிரச்சினை இப்போது மாடல் கட்டமைப்பல்ல; தரவை எவ்வாறு உற்பத்தி செய்வது என்பதே ஆகும்.
மூளை அலைகள் மற்றும் தசை சிக்னல்களைச் சேர்த்தல்
காட்சிப் பதிவுகளுடன் உடலியல் சிக்னல்களையும் (physiological signals) சேர்ப்பதன் மூலம் அந்த இடைவெளியை நிரப்ப Encord-Zander முன்னோடித் திட்டம் முயல்கிறது. இயக்குபவர்கள் மூளையின் மின் செயல்பாடான எலக்ட்ரோஎன்செபலொகிராபி (EEG) சாதனங்களை அணிந்துள்ளனர், அதே நேரத்தில் முன்கையில் உள்ள EMG சென்சார்கள் தசைத் தூண்டுதல்களைப் பிடிக்கின்றன. இதன் நோக்கம், நோக்கம் (intent), ஆச்சரியம் அல்லது பிழை போன்ற மன நிலைகளைக் கண்டறிவதும், வெறும் வீடியோவால் மட்டுமே செய்ய முடியாத கைகளின் இயக்கத்தை முப்பரிமாண வரைபடமாக (three-dimensional map) மாற்றவும் ஆகும்.
Zander நிறுவனத்தின் நரம்பியல் விஞ்ஞானி Lucas Gehrke விளக்குவதாவது, ஒரு மனிதன் ஒரு கடினமான துணைப் பணியை (sub-task) எப்போது எதிர்பார்க்கிறான் என்பதைத் தெரிந்துகொள்வதன் மூலம், ஒரு ரோபோ தனது மிகவும் சக்திவாய்ந்த கணக்கீட்டு மாதிரிகளை (computational models) சரியான நேரத்தில் பயன்படுத்திக்கொள்ள முடியும்.
நரம்பியல் தரவுகளுக்கு அப்பால், Encord சில கூடுதல் நுட்பங்களைச் சோதிக்கிறது:
- Electromyography (EMG): முன்கையில் உள்ள சென்சார்கள் தசைச் செயல்பாட்டின் நேரடித் தகவல்களைத் தருகின்றன, இது தலைக்கவச கேமராக்களால் பெரும்பாலும் கவனிக்க முடியாத விரல்களின் இயக்கப் பாதைகளை (finger trajectories) துல்லியமாக மறுசீரமைக்க உதவுகிறது.
- Leader-follower rigs: ஒரு ஜோடி ரோபோடிக் கைகள் இணைந்து செயல்படுகின்றன, அதில் ஒன்று மனித இயக்குபவரின் இயக்கங்களைப் பிரதிபலிக்கிறது. திரவங்களை ஊற்றுவது, சிப்ஸ்களை அடுக்கி வைப்பது போன்ற மில்லிமீட்டர் அளவிலான பிழைகள் கூட முக்கியமான நுணுக்கமான பணிகளை இது படம்பிடிக்கிறது.
- Dense annotation: உயர்நிலைச் செயல்களை மட்டும் லேபிளிடுவதற்குப் பதிலாக, Velmurugan-இன் குழு "வலது கை போல்ட்டை இறுக்குகிறது" போன்ற நுணுக்கமான விளக்கங்களைச் சேர்க்கிறது. வெறும் எகோ-சென்ட்ரிக் (ego-centric) வீடியோவை விட, ஒரு குறிப்பிட்ட கையாளுதல் திறனை (manipulation skill) பயிற்றுவிப்பதற்கு இந்தத் தகவல் சுமார் 100 மடங்கு அதிக மதிப்புடையது என்று அவர் மதிப்பிடுகிறார்.
தரவு உற்பத்தியின் பொருளாதாரம்
Physical AI என்பது இயந்திரக் கற்றலின் (machine learning) நிதி சார்ந்த கணக்கீடுகளை மாற்றுகிறது. இணையத்தில் முடிவில்லாத உரைத் தரவுகள் கிடைப்பதால், LLM ஆய்வகங்கள் மிகக் குறைந்த கூடுதல் செலவில் (near-zero marginal cost) மாதிரிகளை உருவாக்கின. இருப்பினும், ரோபோ பயிற்சித் தரவைத் தயாரிப்பதற்கு வன்பொருள் (hardware), மனித இயக்குபவர்கள் மற்றும் கடினமான அனோடேஷன் (annotation) தேவைப்படுகிறது. வாடிக்கையாளர்களுக்குத் தரப்படும் மதிப்பை விட, உயர்தரத் தரவை 20 மடங்கு அதிக செலவு குறைந்ததாக மாற்றுவதே Encord-இன் உள் இலக்காகும். ஆனால், அந்தத் தீவிரமான செயல்திறன் கூட, பெரிய அளவிலான ரோபோ கூட்டமைப்புகளுக்கான (robot fleets) பல மில்லியன் டாலர் திட்டங்களாகவே மாறுகிறது.
இதில் உள்ள முக்கியத்துவம் தெளிவானது: மிகப்பெரிய மற்றும் விரிவான அனோடேஷன் செய்யப்பட்ட தரவுத்தொகுப்புகளை (datasets) முதலில் உருவாக்கும் நிறுவனங்கள், தன்னாட்சி கையாளுதலுக்கான (autonomous manipulation) வளர்ந்து வரும் சந்தையை ஆதிக்கம் செலுத்தும்—அது டேட்டா சென்டர் தரையில் ஈதர்நெட் கேபிள்களை இணைப்பதாக இருந்தாலும் சரி அல்லது விநியோக மையத்தில் பொருட்களைத் தேர்ந்தெடுத்துப் பேக் செய்வதாக இருந்தாலும் சரி. போட்டியாளர்கள் மனித உடல் மற்றும் மூளையிலிருந்து அதிகத் தரவுகளைப் பெறத் தொடங்கும் போது, வீடியோ-மட்டும் சார்ந்திருக்கும் நிறுவனங்கள் பின்தங்கும் அபாயம் உள்ளது.
முரண்பட்ட கருத்துக்கள் மற்றும் திறந்த கேள்விகள்
நரம்பியல் சிக்னல்கள் தான் விடுபட்ட பகுதி என்று அனைவரும் நம்பவில்லை. வீடியோ மற்றும் ஃபோர்ஸ்-டார்க் (force-torque) சென்சார்கள் ஏற்கனவே பல தொழில்துறை பணிகளுக்குச் சிறந்த செயல்திறனைத் தரும்போது, கூடுதல் வன்பொருள் சிக்கல்கள் அதன் நன்மைகளை விட அதிகமாக இருக்கலாம் என்று விமர்சகர்கள் வாதிடுகின்றனர். அளவிடுதல் (Scalability) என்பது மற்றொரு கவலை: ஆயிரக்கணக்கான இயக்குபவர்களுக்கு EEG ஹெட்செட்கள் மற்றும் EMG கருவிகளை வழங்குவது சிறிய உற்பத்தியாளர்களுக்குச் சாத்தியமற்றதாக இருக்கலாம்.
தரவு உருவாக்கும் முறை (data-generation pipeline) இன்னும் அதிக உழைப்பைச் சார்ந்து உள்ளது. Leader-follower கருவிகள் இருந்தாலும், ஒரு உண்மையான பொதுவான ரோபோவிற்குத் தேவையான பணிகளின் பரப்பளவைப் படம்பிடிக்க பல ஆய்வகங்கள் மற்றும் தொழிற்சாலைகளிடையே தொடர்ச்சியான, ஒருங்கிணைந்த முயற்சி தேவைப்படும். இந்தச் சிறு முன்னேற்றங்கள் ஆரம்பக்கட்ட முதலீட்டிற்குத் தகுதியானதா என்பதைச் சந்தையே தீர்மானிக்க வேண்டும்.
அடுத்து கவனிக்க வேண்டியவை
- தரவு அளவு மைல்கற்கள் (Data volume milestones): யூடியூப் அளவை விட ஐந்து மடங்கு பெரிய தரவுத்தொகுப்பு உள்ளது என்ற Encord-இன் கூற்று ஒரு முக்கிய அளவுகோலாக இருக்கும். அது வெளிப்படுத்தப்படும்போது, மற்ற நிறுவனங்கள் அதைச் சமன் செய்ய அல்லது முந்துவதற்கு ஒரு தெளிவான இலக்கைப் பெறும்.
- வன்பொருள் பயன்பாட்டு விகிதங்கள் (Hardware adoption rates): தரவு சேகரிப்பு கருவிகளில் EEG மற்றும் EMG சாதனங்கள் எந்த வேகத்தில் தரநிலையாக மாறுகின்றன என்பது, இந்த அணுகுமுறை சோதனைத் திட்டங்களைத் தாண்டி விரிவடையுமா என்பதைக் காட்டும்.
- செலவு அளவீடுகள் (Cost metrics): Encord வாக்குறுதி அளித்த 20 மடங்கு செலவுச் சிக்கனத்தை நிரூபிக்க முடிந்தால், அது மாடல் வடிவமைப்பிற்குப் பதிலாக "தரவு உற்பத்தி" (data manufacturing) என்பதில் கவனம் செலுத்தும் புதிய நிறுவனங்களின் வருகையைத் தூண்டும்.
- செயல்திறன் இடைவெளிகள் (Performance gaps)
