ஒரு குறுக்கு-முறை அறிவு-வடித்தெடுப்பு (cross-modal knowledge-distillation) கட்டமைப்பு, பல்மொழிப் பணியாளர்களுக்கான மென்மையான ரோபோட்டிக்ஸ் (soft-robotics) பராமரிப்பு நேரத்தை 34% குறைத்தது, அதன் inference engine அளவை 60% சுருக்கியது மற்றும் 45 மில்லி விநாடிகளுக்கும் குறைவான நேரத்தில் அறிவுறுத்தல்களை வழங்கியது. இந்த முன்னேற்றம் முக்கியமானது, ஏனெனில் நெகிழ்வான பாலிமர்கள் மற்றும் திரவச் செயல்பாட்டிகளால் (fluidic actuators) உருவாக்கப்பட்ட மென்மையான ரோபோக்கள், உற்பத்தி, மருத்துவக் கருவிகள் மற்றும் அபாயகரமான இடங்கள் எனப் பரவி வருகின்றன; இருப்பினும், மொழித் தடைகள் மற்றும் துண்டு துண்டான சென்சார் தரவுகள் அவற்றின் பராமரிப்பைத் தடுத்து வருகின்றன.
மென்மையான ரோபோட்டிக்ஸ் பராமரிப்பு ஏன் ஒரு மல்டிமோடல் (multimodal) சிக்கலாகும்
மென்மையான ரோபோக்கள் உலோகக் கைகளிலிருந்து வேறுபட்டவை: எலாஸ்டோமர்கள், சிலிகான் தோல்கள் மற்றும் உள்ளமைக்கப்பட்ட சேனல்கள் திரவங்களை இறைக்கின்றன. ஒரு மென்படலத்திலுள்ள விரிசல், நியூமேடிக் குழாயில் கசிவு அல்லது பம்பின் சத்தத்தில் ஏற்படும் நுட்பமான மாற்றம் ஆகியவை அனைத்தும் உடனடித் தோல்வியின் அறிகுறிகளாக இருக்கலாம். அந்த அறிகுறிகளைக் கண்டறிய ஒன்றுக்கும் மேற்பட்ட தரவு ஆதாரங்கள் தேவைப்படுகின்றன.
- காட்சி (Visual) தரவுகள் மேற்பரப்பு உருமாற்றங்கள் அல்லது நிறமாற்றங்களைக் காட்டுகின்றன.
- தொடு உணர்வு (Tactile) சென்சார்கள் எதிர்பாராத நெகிழ்வுத்தன்மை அல்லது வழுக்கலைக் குறிக்கின்றன.
- ஒலி (Acoustic) மைக்ரோஃபோன்கள் அசாதாரண பம்ப் அதிர்வெண்களைப் பதிவு செய்கின்றன.
- மொழிசார் (Linguistic) உள்ளீடுகள் பழுதுபார்க்கும் நடைமுறைகளைத் தொழில்நுட்ப வல்லுநரின் தாய்மொழியில் வழங்குகின்றன.
ஒரு ஸ்பானிஷ் பேசும் பணியாளர் ஒரு சாதாரண மொழிபெயர்ப்பு மாதிரியிலிருந்து ஆங்கிலம் மட்டுமே கொண்ட அறிவுறுத்தல்களைப் பின்பற்றியபோது, அந்த மாதிரி உரையைச் சரியாக மொழிபெயர்த்தது, ஆனால் வளரும் விரிசலின் காட்சித் தகவலைக் கவனிக்கத் தவறிவிட்டது. இதனால் பழுதுபார்ப்பு தாமதமானது மற்றும் இயந்திரத்தை நிறுத்தியது பண இழப்பை ஏற்படுத்தியது. இந்தச் சம்பவம் மூன்று ஒன்றோடொன்று இணைக்கப்பட்ட சவால்களை வெளிப்படுத்தியது: ஒத்திசைவற்ற முறைகள் (mismatched modalities), நேரடி மொழிபெயர்ப்பிற்குப் பொருந்தாத தொழில்நுட்பச் சொற்கள் மற்றும் நேரடித் தொழிற்சாலைத் தளத் தகவல் (real-time shop-floor feedback) தேவைப்படுதல்.
குறுக்கு-முறை அறிவு வடித்தெடுப்பு (cross-modal knowledge distillation) எவ்வாறு செயல்படுகிறது
ஆராய்ச்சியாளர்கள் ஒரு பெரிய அளவிலான (monolithic) AI-க்கு பதிலாக, ஒவ்வொரு முறையிலும் நிபுணத்துவம் பெற்ற "ஆசிரியர்" (teacher) மாதிரிகளின் தொகுப்பையும், அவற்றின் நுண்ணறிவுகளை ஒருங்கிணைக்கும் ஒரு இலகுவான "மாணவர்" (student) மாதிரியையும் பயன்படுத்தினர். இந்தச் செயல்முறை மூன்று நிலைகளைக் கொண்டுள்ளது:
- முறை சார்ந்த ஆசிரியர்கள் (Modality-specific teachers) – பார்வை, ஒலி மற்றும் உரைத் தொகுப்புகளில் (corpora) பயிற்சி பெற்ற தனித்தனி நரம்பியல் வலைப்பின்னல்கள் (neural networks). பார்வை ஆசிரியர் விரிசல்களைக் கண்டறிகிறார், ஒலி ஆசிரியர் அசாதாரண பம்ப் சத்தங்களைக் குறிக்கிறார், மொழி ஆசிரியர் தொழில்நுட்ப கையேடுகளைப் பகுப்பாய்வு செய்கிறார்.
- ஒத்திசைவு தொகுதி (Alignment module) – மாறுபட்ட வெளியீடுகளை ஒரு பொதுவான எம்பெடிங் ஸ்பேஸில் (embedding space) கொண்டு செல்லும் ஒரு நரம்பியல் பாலம். 'Contrastive learning' முறை, உதாரணமாக, ஒரு காட்சி விரிசலை அதன் ஒலித் தன்மையுடன் தொடர்புபடுத்தச் செய்கிறது, இதனால் எம்பெடிங்க்கள் குறுக்கு-முறைப் பொருளைப் (cross-modal semantics) பிடிக்கின்றன.
- பல்மொழி மாணவர் மாதிரி (Multilingual student) – ஒத்திசைவு செய்யப்பட்ட எம்பெடிங்குகளைப் பயன்படுத்தி, ஆதரிக்கப்படும் எந்தவொரு மொழியிலும் பழுதுபார்க்கும் அறிவுறுத்தல்களை உருவாக்கும் ஒரு சிறிய மாதிரி. ஒரு துறை சார்ந்த அறிவு வரைபடம் (knowledge graph), “pneumatic diaphragm” அல்லது “hydrogel actuator” போன்ற நுணுக்கமான சொற்களுக்குச் சரியான மொழிபெயர்ப்புகளை வழங்குகிறது.
குவாண்ட்டைசேஷன் (Quantization)—எடைத் துல்லியத்தைக் குறைத்தல்—மாணவர் மாதிரியின் அளவை 60% குறைக்கிறது, இது குறைந்த கணக்கீட்டுத் திறன் கொண்ட எட்ஜ் (edge) சாதனங்களில் இயங்க அனுமதிக்கிறது. இதன் விளைவாகக் கிடைக்கும் 45 மில்லி விநாடி inference தாமதம், நேரடி கேமரா காட்சியைப் பார்த்தபடி பம்ப் சத்தங்களைக் கவனிக்கும் ஒரு பணியாளரின் நேரடித் தேவைகளைப் பூர்த்தி செய்கிறது.
செயல்திறன் முன்னேற்றங்கள் மற்றும் நிஜ உலகத் தாக்கம்
இந்தக் கட்டமைப்பு ஒரு கூட்டாளர் நிறுவனத்தில் சோதனை செய்யப்பட்டது.
- நேர சேமிப்பு: காட்சி மற்றும் ஒலி அசாதாரணங்களை ஒன்றாகக் காட்டும் உடனடி, மொழிக்கு ஏற்ற வழிகாட்டுதல்களால், பல்மொழிப் பணியாளர்கள் வழக்கமான சோதனைகளை 34% வேகமாக முடித்தனர்.
சென்சார் தரவுகளை மொழிச் செயலாக்கத்துடன் இணைப்பதன் மூலம், மென்மையான ரோபோட்டிக்ஸ் பராமரிப்பைத் தற்காப்பு முறையிலிருந்து (reactive) முன்னறிவிப்பு முறைக்கு (predictive) மாற்ற முடியும் என்பதை இந்த எண்கள் காட்டுகின்றன.
சாத்தியமான குறைபாடுகள்
இந்த அணுகுமுறை, ஒரு பெரிய மாதிரியின் எளிமைக்கு பதிலாக, ஆசிரியர்கள் மற்றும் ஒரு ஒத்திசைவு அடுக்கின் (alignment layer) சிக்கலான ஒருங்கிணைப்பைத் தேர்ந்தெடுக்கிறது. பல நிபுணத்துவ மாதிரிகளைப் பராமரிப்பதற்கு ஒவ்வொரு முறைக்கும் அதிகப்படியான பயிற்சித் தரவுகளும், கவனமான பதிப்பு கட்டுப்பாடும் (version control) தேவைப்படுகிறது.
அடுத்து என்ன
முக்கியக் கருத்து: ஒரு சிறிய பல்மொழி மாதிரி பார்வை, ஒலி மற்றும் உரை ஆகியவற்றை ஒன்றாகக் கேட்கக் கற்றுக்கொள்வது, பொறியாளர்கள் பராமரிப்பு சுழற்சிகளைக் குறைக்க வழிவகுக்கிறது மற்றும் மென்மையான ரோபோட்டிக்ஸின் நம்பகத்தன்மையை பல்வேறு பணியாளர்களுக்குக் கொண்டு சேர்க்கிறது. பெரியதாக இல்லாமல், புத்திசாலித்தனமாக இருக்கும் AI மட்டுமே மொழி இடைவெளிகளையும் சென்சார் தனிமைப்படுத்தல்களையும் (sensor silos) நேரலையில் இணைக்க முடியும் என்பதை இந்த முறை நிரூபிக்கிறது.
