ஆராய்ச்சியாளர்கள் ReBA routing என்ற ஒரு வடிவியல் சார்ந்த டோக்கன்-ரூட்டிங் முறையை அறிமுகப்படுத்தியுள்ளனர். இது மல்டிமோடல் மிக்சர்-ஆஃப்-எக்ஸ்பர்ட்ஸ் (MoE) மாடல்களில் காட்சி (visual) மற்றும் உரை (textual) டோக்கன்களை சமநிலையில் வைக்கிறது. ஆரம்பகால சோதனைகள், படத்தின் தெளிவுத்திறன் (resolution) அதிகரிக்கப்படும்போது, வழக்கமான ரூட்டர்கள் தடுமாறும் சூழலில் இந்த முறை பயிற்சியை (training) சீராக வைத்திருப்பதை வெளிப்படுத்தின.
பார்வை-மொழி (vision-language) மாடல்களுக்கு ஏன் ஒரு புதிய ரூட்டர் தேவைப்படுகிறது
பார்வை-மொழி மாடல்கள் இரண்டு முற்றிலும் மாறுபட்ட தரவு ஓட்டங்களை உள்வாங்கிக் கொள்கின்றன: நூற்றுக்கணக்கானவை இருக்கலாம் எனக் கருதப்படும் இமேஜ் பேட்ச்கள் (image patches) மற்றும் ஒரு சில வார்த்தை டோக்கன்கள். நிலையான MoE ரூட்டர்கள் ஒவ்வொரு டோக்கனையும் ஒரே மாதிரியான தரவாகக் கருதுகின்றன, இதனால் இமேஜ் பேட்ச்கள் சில எக்ஸ்பர்ட்களைத் திணறடிக்கும் அதே வேளையில், உரை டோக்கன்கள் பயன்படுத்தப்படாமல் அப்படியே இருக்கும். தற்போதுள்ள ஆய்வுகள், ஒவ்வொரு எக்ஸ்பர்ட்டிற்கும் ஒதுக்கப்படும் டோக்கன்களின் மொத்த எண்ணிக்கையை மட்டுமே சமன் செய்யும் ஒரு துணை இழப்பு (auxiliary loss) மூலம் இந்தச் சுமையைச் சரிசெய்ய முயல்கின்றன. படத்தின் மிகப்பெரிய சுமை, சிறிய அளவிலான உரைச் சுமையை ஈடுசெய்து விடுவதால், செயல்திறன் குறையும் வரை அந்த இழப்பு உண்மையான சமநிலையின்மையைக் காட்டாது.
ReBA ரூட்டிங் முறையை எவ்வாறு மாற்றுகிறது
ReBA ரூட்டிங் செயல்பாட்டில் ஒரு மோடாலிட்டி எல்லையை (modality boundary) சேர்க்கிறது. பேட்ச்களையும் வார்த்தைகளையும் கலக்கும் ஒரு ஒற்றை தொகுப்பிற்குப் பதிலாக, இது இமேஜ் டோக்கன்களின் வடிவியல் அமைப்பைப் பின்பற்றும் தனித்தனி பாதைகளை உருவாக்குகிறது. ஒவ்வொரு இமேஜ் இன்ஸ்டன்ஸிற்கும் (image instance) சமமான ஒட்டுமொத்த எடை வழங்கப்படுவதால், எந்தவொரு தனிப்பட்ட எக்ஸ்பர்ட்டும் தடையாகவும் (bottleneck) மாறுவது தடுக்கப்படுகிறது. பேட்ச்களின் இடஞ்சார்ந்த அமைப்பால் (spatial arrangement) வழிநடத்தப்படும் இந்த அமைப்பு, உள்ளீட்டுத் தெளிவுத்திறன் மாறினாலும் நிலையாக இருக்கும்.
ஆசிரியர்கள் அறிக்கையளித்த முக்கிய நன்மைகள்:
- காட்சி மற்றும் மொழியியல் டோக்கன்களுக்கு இடையே தெளிவான பிரிவை ஏற்படுத்துகிறது.
- ஒரு பேட்ச்சில் உள்ள ஒவ்வொரு படத்திலிருந்தும் சமமான பங்களிப்பை உறுதி செய்கிறது.
- ஒரு குறிப்பிட்ட மோடாலிட்டியால் எக்ஸ்பர்ட்கள் திணறுவதைத் தடுக்கிறது.
- இமேஜ் பேட்ச்களின் எண்ணிக்கை அதிகரிக்கும் போது சமநிலையைப் பராமரிக்கிறது.
பல பெஞ்ச்மார்க் அமைப்புகளில், ஒரு பேட்ச்சில் எத்தனை பேட்ச்கள் சேர்க்கப்பட்டாலும், ReBA எக்ஸ்பர்ட் பூலை (expert pool) சமமாகப் பயன்படுத்தியதுடன், பாரம்பரிய துணை-இழப்பு (auxiliary-loss) அணுகுமுறையை விடச் சிறப்பாகச் செயல்பட்டது.
வரம்புகள் மற்றும் திறந்த கேள்விகள்
இந்த ஆய்வு வேகம் அல்லது நினைவகப் பயன்பாடு (memory consumption) குறித்த எண்களை வழங்கவில்லை, எனவே கூடுதல் ரூட்டிங் லாஜிக் மறைமுகச் செலவுகளைச் சேர்க்கிறதா என்பது நமக்குத் தெரியவில்லை. மேலும், ஒரு படத்திலிருந்து வரும் அனைத்து பேட்ச்களும் ஒரு தனி அலகாகச் செயல்படுகின்றன என்று ஆசிரியர்கள் கருதுகின்றனர்; வெவ்வேறு தெளிவுத்திறன் கொண்ட படங்களைச் சேர்க்கும் அல்லது பகுதியளவு மறைக்கப்பட்ட பகுதிகளைக் (partially masked regions) கொண்ட பேட்ச்களில் இந்த அனுமானம் தவறாகலாம்.
அடுத்து கவனிக்க வேண்டியவை
- செயல்திறன்-எதிர்-திறன் சமநிலைகள் (Performance-vs-efficiency trade-offs): ReBA சேர்க்கும் கூடுதல் சுமையை (overhead) எதிர்கால ஆய்வுகள் அளவிட வேண்டியிருக்கும்.
- கலப்பு-பேட்ச் நடத்தை (Mixed-batch behavior): அதிக தெளிவுத்திறன் மற்றும் குறைந்த தெளிவுத்திறன் கொண்ட படங்களை இணைக்கும் பேட்ச்களில் சோதனை செய்வது, மோடாலிட்டி எல்லை நிலைத்தன்மையுடன் இருக்கிறதா என்பதைக் காட்டும்.
- பெரிய அளவிலான குழாய்களில் (pipelines) பயன்பாடு: ரூட்டிங் நிலைத்தன்மை என்பது இமேஜ் கேப்ஷனிங் (image captioning) அல்லது விஷுவல் கேள்வி பதில் (visual question answering) போன்ற கீழ்நிலை பணிகளில் (downstream tasks) சிறந்த முடிவுகளைத் தந்தால், டெவலப்பர்கள் நிலையான துணை-இழப்பிற்குப் பதிலாக ReBA-வை மாற்றக்கூடும்.
நீங்கள் ஒரு பார்வை-மொழி MoE குழாயை (pipeline) உருவாக்குகிறீர்கள் என்றால், படத்தின் தெளிவுத்திறனை அதிகரிக்கும் போது, இயல்புநிலை ரூட்டருக்குப் பதிலாக ReBA-வை மாற்றுவது உங்களுக்கு மிகவும் சீரான எக்ஸ்பர்ட் பயன்பாட்டு முறையை வழங்கக்கூடும். மாற்றத்திற்குப் பிறகு டோக்கன்-விநியோக அளவீடுகளைக் (token-distribution metrics) கவனியுங்கள்; ஒரு சமதள விநியோகம் (flatter distribution) மோடாலிட்டி எல்லை தனது வேலையைச் சரியாகச் செய்கிறது என்பதைக் குறிக்கிறது.
