வீடியோ புரிதல் (Video understanding) ஒரே நேரத்தில் இரண்டு கடினமான கேள்விகளைக் கேட்கிறது. பிரேமிற்குள் (frame) என்ன இருக்கிறது, மற்றும் அது எங்கு செல்கிறது? கணினி பார்வை (Computer vision) அமைப்புகள் பாரம்பரியமாக இவற்றை ஒவ்வொன்றாகவே பதிலளித்துள்ளன. முதலில் அவை செக்மென்டேஷன் (segmentation) செய்கின்றன, அதாவது பிக்சல்களில் (pixels) இருந்து பொருட்களைப் பிரிக்கின்றன. பின்னர் அவை ட்ராக்கிங் (tracking) செய்கின்றன, அதாவது அந்தப் பொருட்களை காலப்போக்கில் இணைக்கின்றன. இந்தத் தனித்தன்மை உராய்வை உருவாக்குகிறது. முதல் நிலையிலிருந்து ஏற்படும் பிழைகள் இரண்டாவது நிலைக்குப் பரவுகின்றன. எல்லைகள் மாறுகின்றன. அடையாளங்கள் மாறுகின்றன. மனிதர்களோ அல்லது வாகனங்களோ ஒன்றையொன்று மறைக்கும்போது, முழு பைப்லைனும் (pipeline) முடங்குகிறது.
மல்டி-கட் (multi-cut) ஃபார்முலேஷன்கள் குறித்த சமீபத்திய ஆய்வுகள் ஒரு மாறுபட்ட பாதையை வழங்குகின்றன. இரண்டு மாடல்களைத் தொடர்ச்சியாகப் பயன்படுத்துவதற்குப் பதிலாக, இது செக்மென்டேஷன் மற்றும் ட்ராக்கிங்கை ஒரே உகப்பாக்கப் பிரச்சனையாக (optimization problem) கட்டமைக்கிறது. இதன் விளைவாகத் துல்லியமான எல்லைகள், குறைவான அடையாள மாற்றங்கள் மற்றும் காட்சிகள் நெருக்கடியாக இருக்கும்போது நிலைத்து நிற்கும் ஒரு பைப்லைன் கிடைக்கிறது.
பைப்லைன்களில் உள்ள சிக்கல்
பெரும்பாலான உற்பத்தி அமைப்புகள் (production systems) முதலில் கண்டறிதல் (detection) அல்லது செக்மென்டேஷனைச் செய்கின்றன, பின்னர் அதன் வெளியீட்டை ஒரு ட்ராக்கிங் மாட்யூலுக்கு (tracking module) வழங்குகின்றன. அந்த ஒப்படைப்பில்தான் விஷயங்கள் தவறாகின்றன. நிலையான படங்களின் (still images) அடிப்படையில் பயிற்சியளிக்கப்பட்ட ஒரு செக்மென்டேஷன் மாடல், பத்தாவது பிரேமில் சற்று பெரியதாகவும், பதினொன்றாவது பிரேமில் சற்று சிறியதாகவும் இருக்கும் ஒரு மாஸ்க்கை (mask) உருவாக்கலாம். பாக்ஸ் மையங்கள் (box centers) அல்லது எம்பெடிங் தூரங்களை (embedding distances) மட்டுமே கவனிக்கும் ஒரு ட்ராக்கர், அந்த இரண்டு மாஸ்க்குகளும் ஒரே பொருளுக்குச் சொந்தமானவையா என்பதைத் தீர்மானிக்க வேண்டியிருக்கும். செக்மென்டேட்டர் எல்லை தவறாகத் தெரிகிறது என்று கூறி, அதைத் திருத்த ட்ராக்கருக்கு எந்த வழியும் இல்லை. இந்த இரண்டு அமைப்புகளும் ஒன்றுடன் ஒன்று பேசிக்கொள்வதில்லை.
பொருட்கள் ஒன்றையொன்று தொடர்பு கொள்ளும்போது இந்தத் தனித்தன்மை செலவுமிக்கதாக மாறுகிறது. பாதசாரிகள் ஒருவருக்கொருவர் இடையே நகர்ந்து செல்லும் ஒரு சாலை சந்திப்பையோ அல்லது ஒரு குறிப்பிட்ட பாகத்தைப் பிடிக்க பெட்டிகளின் அடுக்குக்கு அப்பால் ஒரு ரோபோட் கை நீளுவதையோ கற்பனை செய்து பாருங்கள். இத்தகைய தருணங்களில், பாரம்பரிய ட்ராக்கர்கள் அடையாளத்தைப் பராமரிக்க மோஷன் மாடல்கள் (motion models) அல்லது தோற்ற அம்சங்களை (appearance features) நம்பியிருக்கின்றன. மறைவு (occlusion) சில பிரேம்களை விடத் தொடர்ந்து நீடிக்கும்போது, அந்தத் தகவல்கள் செயலிழந்துவிடுகின்றன. ட்ராக்கர் அந்தப் பொருளுக்கே ஒரு புதிய அடையாளத்தை உருவாக்குகிறது அல்லது ஒரு அடையாளத்தை வேறொரு பொருளுக்கு மாற்றுகிறது. இதற்கிடையில், லேபிள்கள் (labels) விலகிவிட்டன என்பதை அறியாமல் செக்மென்டேட்டர் தொடர்ந்து மாஸ்க்குகளைத் தயாரித்துக் கொண்டே இருக்கிறது. அந்த விலகலைச் சரிசெய்வதற்கு அதிகப்படியான போஸ்ட்-புராசஸிங் (post-processing) அல்லது கைமுறை அனோடேஷன் (manual annotation) தேவைப்படுகிறது, இது தானியங்கி முறையின் நோக்கத்தையே சிதைத்துவிடுகிறது.
பாரம்பரிய மாடல்கள் பொருட்கள் ஒன்றையொன்று மறைக்கும்போது பெரும்பாலும் அவற்றைத் தவறவிடுகின்றன. பிழைகள் தற்செயலானவை அல்ல; அவை கட்டமைப்பு ரீதியானவை. காலத்தை ஒரு கூடுதல் விஷயமாக மட்டுமே கருதும் ஒரு பைப்லைன், தொடர்ச்சியைக் கையாள்வதில் சிரமப்பட நேரிடும்.
Multi-Cut எதைக் கொண்டுவருகிறது
ஒரு மல்டி-கட் ஃபார்முலேஷன், செக்மென்டேஷன் மற்றும் ட்ராக்கிங் இடையிலான சுவரைத் தகர்க்கிறது. துண்டிக்கப்பட்ட மாஸ்க்குகளின் வரிசையை உருவாக்கி பின்னர் அவற்றை ஒன்றாக இணைப்பதற்குப் பதிலாக, இந்த முறை வெளி (space) மற்றும் காலம் (time) ஆகிய இரண்டையும் உள்ளடக்கிய ஒரு வரைபடத்தை (graph) உருவாக்குகிறது. ஒவ்வொரு பிரேமிலும் உள்ள ஒவ்வொரு சாத்தியமான பொருள் பகுதியும் ஒரு நோடாக (node) மாறுகிறது. ஒரே பிரேமிற்குள்ளும், அடுத்தடுத்த பிரேம்களிலும் ஒரே பொருளுக்குச் சொந்தமானதாக இருக்கலாம் என்று கருதப்படும் பகுதிகளை எட்ஜ்கள் (edges) இணைக்கின்றன. பின்னர் அந்த எட்ஜ்களை வெட்டுவதற்கான உகந்த வழியை இந்த அல்காரிதம் கண்டறிகிறது, இதனால் எஞ்சியிருக்கும் இணைக்கப்பட்ட கூறுகள் வீடியோவில் இயற்கையாக நகரும் நிலையான பொருள்களாக அமைகின்றன.
இந்த முடிவு உலகளாவிய ரீதியில் (global) எடுக்கப்படுவதால், பதினைந்தாவது பிரேமில் செய்யப்படும் ஒரு எல்லைத் திருத்தம் ஐந்தாவது பிரேமில் உள்ள ஆதாரங்களால் பாதிக்கப்படலாம். இரண்டு பேர் பாதையில் குறுக்கிடும்போது, இந்த ஃபார்முலேஷன் வேகத்தை (velocity) மட்டும் வைத்து யூகிக்க வேண்டிய அவசியமில்லை. இது தோற்றம், வடிவம், இயக்கம் மற்றும் எல்லைத் தொடர்ச்சி ஆகிய அனைத்தையும் ஒரே நேரத்தில் கணக்கில் கொள்கிறது. மாஸ்க் தரம் மற்றும் ட்ராக் தரம் ஆகிய இரண்டும் ஒரே குறிக்கோளின் கீழ் உகப்பாக்கப்படுகின்றன. ஒரு தீர்வி (solver) ஒரு அடையாளத்தை உறுதி செய்யும்போது, அது அந்தந்த பிக்சல்கள் இடஞ்சார்ந்த ரீதியாக (spatially) சரியாக இருப்பதை ஏற்கனவே சரிபார்த்திருக்கும். இந்த இணைப்புதான், ஒரு பைப்லைன் அணுகுமுறையைச் சிதைக்கக்கூடிய மறைவுகளிலிருந்து (occlusions) கட்டமைப்பை மீட்க உதவுகிறது.
விஷுவல் தரவை நேரடியாக ட்ராக்கிங் லாஜிக்குடன் இணைப்பது பின்னூட்ட சுழற்சியை (feedback loop) மூடுகிறது. செக்மென்டேஷன் ட்ராக்கிங்கிற்குத் தகவல்களைத் தருகிறது, மேலும் ட்ராக்கிங் கட்டுப்பாடுகள் செக்மென்டேஷனைச் சுத்தப்படுத்துகின்றன. ஒவ்வொரு நிலையிலும் சிஸ்டம் தனித்து யூகிக்காததால், குறைவான கைமுறைத் திருத்தங்களுடன் அதிக துல்லியமான முடிவுகளைப் பெறலாம்.
இது நடைமுறையில் எங்கு வெளிப்படுகிறது
ஒருங்கிணைந்த ஃபார்முலேஷனின் நன்மைகள் வெறும் தத்துவார்த்தமானவை மட்டுமல்ல. அவை பயன்பாட்டில் அடிக்கடி வரும் மூன்று குறிப்பிட்ட பகுதிகளில் முக்கியத்துவம் பெறுகின்றன.
Frame-to-frame consistency. விளையாட்டு பகுப்பாய்வில் (sports analytics), ஒரு வீரரின் உருவ அமைப்பு (silhouette) துல்லியமாக இருக்க வேண்டும், அப்போதுதான் காலடி நீளம் அல்லது மூட்டு கோணங்கள் போன்ற பயோமெக்கானிக்கல் அளவீடுகளை (biomechanical metrics) நம்பகமான முறையில் எடுக்க முடியும். செக்மென்டேஷன் ட்ராக்கிங்கிலிருந்து தனித்துத் தடுமாறினால், அதன் விளைவாகக் கிடைக்கும் இயக்கவியல் (kinematics) இரைச்சலாக (noisy) மாறும். ஒருங்கிணைந்த ஃபார்முலேஷன், வீரரின் வெளிப்புறத்தை முழு வீடியோவிலும் ஒரு தொடர்ச்சியான பொருளாகக் கருதுவதன் மூலம் அந்தத் தடுமாற்றத்தைத் தவிர்க்கிறது.
நெரிசலான காட்சிகள். கண்காணிப்பு மற்றும் கூட்டத்தைக் கணக்கிடும் பயன்பாடுகள் மக்கள் கூட்டமாகச் சேரும்போது துல்லியத்தன்மையை இழக்கின்றன. தனித்தனி trackers பெரும்பாலும் அடையாளங்களை ஒன்றிணைக்கின்றன அல்லது உடல்களுக்கு இடையிலான இடைவெளிகளில் போலிப் பொருட்களை (phantom objects) உருவாக்குகின்றன. காட்சி ஆதாரங்களை நேரடியாகத் தடயங்காட்டும் தர்க்கத்துடன் (tracking logic) இணைப்பதன் மூலம், multi-cut அணுகுமுறை நெரிசலான காட்சிகளில் பொருளின் அடையாளத்தை சிறப்பாகப் பராமரிக்கிறது. அவற்றின் bounding boxes கிட்டத்தட்ட முழுமையாக ஒன்றின் மேல் ஒன்று அமைந்தாலும், தனிநபர்கள் தனித்துவமாகத் தொடர்கின்றனர்.
எல்லைத் தரம் (Boundary integrity). ரோபாட்டிக்ஸில், ஒரு pick-and-place அமைப்பு பொருட்களைப் பிடிப்பதற்குத் துல்லியமான பொருளின் விளிம்புகள் (contours) தேவைப்படுகின்றன. காலமுறைச் சூழலை (temporal context) புறக்கணிக்கும் ஒரு segmentation மாதிரி, பின்னணியின் ஒரு பகுதியைச் சேர்க்கலாம் அல்லது பொருளின் ஒரு மூலையைத் துண்டித்துவிடலாம். segmentation மற்றும் tracking ஆகிய இரண்டும் ஒரே குறிக்கோளைப் பகிர்ந்து கொள்ளும்போது, எல்லைகள் காலரீதியாக நிலையானதாக இருக்க வேண்டும் என்பதை மாதிரி கற்றுக்கொள்கிறது. இதன் விளைவாகக் கிடைக்கும் masks உண்மையான விளிம்புகளுடன் துல்லியமாகப் பொருந்தும், இதன் மூலம் பிடிப்பதில் ஏற்படும் தோல்விகள் குறையும் மற்றும் அதிகப்படியான பாதுகாப்பு இடைவெளிகளின் (safety margins) தேவை குறையும்.
சிறந்த పైப்லைன்களை (Pipelines) உருவாக்குதல்
வீடியோ பகுப்பாய்வு அல்லது ரோபாட்டிக்ஸில் பணிபுரியும் பொறியாளர்களுக்கு, இந்த மாற்றம் உங்கள் அமைப்பை வடிவமைக்கும் முறையில் உறுதியான தாக்கங்களை ஏற்படுத்துகிறது.
கண்டறிதல் (detection), segmentation மற்றும் tracking ஆகிய மூன்றையும் ஒரு கன்வேயர் பெல்ட்டில் (conveyor belt) டென்சர்களை (tensors) கடத்தும் மூன்று தனித்தனி microservices என்று நினைப்பதை நிறுத்துங்கள். அதற்குப் பதிலாக, ஒரு கூட்டு இலக்கை வெளிப்படுத்தும் கட்டமைப்புகளை (frameworks) தேடுங்கள். நீங்கள் ஒரு தனிப்பயனாக்கப்பட்ட (custom) pipeline-ஐ உருவாக்குகிறீர்கள் என்றால், உங்கள் வரைபட அமைப்பு (graph structure) ஒரே loss-இல் இடஞ்சார்ந்த நெருக்கம் (spatial affinity) மற்றும் காலமுறைத் தொடர்ச்சி (temporal continuity) ஆகிய இரண்டையும் குறியீடாக்க முடியுமா என்று பரிசீலியுங்கள். நீங்கள் முழுமையான multi-cut solver-ஐ நீங்களே செயல்படுத்தாவிட்டாலும், இந்தத் தத்துவம் பொருந்தும். காலப்போக்கில் தோற்றத்தை (appearance), ஒவ்வொரு பிரேமிற்கும் (per-frame) கிடைக்கும் mask-ன் தரத்துடன் இணைக்கும் கட்டுப்பாடுகளைச் சேர்க்கவும்.
மறைப்பு (occlusion) நிகழ்வுகளில் தீவிரமாகச் சோதனை செய்யுங்கள். எளிமையான வடிவங்களில் நகரும் தனிமைப்படுத்தப்பட்ட பொருட்களைக் கொண்ட ஒரு டெமோ வீடியோ, ஒரு pipeline அணுகுமுறையின் பலவீனங்களை வெளிப்படுத்தாது. இலக்குகள் ஒன்றின் மேல் ஒன்று மேலடுக்கும் (overlap), மறைக்கப்படும்போது ஒளி மாறுகிறது மற்றும் பொருட்கள் திரைக்கு வெளியே இருந்து மீண்டும் உள்ளே நுழைகின்றன போன்ற வரிசைகளைச் சேகரிக்கவும். இவைதான் ஒரு இணைக்கப்பட்ட (glued-together) pipeline-க்கும், உண்மையான ஒருங்கிணைந்த (unified) pipeline-க்கும் இடையிலான வித்தியாசத்தை உணர்த்தும் தருணங்கள்.
உங்கள் அனோடேஷன் (annotation) உத்தியைத் கவனமாகத் தயார் செய்யுங்கள். கூட்டு மாதிரிகளுக்கு (joint models), தூய segmentation அல்லது தூய tracking தரவுத்தொகுப்புகளை விட வேறுபட்ட ground truth கட்டமைப்புகள் தேவைப்படலாம். நீங்கள் ஒவ்வொரு படத்திலும் உள்ள pixel வகுப்புகளை மட்டும் குறிக்காமல், பிரேம்கள் முழுவதும் instance அடையாளங்களை சீராகக் குறிக்க வேண்டியிருக்கலாம். ஆரம்பத்திலேயே இத்தகைய லேபிளிங்கில் (labeling) முதலீடு செய்வது, பின்னர் பயன்பாட்டிற்கு (deployment) கொண்டு வரும்போது கைமுறைத் திருத்தங்களைக் குறைக்க உதவும்.
உண்மையான முடிவு (The Real Takeaway)
கணக்கீட்டுத் திறன் (compute) மற்றும் மாதிரித் திறன் (model capacity) குறைவாக இருந்தபோது, segmentation மற்றும் tracking ஆகியவற்றைத் தனித்தனி வேலைகளாகக் கருதுவது சரியாக இருந்தது. ஆனால் இப்போது அது பொருந்தாது. ஒரு multi-cut வடிவம் (formulation) இந்த இரண்டு பணிகளும் உண்மையில் ஒன்று என்பதைக் காட்டுகிறது: அதாவது காலப்போக்கில் நிலைத்திருக்கும் ஒருங்கிணைந்த பொருட்களைக் கண்டறிவது. அவற்றை ஒன்றாகத் தீர்ப்பதன் மூலம், இயக்கத்தை மதிக்கும் masks மற்றும் வடிவத்தை மதிக்கும் tracks ஆகியவற்றைப் பெறலாம். இதன் விளைவாக, பிரேம்களுக்கு இடையிலான பிழைகளைக் குறைக்கும், நகரும் பொருட்களுக்குச் சுத்தமான எல்லைகளை உருவாக்கும் மற்றும் மறைப்புகள் மற்றும் நெரிசல்கள் நிறைந்த யதார்த்தமான சூழல்களிலும் துல்லியமாகச் செயல்படும் ஒரு வீடியோ புரிதல் (video understanding) pipeline-ஐப் பெறலாம்.
