व्हिडिओ समजून घेताना (Video understanding) एकाच वेळी दोन कठीण प्रश्न विचारले जातात. फ्रेममध्ये काय आहे आणि ते कुठे जात आहे? कॉम्प्युटर व्हिजन सिस्टम्सनी पारंपारिकपणे या प्रश्नांची उत्तरे एकेका वेळी दिली आहेत. प्रथम ते सेगमेंटेशन (segmentation) करतात, म्हणजे पिक्सेलपासून वस्तू वेगळ्या करतात. त्यानंतर ते ट्रॅकिंग (tracking) करतात, म्हणजे त्या वस्तूंचा वेळेनुसार संबंध जोडतात. या विभाजनामुळे अडथळे निर्माण होतात. पहिल्या टप्प्यातील चुका दुसऱ्या टप्प्यात शिरतात. सीमा (boundaries) बदलतात. ओळख (identities) बदलली जाते. जेव्हा लोक किंवा वाहने एकमेकांवर येतात (overlap), तेव्हा संपूर्ण पाइपलाइन थांबते.
मल्टी-कट फॉर्म्युलेशन्सवरील (multi-cut formulations) अलीकडील संशोधन एक वेगळा मार्ग सुचवते. दोन मॉडेल्सना साखळीप्रमाणे जोडण्याऐवजी, हे सेगमेंटेशन आणि ट्रॅकिंगला एकच ऑप्टिमायझेशन समस्या (optimization problem) म्हणून मांडते. याचा परिणाम म्हणजे अधिक अचूक सीमा, कमी ओळख बदलणे (identity switches) आणि गर्दीच्या दृश्यांमध्येही अखंडपणे काम करणारी पाइपलाइन.
पाइपलाइनमधील समस्या
बहुतेक प्रोडक्शन सिस्टम्स प्रथम डिटेक्शन किंवा सेगमेंटेशन करतात आणि नंतर त्याचे आउटपुट ट्रॅकिंग मॉड्यूलला देतात. या हस्तांतरणामध्येच चुका होतात. स्थिर प्रतिमांवर (still images) प्रशिक्षित केलेले सेगमेंटेशन मॉडेल फ्रेम १० मध्ये थोडे मोठे मास्क आणि फ्रेम ११ मध्ये थोडे लहान मास्क तयार करू शकते. केवळ बॉक्स सेंटर्स किंवा एम्बेडिंग अंतरावर लक्ष ठेवणारा ट्रॅकर, हे दोन मास्क एकाच वस्तूचे आहेत की नाही याचा निर्णय घेतो. सेगमेंटरला सीमा चुकीची दिसत आहे हे सांगण्यासाठी ट्रॅकरकडे कोणताही मार्ग नसतो. या दोन सिस्टम्स एकमेकांशी संवाद साधत नाहीत.
जेव्हा वस्तू एकमेकांशी संवाद साधतात (interact), तेव्हा हे विभाजन खर्चिक ठरते. एकमेकांच्या मधून चालणाऱ्या पादचाऱ्यांच्या रस्त्यावरील क्रॉसिंगचा किंवा बॉक्सच्या थराच्या पलीकडे जाऊन एखादा विशिष्ट भाग पकडणाऱ्या रोबोटिक हाताचा विचार करा. अशा क्षणी, पारंपारिक ट्रॅकर्स ओळख टिकवून ठेवण्यासाठी मोशन मॉडेल्स किंवा अपिअरन्स फीचर्सवर (appearance features) अवलंबून असतात. जेव्हा अडथळा (occlusion) काहीपेक्षा जास्त फ्रेम्ससाठी टिकतो, तेव्हा हे संकेत निकामी ठरतात. ट्रॅकर एकतर त्याच वस्तूसाठी नवीन ओळख तयार करतो किंवा ती ओळख दुसऱ्या वस्तूला लावून देतो. दरम्यान, सेगमेंटर मास्क तयार करत राहतो, पण लेबल्स बदलले आहेत याची त्याला कल्पना नसते. या बदलांची दुरुस्ती करण्यासाठी जड पोस्ट-प्रोसेसिंग किंवा मॅन्युअल अॅनोटेशन करावे लागते, ज्यामुळे ऑटोमेशनचा मूळ उद्देशच संपतो.
पारंपारिक मॉडेल्स अनेकदा वस्तू एकमेकांवर आल्यावर (overlap) त्यांचा मागोवा गमावतात. या चुका यादृच्छिक (random) नसून संरचनात्मक (structural) असतात. वेळेला दुय्यम महत्त्व देणारी पाइपलाइन सातत्य राखण्यासाठी संघर्ष करणारच.
मल्टी-कट काय आणते
मल्टी-कट फॉर्म्युलेशन सेगमेंटेशन आणि ट्रॅकिंगमधील भिंत नष्ट करते. विस्कळीत मास्कची मालिका तयार करून नंतर त्यांना एकत्र जोडण्याऐवजी, ही पद्धत अवकाश (space) आणि वेळ (time) या दोन्हीवर विस्तारणारा एक ग्राफ तयार करते. प्रत्येक फ्रेममधील संभाव्य वस्तूचा भाग एक 'नोड' (node) बनतो. एडजेस (Edges) अशा भागांना जोडतात जे एकाच घटकाचे असू शकतात, मग ते एकाच फ्रेममध्ये असोत किंवा सलग फ्रेम्समध्ये. त्यानंतर अल्गोरिदम त्या एडजेस कापण्याचा सर्वोत्तम मार्ग शोधतो, जेणेकरून उरलेले घटक व्हिडिओमध्ये नैसर्गिकरित्या हलणाऱ्या सुसंगत वस्तू तयार करतील.
निर्णय जागतिक (global) असल्याने, फ्रेम १५ मधील सीमा सुधारणेवर फ्रेम ५ मधील पुराव्यांचा परिणाम होऊ शकतो. जर दोन व्यक्तींचे मार्ग एकमेकांना छेदत असतील, तर हे फॉर्म्युलेशन केवळ वेगाच्या (velocity) आधारावर अंदाज लावण्याची गरज पडत नाही. ते अपिअरन्स, आकार, हालचाल आणि सीमा सुसंगतता (boundary coherence) या सर्वांचा एकाच वेळी विचार करते. मास्कची गुणवत्ता आणि ट्रॅकची गुणवत्ता एकाच उद्दिष्टाखाली ऑप्टिमाइझ केली जाते. जेव्हा सॉल्वर (solver) एखाद्या ओळखीवर शिक्कामोर्तब करतो, तेव्हा त्याने संबंधित पिक्सेल अवकाशाच्या दृष्टीने योग्य आहेत की नाही हे आधीच तपासलेले असते. हे कपलिंग (coupling) अशा अडथळ्यांमधून (occlusions) सावरण्यास मदत करते, जे पाइपलाइन दृष्टिकोनाला तोडू शकतात.
व्हिज्युअल डेटा थेट ट्रॅकिंग लॉजिकशी जोडल्यामुळे फीडबॅक लूप पूर्ण होतो. सेगमेंटेशन ट्रॅकिंगला माहिती देते आणि ट्रॅकिंगचे निर्बंध सेगमेंटेशनमधील चुका सुधारतात. तुम्हाला कमी मॅन्युअल दुरुस्त्यांसह अधिक अचूक निकाल मिळतात कारण सिस्टम आता प्रत्येक टप्प्यावर स्वतंत्रपणे अंदाज लावत नाही.
याचा प्रत्यक्ष वापर कुठे होतो
युनिफाइड फॉर्म्युलेशनचे फायदे केवळ सैद्धांतिक नाहीत. उपयोजनामध्ये (deployment) वारंवार येणाऱ्या तीन विशिष्ट क्षेत्रांमध्ये ते महत्त्वाचे ठरतात.
फ्रेम-टू-फ्रेम सुसंगतता (Frame-to-frame consistency). स्पोर्ट्स ॲनालिटिक्समध्ये, खेळाडूची आकृती (silhouette) अचूक असणे आवश्यक आहे जेणेकरून पाऊल लांबी किंवा सांध्यांचे कोन यांसारखी बायोमेकॅनिकल मेट्रिक्स (biomechanical metrics) विश्वसनीयपणे काढता येतील. जर सेगमेंटेशन ट्रॅकिंगपासून स्वतंत्रपणे डगमगले, तर resulting kinematics गोंधळलेले (noisy) होतात. युनिफाइड फॉर्म्युलेशन संपूर्ण क्लिपमध्ये खेळाडूची बाह्यरेखा एका अखंड घटकाप्रमाणे मानून तो डगमगण्याचा प्रश्न मिटवते.
गर्दीची दृश्ये. देखरेख (surveillance) आणि गर्दी मोजण्याच्या (crowd-counting) ॲप्लिकेशन्सची अचूकता तेव्हा कमी होते जेव्हा लोक एकत्र येतात. वेगळे ट्रॅकर्स अनेकदा ओळख (identities) एकत्र करतात किंवा शरीरांमधील अंतरामध्ये काल्पनिक वस्तू (phantom objects) तयार करतात. दृश्य पुरावा (visual evidence) थेट ट्रॅकिंग लॉजिकशी जोडल्यामुळे, multi-cut दृष्टिकोन गर्दीच्या दृश्यांमध्ये वस्तूची ओळख अधिक चांगल्या प्रकारे टिकवून ठेवतो. जेव्हा त्यांचे बाउंडिंग बॉक्सेस (bounding boxes) जवळजवळ पूर्णपणे एकमेकांवर येतात, तेव्हाही व्यक्ती स्वतंत्र राहतात.
सीमांची अखंडता (Boundary integrity). रोबोटिक्समध्ये, 'पिक-अँड-प्लेस' (pick-and-place) प्रणालीला पकड (grasp) नियोजित करण्यासाठी वस्तूच्या अचूक कडा (contours) आवश्यक असतात. जो सेगमेंटेशन मॉडेल 'टेम्पोरल कॉन्टेक्स्ट' (temporal context) दुर्लक्षित करतो, तो पार्श्वभूमीचा (background) काही भाग समाविष्ट करू शकतो किंवा वस्तूचा एखादा कोपरा कापून टाकू शकतो. जेव्हा सेगमेंटेशन आणि ट्रॅकिंगचे उद्दिष्ट एकच असते, तेव्हा मॉडेलला हे समजते की सीमा (boundaries) काळाच्या ओघात स्थिर (temporally stable) असाव्यात. परिणामी मिळणारे मास्क खऱ्या कडांशी अधिक अचूकपणे जुळतात, ज्याचा अर्थ असा की पकडण्याच्या प्रयत्नांमधील अपयश कमी होते आणि सुरक्षिततेसाठी जास्त अतिरिक्त मार्जिनची गरज भासत नाही.
अधिक चांगले पाइपलाइन्स तयार करणे
व्हिडिओ विश्लेषण किंवा रोबोटिक्समध्ये काम करणाऱ्या इंजिनिअर्ससाठी, या बदलामुळे तुमच्या सिस्टमच्या आर्किटेक्चरवर प्रत्यक्ष परिणाम होतो.
डिटेक्शन (detection), सेगमेंटेशन (segmentation) आणि ट्रॅकिंग (tracking) यांना कन्वेअर बेल्टवरून टेन्सर (tensors) पास करणाऱ्या तीन वेगवेगळ्या मायक्रोसर्व्हिसेस म्हणून पाहणे थांबवा. त्याऐवजी, संयुक्त उद्दिष्ट (joint objective) दर्शविणाऱ्या फ्रेमवर्क्सचा शोध घ्या. जर तुम्ही कस्टम पाइपलाइन तयार करत असाल, तर तुमचे ग्राफ स्ट्रक्चर एकाच 'लॉस'मध्ये (loss) 'स्पेशियल एफिनिटी' (spatial affinity) आणि 'टेम्पोरल कंटिन्यूटी' (temporal continuity) दोन्ही एनकोड करू शकते का, याचा विचार करा. जरी तुम्ही पूर्ण multi-cut solver स्वतः लागू करत नसाल, तरीही हे तत्त्व लागू होते. असे निर्बंध (constraints) जोडा जे काळातील स्वरूप (appearance over time) पुन्हा प्रति-फ्रेम मास्कच्या (per-frame mask) गुणवत्तेशी जोडतात.
'ऑक्लुजन'वर (occlusion) आक्रमकपणे चाचणी घ्या. साध्या पॅटर्नमध्ये हलणाऱ्या विलग वस्तू असलेला डेमो व्हिडिओ पाइपलाइन दृष्टिकोनातील उणिवा उघड करणार नाही. अशा सिक्वेन्स गोळा करा जिथे लक्ष्ये एकमेकांवर येतात (overlap), जिथे ऑक्लुजन दरम्यान प्रकाश बदलतो, आणि जिथे वस्तू स्क्रीनच्या बाहेरून पुन्हा प्रवेश करतात. हे ते क्षण आहेत जे केवळ जोडलेल्या पाइपलाइनला आणि खऱ्या अर्थाने एकत्रित (unified) पाइपलाइनला वेगळे करतात.
तुमची ॲनोटेशन स्ट्रॅटेजी (annotation strategy) काळजीपूर्वक तयार करा. जॉइंट मॉडेल्सना अनेकदा शुद्ध सेगमेंटेशन किंवा शुद्ध ट्रॅकिंग डेटासेटपेक्षा वेगळ्या 'ग्राउंड ट्रुथ' (ground truth) स्ट्रक्चर्सची आवश्यकता असते. तुम्हाला केवळ प्रति प्रतिमा पिक्सेल क्लासेसना लेबल करण्याची गरज नाही, तर सर्व फ्रेम्समध्ये इन्स्टन्स आयडेंटिटीज (instance identities) सुसंगतपणे लेबल करण्याची आवश्यकता असू शकते. सुरुवातीला या लेबलिंगमध्ये गुंतवणूक केल्यामुळे नंतरच्या वेळी डिप्लॉयमेंट दरम्यान मॅन्युअल दुरुस्ती कमी होऊन त्याचा फायदा होतो.
मुख्य निष्कर्ष
जेव्हा कॉम्प्युट (compute) आणि मॉडेल क्षमता मर्यादित होती, तेव्हा सेगमेंटेशन आणि ट्रॅकिंगला स्वतंत्र कामे म्हणून मानणे योग्य होते. आता तसे नाही. multi-cut फॉर्म्युलेशन हे दर्शवते की ही दोन कार्ये प्रत्यक्षात एकच आहेत: काळाच्या ओघात टिकून राहणाऱ्या सुसंगत वस्तू शोधणे. त्यांना एकत्र सोडवल्यामुळे, तुम्हाला गतीचा (motion) आदर करणारे मास्क आणि आकाराचा (shape) आदर करणारे ट्रॅक्स मिळतात. याचा परिणाम असा होतो की, एक व्हिडिओ अंडरस्टँडिंग पाइपलाइन तयार होते जी फ्रेम्समधील त्रुटी कमी करते, हलणाऱ्या वस्तूंच्या भोवती अधिक स्पष्ट सीमा तयार करते आणि ऑक्लुजन आणि गर्दीच्या गुंतागुंतीच्या वास्तवातही अचूक राहते.
