वीडियो अंडरस्टैंडिंग एक साथ दो कठिन प्रश्न पूछती है। फ्रेम में क्या है, और वह कहाँ जा रहा है? कंप्यूटर विज़न सिस्टम पारंपरिक रूप से इनका उत्तर एक-एक करके देते हैं। पहले वे सेगमेंटेशन (segmentation) करते हैं, पिक्सेल से वस्तुओं को अलग करते हैं। फिर वे ट्रैकिंग (tracking) करते हैं, समय के साथ उन वस्तुओं को जोड़ते हैं। यह विभाजन घर्षण पैदा करता है। पहले चरण की त्रुटियाँ दूसरे चरण में आ जाती हैं। सीमाएँ बदल जाती हैं। पहचान (identities) बदल जाती है। जब लोग या वाहन एक-दूसरे के ऊपर आते हैं (overlap), तो पूरी पाइपलाइन रुक जाती है।

मल्टी-कट फॉर्मुलेशन (multi-cut formulations) पर हालिया कार्य एक अलग रास्ता प्रदान करता है। दो मॉडलों को एक के बाद एक जोड़ने के बजाय, यह सेगमेंटेशन और ट्रैकिंग को एक एकल ऑप्टिमाइज़ेशन समस्या (optimization problem) के रूप में पेश करता है। इसका परिणाम अधिक सटीक सीमाएँ, कम पहचान परिवर्तन (identity switches), और एक ऐसी पाइपलाइन है जो भीड़भाड़ वाले दृश्यों में भी बनी रहती है।

पाइपलाइनों के साथ समस्या

अधिकांश प्रोडक्शन सिस्टम पहले डिटेक्शन या सेगमेंटेशन चलाते हैं, फिर आउटपुट को ट्रैकिंग मॉड्यूल को सौंप देते हैं। यही वह जगह है जहाँ चीजें गलत हो जाती हैं। स्थिर छवियों (still images) पर प्रशिक्षित एक सेगमेंटेशन मॉडल ऐसा मास्क बना सकता है जो फ्रेम दस में थोड़ा बहुत बड़ा हो और फ्रेम ग्यारह में थोड़ा बहुत छोटा हो। एक ट्रैकर, जो केवल बॉक्स केंद्रों या एम्बेडिंग दूरियों (embedding distances) को देखता है, उसे यह तय करना होता है कि क्या वे दोनों मास्क एक ही वस्तु के हैं। उसके पास सेगमेंटर को यह बताने का कोई तरीका नहीं है कि सीमा गलत दिख रही है। दोनों सिस्टम आपस में बात नहीं करते हैं।

जब वस्तुएं आपस में क्रिया करती हैं, तो यह अलगाव महंगा हो जाता है। एक सड़क क्रॉसिंग के बारे में सोचें जहाँ पैदल यात्री एक-दूसरे के बीच से निकल रहे हों, या एक रोबोटिक आर्म किसी विशिष्ट हिस्से को पकड़ने के लिए बक्सों के ढेर के आगे बढ़ रही हो। इन क्षणों में, पारंपरिक ट्रैकर पहचान बनाए रखने के लिए मोशन मॉडल (motion models) या अपीयरेंस फीचर्स (appearance features) पर निर्भर करते हैं। जब ऑक्लूजन (occlusion) कुछ से अधिक फ्रेम तक रहता है, तो वे संकेत विफल हो जाते हैं। ट्रैकर या तो उसी वस्तु के लिए एक नई पहचान बना लेता है या पहचान को किसी दूसरी वस्तु पर लगा देता है। इस बीच, सेगमेंटर मास्क बनाता रहता है, इस बात से पूरी तरह अनजान कि लेबल भटक गए हैं। उस विचलन (drift) को साफ करने का मतलब है भारी पोस्ट-प्रोसेसिंग या मैन्युअल एनोटेशन, जो ऑटोमेशन के उद्देश्य को ही विफल कर देता है।

पारंपरिक मॉडल अक्सर ठीक उसी समय ट्रैक खो देते हैं जब वस्तुएं ओवरलैप होती हैं। त्रुटियाँ रैंडम नहीं होतीं; वे संरचनात्मक (structural) होती हैं। एक पाइपलाइन जो समय को बाद की बात मानती है, उसका निरंतरता (continuity) के साथ संघर्ष करना तय है।

मल्टी-कट क्या नया लाता है

मल्टी-कट फॉर्मुलेशन सेगमेंटेशन और ट्रैकिंग के बीच की दीवार को खत्म कर देता है। अलग-अलग मास्क का एक क्रम बनाने और फिर उन्हें बाद में जोड़ने के बजाय, यह विधि एक ऐसा ग्राफ बनाती है जो स्थान (space) और समय (time) दोनों में फैला होता है। प्रत्येक फ्रेम में प्रत्येक संभावित वस्तु क्षेत्र एक नोड (node) बन जाता है। किनारे (Edges) उन क्षेत्रों को जोड़ते हैं जो एक ही इकाई (entity) के हो सकते हैं, एक ही फ्रेम के भीतर और लगातार फ्रेमों में भी। एल्गोरिदम फिर उन किनारों को काटने का इष्टतम (optimal) तरीका खोजता है ताकि शेष जुड़े हुए घटक (connected components) वीडियो में स्वाभाविक रूप से चलती हुई सुसंगत वस्तुओं का निर्माण करें।

क्योंकि निर्णय वैश्विक (global) होता है, इसलिए फ्रेम पंद्रह में सीमा सुधार फ्रेम पांच के साक्ष्य से प्रभावित हो सकता है। यदि दो लोग एक-दूसरे के रास्ते में आते हैं, तो फॉर्मुलेशन को केवल वेग (velocity) के आधार पर अनुमान लगाने की आवश्यकता नहीं होती है। यह अपीयरेंस, आकार, मोशन और बाउंड्री कोहेरेंस (boundary coherence) को एक साथ तौलता है। मास्क की गुणवत्ता और ट्रैक की गुणवत्ता को एक ही उद्देश्य के तहत ऑप्टिमाइज़ किया जाता है। जब सॉल्वर किसी पहचान को तय करता है, तो वह पहले ही जांच चुका होता है कि संबंधित पिक्सेल स्थानिक रूप से (spatially) सही हैं या नहीं। यही कपलिंग (coupling) फ्रेमवर्क को उन ऑक्लूजन से उबरने में मदद करती है जो एक पाइपलाइन दृष्टिकोण को तोड़ देंगे।

विजुअल डेटा को सीधे ट्रैकिंग लॉजिक से जोड़ने से फीडबैक लूप पूरा हो जाता है। सेगमेंटेशन ट्रैकिंग को सूचित करता है, और ट्रैकिंग बाधाएं (constraints) सेगमेंटेशन को साफ करती हैं। आपको कम मैन्युअल सुधारों के साथ अधिक सटीक परिणाम मिलते हैं क्योंकि सिस्टम अब प्रत्येक चरण में अलग-थलग होकर अनुमान नहीं लगा रहा है।

यह व्यवहार में कहाँ दिखाई देता है

एक एकीकृत फॉर्मुलेशन के लाभ केवल सैद्धांतिक नहीं हैं। वे तीन विशिष्ट क्षेत्रों में महत्वपूर्ण हैं जो तैनाती (deployment) के दौरान लगातार सामने आते हैं।

फ्रेम-टू-फ्रेम निरंतरता (Frame-to-frame consistency)। स्पोर्ट्स एनालिटिक्स में, एक एथलीट की रूपरेखा (silhouette) को सटीक रहना आवश्यक है ताकि स्ट्राइड लेंथ (stride length) या जॉइंट एंगल (joint angles) जैसे बायोमैकेनिकल मेट्रिक्स को विश्वसनीय रूप से निकाला जा सके। यदि सेगमेंटेशन ट्रैकिंग से स्वतंत्र रूप से डगमगाता है, तो परिणामी काइनेमैटिक्स (kinematics) शोरपूर्ण (noisy) हो जाते हैं। एक एकीकृत फॉर्मुलेशन पूरे क्लिप में एथलीट की रूपरेखा को एक निरंतर इकाई मानकर उस डगमगाहट को समाप्त कर देता है।

भीड़भाड़ वाले दृश्य। निगरानी और भीड़-गणना अनुप्रयोगों की सटीकता तब कम हो जाती है जब लोग एक साथ जमा हो जाते हैं। अलग-अलग ट्रैकर्स अक्सर पहचानों को मिला देते हैं या शरीर के बीच के अंतराल में काल्पनिक वस्तुएं (phantom objects) बना देते हैं। विजुअल साक्ष्यों को सीधे ट्रैकिंग लॉजिक से जोड़कर, मल्टी-कट दृष्टिकोण भीड़भाड़ वाले दृश्यों में ऑब्जेक्ट की पहचान को बेहतर बनाए रखता है। व्यक्ति तब भी अलग रहते हैं जब उनके बाउंडिंग बॉक्स लगभग पूरी तरह से एक-दूसरे के ऊपर आ जाते हैं।

सीमा की अखंडता (Boundary integrity)। रोबोटिक्स में, एक पिक-एंड-प्लेस सिस्टम को ग्रैस्प (grasp) की योजना बनाने के लिए वस्तु के सटीक कंटूर (contours) की आवश्यकता होती है। एक सेगमेंटेशन मॉडल जो टेम्पोरल कॉन्टेक्स्ट (temporal context) को नजरअंदाज करता है, वह बैकग्राउंड के किसी हिस्से को शामिल कर सकता है या वस्तु के किसी कोने को काट सकता है। जब सेगमेंटेशन और ट्रैकिंग एक ही उद्देश्य साझा करते हैं, तो मॉडल यह सीखता है कि सीमाएं टेम्पोरल रूप से स्थिर होनी चाहिए। इसके परिणामस्वरूप मास्क वास्तविक किनारों के साथ अधिक सटीकता से जुड़ते हैं, जिसका अर्थ है कि ग्रैस्प फेल होने की संभावना कम होती है और सुरक्षा मार्जिन की कम आवश्यकता होती है।

बेहतर पाइपलाइन बनाना

वीडियो विश्लेषण या रोबोटिक्स में काम करने वाले इंजीनियरों के लिए, यह बदलाव आपके सिस्टम को आर्किटेक्ट करने के तरीके पर ठोस प्रभाव डालता है।

डिटेक्शन, सेगमेंटेशन और ट्रैकिंग को तीन अलग-अलग माइक्रोसर्विसेज के रूप में सोचना बंद करें जो कन्वेयर बेल्ट पर टेंसर्स (tensors) पास करती हैं। इसके बजाय ऐसे फ्रेमवर्क खोजें जो एक संयुक्त उद्देश्य (joint objective) प्रस्तुत करते हों। यदि आप एक कस्टम पाइपलाइन बना रहे हैं, तो विचार करें कि क्या आपका ग्राफ स्ट्रक्चर एक ही लॉस (loss) में स्पेशियल एफिनिटी (spatial affinity) और टेम्पोरल कंटिन्यूटी (temporal continuity) दोनों को एनकोड कर सकता है। भले ही आप स्वयं पूर्ण मल्टी-कट सॉल्वर को लागू न करें, फिर भी यह सिद्धांत लागू होता है। ऐसे कंस्ट्रेंट्स जोड़ें जो समय के साथ दिखने वाले स्वरूप (appearance) को प्रति-फ्रेम मास्क की गुणवत्ता से जोड़ते हों।

ऑक्लूजन (occlusion) पर आक्रामक रूप से परीक्षण करें। सरल पैटर्न में चलती अलग-थलग वस्तुओं वाला एक डेमो वीडियो पाइपलाइन दृष्टिकोण की कमजोरियों को प्रकट नहीं करेगा। ऐसे सीक्वेंस एकत्र करें जहाँ लक्ष्य एक-दूसरे के ऊपर आते हैं, जहाँ ऑक्लूजन के दौरान रोशनी बदलती है, और जहाँ वस्तुएं ऑफ-स्क्रीन से वापस आती हैं। ये वे क्षण हैं जो एक जोड़-तोड़ कर बनाई गई पाइपलाइन को वास्तव में एकीकृत पाइपलाइन से अलग करते हैं।

अपनी एनोटेशन रणनीति को सावधानीपूर्वक तैयार करें। संयुक्त मॉडलों को अक्सर शुद्ध सेगमेंटेशन या शुद्ध ट्रैकिंग डेटासेट की तुलना में अलग ग्राउंड ट्रुथ स्ट्रक्चर की आवश्यकता होती है। आपको केवल प्रति इमेज पिक्सेल क्लास के बजाय, फ्रेम्स में निरंतर रूप से इंस्टेंस पहचान (instance identities) को लेबल करने की आवश्यकता हो सकती है। शुरुआत में ही लेबलिंग में निवेश करने से डिप्लॉयमेंट के दौरान मैन्युअल सुधार कम करने में मदद मिलती है।

मुख्य निष्कर्ष

सेगमेंटेशन और ट्रैकिंग को स्वतंत्र कार्यों के रूप में मानना तब तर्कसंगत था जब कंप्यूट और मॉडल क्षमता सीमित थी। अब ऐसा नहीं है। एक मल्टी-कट फॉर्मूलेशन दिखाता है कि ये दोनों कार्य वास्तव में एक ही हैं: सुसंगत वस्तुओं को खोजना जो समय के साथ बनी रहती हैं। उन्हें एक साथ हल करके, आपको ऐसे मास्क मिलते हैं जो गति (motion) का सम्मान करते हैं और ऐसे ट्रैक्स मिलते हैं जो आकार (shape) का सम्मान करते हैं। इसका परिणाम एक ऐसा वीडियो अंडरस्टैंडिंग पाइपलाइन है जो फ्रेम्स के बीच त्रुटियों को कम करता है, चलती वस्तुओं के चारों ओर साफ सीमाएं बनाता है, और ऑक्लूजन और भीड़ की जटिल वास्तविकता के बावजूद सटीक बना रहता है।