વિડિયો અન્ડરસ્ટેન્ડિંગ એકસાથે બે મુશ્કેલ પ્રશ્નો પૂછે છે. ફ્રેમમાં શું છે, અને તે ક્યાં જઈ રહ્યું છે? કમ્પ્યુટર વિઝન સિસ્ટમોએ પરંપરાગત રીતે આના જવાબ એક પછી એક આપ્યા છે. પહેલા તેઓ સેગમેન્ટ (segment) કરે છે, પિક્સેલ્સમાંથી વસ્તુઓને અલગ કરે છે. પછી તેઓ ટ્રેક (track) કરે છે, સમય સાથે તે વસ્તુઓને જોડે છે. આ વિભાજન ઘર્ષણ પેદા કરે છે. પ્રથમ તબક્કાની ભૂલો બીજા તબક્કામાં પ્રસરી જાય છે. સીમાઓ બદલાય છે. ઓળખ બદલાઈ જાય છે. જ્યારે લોકો અથવા વાહનો એકબીજા પર ઓવરલેપ થાય છે, ત્યારે આખી પાઇપલાઇન અટકી જાય છે.
મલ્ટી-કટ ફોર્મ્યુલેશન (multi-cut formulations) પરનું તાજેતરનું કાર્ય એક અલગ માર્ગ પ્રદાન કરે છે. બે મોડેલોને સાંકળવાને બદલે, તે સેગમેન્ટેશન અને ટ્રેકિંગને એક સિંગલ ઓપ્ટિમાઇઝેશન સમસ્યા તરીકે રજૂ કરે છે. તેનું પરિણામ વધુ ચોક્કસ સીમાઓ, ઓછી ઓળખ બદલાવ (identity switches), અને જ્યારે દ્રશ્યો ભીડભાડવાળા હોય ત્યારે પણ સ્થિર રહે તેવી પાઇપલાઇન છે.
પાઇપલાઇન્સ સાથેની સમસ્યા
મોટાભાગની પ્રોડક્શન સિસ્ટમ્સ પહેલા ડિટેક્શન અથવા સેગમેન્ટેશન ચલાવે છે, અને પછી આઉટપુટ ટ્રેકિંગ મોડ્યુલને સોંપે છે. આ હેન્ડઓફ (handoff) દરમિયાન જ ભૂલો થાય છે. સ્થિર છબીઓ (still images) પર તાલીમ પામેલું સેગમેન્ટેશન મોડેલ ફ્રેમ દસમાં થોડું મોટું માસ્ક અને ફ્રેમ અગિયારમાં થોડું નાનું માસ્ક બનાવી શકે છે. માત્ર બોક્સના કેન્દ્રો અથવા એમ્બેડિંગ અંતર (embedding distances) પર ધ્યાન આપતું ટ્રેકર એ નક્કી કરવું પડે છે કે તે બંને માસ્ક એક જ વસ્તુના છે કે નહીં. તેની પાસે સેગમેન્ટરને એ કહેવાનો કોઈ રસ્તો નથી કે સીમા ખોટી દેખાય છે. આ બંને સિસ્ટમો એકબીજા સાથે વાત કરતી નથી.
જ્યારે વસ્તુઓ એકબીજા સાથે સંપર્ક કરે છે ત્યારે આ અલગતા ખર્ચાળ બની જાય છે. એક સ્ટ્રીટ ક્રોસિંગ વિશે વિચારો જ્યાં રાહદારીઓ એકબીજાની વચ્ચેથી પસાર થઈ રહ્યા હોય, અથવા રોબોટિક આર્મ બોક્સના સ્ટેકમાંથી કોઈ ચોક્કસ ભાગ પકડવા માટે આગળ વધતું હોય. આવા ક્ષણોમાં, પરંપરાગત ટ્રેકર્સ ઓળખ જાળવી રાખવા માટે મોશન મોડેલ્સ અથવા અપીરન્સ ફીચર્સ (appearance features) પર આધાર રાખે છે. જ્યારે ઓક્યુઝન (occlusion) થોડી ફ્રેમ્સ કરતાં વધુ સમય ચાલે છે, ત્યારે તે સંકેતો નિષ્ફળ જાય છે. ટ્રેકર કાં તો તે જ વસ્તુ માટે નવી ઓળખ બનાવી દે છે અથવા ઓળખને બીજી કોઈ વસ્તુ સાથે જોડી દે છે. આ દરમિયાન, સેગમેન્ટર માસ્ક બનાવવાનું ચાલુ રાખે છે, અને લેબલ્સ બદલાઈ ગયા છે તેનાથી અજાણ રહે છે. આ ડ્રિફ્ટ (drift) ને સાફ કરવા માટે ભારે પોસ્ટ-પ્રોસેસિંગ અથવા મેન્યુઅલ એનોટેશનની જરૂર પડે છે, જે ઓટોમેશનના હેતુને નિષ્ફળ બનાવે છે.
પરંપરાગત મોડેલ્સ ઘણીવાર ત્યારે જ ટ્રેક ગુમાવે છે જ્યારે વસ્તુઓ એકબીજા પર ઓવરલેપ થાય છે. આ ભૂલો યાદચ્છિક નથી; તે માળખાગત છે. જે પાઇપલાઇન સમયને ગૌણ ગણે છે, તેને સાતત્ય જાળવવામાં મુશ્કેલી પડવાની જ છે.
મલ્ટી-કટ શું લાવે છે
મલ્ટી-કટ ફોર્મ્યુલેશન સેગમેન્ટેશન અને ટ્રેકિંગ વચ્ચેની દીવાલ તોડી નાખે છે. અસંબંધિત માસ્કનો સિક્વન્સ બનાવ્યા પછી તેમને પછીથી જોડવાને બદલે, આ પદ્ધતિ એક ગ્રાફ બનાવે છે જે અવકાશ (space) અને સમય (time) બંનેમાં ફેલાયેલો હોય છે. દરેક ફ્રેમમાં દરેક સંભવિત ઓબ્જેક્ટ રીજન એક નોડ (node) બની જાય છે. એજિસ (Edges) એવા રીજન્સને જોડે છે જે એક જ એન્ટિટીના હોઈ શકે છે, એક જ ફ્રેમમાં અને ક્રમિક ફ્રેમ્સમાં પણ. ત્યારબાદ અલ્ગોરિધમ એ એજિસને કાપવાની શ્રેષ્ઠ રીત શોધે છે જેથી બાકીના કનેક્ટેડ ઘટકો વિડિયોમાં કુદરતી રીતે હલતી સુસંગત વસ્તુઓ બનાવે.
નિર્ણય વૈશ્વિક (global) હોવાને કારણે, ફ્રેમ પંદરના બોર્ડર કરેક્શન પર ફ્રેમ પાંચના પુરાવા દ્વારા પ્રભાવ પડી શકે છે. જો બે લોકો એકબીજાના રસ્તામાં આવે છે, તો ફોર્મ્યુલેશનને માત્ર વેલોસિટીના આધારે અનુમાન લગાવવાની જરૂર નથી. તે એકસાથે અપીરન્સ, આકાર, મોશન અને
ભીડવાળી દ્રશ્યો. જ્યારે લોકો એકબીજાની નજીક ભેગા થાય છે ત્યારે સર્વેલન્સ અને ક્રાઉડ-કાઉન્ટિંગ એપ્લિકેશન્સની ચોકસાઈ ઘટી જાય છે. અલગ-અલગ ટ્રેકર્સ ઘણીવાર ઓળખને મિક્સ કરી દે છે અથવા શરીર વચ્ચેના ખાલી ભાગમાં કાલ્પનિક (phantom) ઓબ્જેક્ટ્સ બનાવે છે. વિઝ્યુઅલ પુરાવાઓને સીધા ટ્રેકિંગ લોજિક સાથે જોડીને, મલ્ટી-કટ અભિગમ ભીડવાળી દ્રશ્યોમાં ઓબ્જેક્ટની ઓળખને વધુ સારી રીતે જાળવી રાખે છે. વ્યક્તિઓ જ્યારે તેમના બાઉન્ડિંગ બોક્સ લગભગ સંપૂર્ણપણે એકબીજા પર ઓવરલેપ થાય છે, ત્યારે પણ તેઓ અલગ ઓળખાય છે.
સીમાની અખંડિતતા. રોબોટિક્સમાં, પિક-એન્ડ-પ્લે સિસ્ટમને પકડવા (grasp) માટે સચોટ ઓબ્જેક્ટ કન્ટોર્સની જરૂર હોય છે. એવું સેગ્મેન્ટેશન મોડેલ જે ટેમ્પોરલ સંદર્ભને અવગણે છે, તે બેકગ્રાઉન્ડનો ભાગ સામેલ કરી શકે છે અથવા વસ્તુના કોઈ ખૂણાને કાપી શકે છે. જ્યારે સેગ્મેન્ટેશન અને ટ્રેકિંગ એક જ ઉદ્દેશ્ય ધરાવે છે, ત્યારે મોડેલ શીખે છે કે સીમાઓ સમયાનુસાર સ્થિર (temporally stable) હોવી જોઈએ. પરિણામે મળતા માસ્ક વાસ્તવિક કિનારીઓ સાથે વધુ ચોકસાઈથી જોડાય છે, જેનો અર્થ છે કે પકડવામાં થતી નિષ્ફળતાઓ ઓછી થશે અને સુરક્ષા માટે વધારાના માર્જિનની જરૂરિયાત ઘટશે.
બહેતર પાઇપલાઇન્સ બનાવવી
વિડિયો એનાલિસિસ અથવા રોબોટિક્સમાં કામ કરતા એન્જિનિયરો માટે, આ ફેરફાર તમારી સિસ્ટમ કેવી રીતે આર્કિટેક્ટ કરવી તેના પર નક્કર અસરો પાડે છે.
ડિટેક્શન, સેગ્મેન્ટેશન અને ટ્રેકિંગને કન્વેયર બેલ્ટ પર ટેન્સર પસાર કરતી ત્રણ અલગ-અલગ માઇક્રોસર્વિસ તરીકે વિચારવાનું બંધ કરો. તેના બદલે એવા ફ્રેમવર્ક શોધો જે સંયુક્ત ઉદ્દેશ્ય (joint objective) પ્રદાન કરે. જો તમે કસ્ટમ પાઇપલાઇન બનાવી રહ્યા હોવ, તો વિચાર કરો કે શું તમારું ગ્રાફ સ્ટ્રક્ચર એક જ લોસમાં સ્પેસિયલ એફિનિટી અને ટેમ્પોરલ કન્ટિન્યુટી બંનેને એન્કોડ કરી શકે છે. ભલે તમે પોતે સંપૂર્ણ મલ્ટી-કટ સોલ્વર અમલમાં ન મૂકો, તેમ છતાં આ સિદ્ધાંત લાગુ પડે છે. એવા કન્સ્ટ્રેઇન્ટ્સ ઉમેરો જે સમય જતાં દેખાવને (appearance) ફરીથી દરેક ફ્રેમના માસ્કની ગુણવત્તા સાથે જોડે.
ઓકલ્યુઝન (occlusion) પર આક્રમક રીતે ટેસ્ટિંગ કરો. સાદા પેટર્નમાં હલતી અલગ પડેલી વસ્તુઓ ધરાવતો ડેમો વિડિયો પાઇપલાઇન અભિગમની નબળાઈઓ દર્શાવશે નહીં. એવા સીક્વન્સ એકત્રિત કરો જ્યાં લક્ષ્યો એકબીજા પર ઓવરલેપ થાય છે, જ્યાં ઓકલ્યુઝન દરમિયાન લાઇટિંગ બદલાય છે, અને જ્યાં વસ્તુઓ સ્ક્રીનની બહારથી ફરીથી પ્રવેશે છે. આ એવા ક્ષણો છે જે એક સામાન્ય રીતે જોડાયેલી પાઇપલાઇનને ખરા અર્થમાં એકીકૃત પાઇપલાઇનથી અલગ પાડે છે.
તમારી એનોટેશન વ્યૂહરચના કાળજીપૂર્વક તૈયાર કરો. જોઈન્ટ મોડેલ્સને ઘણીવાર શુદ્ધ સેગ્મેન્ટેશન અથવા શુદ્ધ ટ્રેકિંગ ડેટાસેટ્સ કરતા અલગ ગ્રાઉન્ડ ટ્રુથ સ્ટ્રક્ચર્સની જરૂર હોય છે. તમારે માત્ર દરેક ઇમેજ દીઠ પિક્સેલ ક્લાસ જ નહીં, પરંતુ ફ્રેમ્સમાં ઇન્સ્ટન્સ ઓળખને સતત રીતે લેબલ કરવાની જરૂર પડી શકે છે. શરૂઆતમાં આ લેબલિંગમાં રોકાણ કરવાથી ડિપ્લોયમેન્ટ દરમિયાન મેન્યુઅલ સુધારણામાં ઘટાડો થશે અને ફાયદો થશે.
મુખ્ય નિષ્કર્ષ
સેગ્મેન્ટેશન અને ટ્રેકિંગને સ્વતંત્ર કાર્યો તરીકે જોવું ત્યારે યોગ્ય હતું જ્યારે કમ્પ્યુટ અને મોડેલ ક્ષમતા મર્યાદિત હતી. હવે તે યોગ્ય નથી. મલ્ટી-કટ ફોર્મ્યુલેશન દર્શાવે છે કે આ બંને કાર્યો ખરેખર એક જ છે: સમય જતાં ટકી રહેતા સુસંગત ઓબ્જેક્ટ્સ શોધવા. તેમને સાથે ઉકેલીને, તમને એવા માસ્ક મળે છે જે ગતિનું સન્માન કરે છે અને એવા ટ્રેક્સ મળે છે જે આકારનું સન્માન કરે છે. તેનું પરિણામ એક એવું વિડિયો અન્ડરસ્ટેન્ડિંગ પાઇપલાઇન છે જે ફ્રેમ્સ વચ્ચેની ભૂલો ઘટાડે છે, હલતી વસ્તુઓની આસપાસ સ્વચ્છ સીમાઓ બનાવે છે, અને ઓકલ્યુઝન તથા ભીડની જટિલ વાસ્તવિકતા વચ્ચે પણ સચોટ રહે છે.
