Dlaczego tłumy paraliżują wizję komputerową

Wyobraź sobie zatłoczony peron metra podczas porannego szczytu. Ludzie stłoczeni są obok siebie, ramiona się zderzają, a teczki wymachują między nieznajomymi. Dla ludzkiego oka to chaos, ale chaos kontrolowany. Wciąż możesz śledzić znajomego w tłumie lub dostrzec kogoś machającego z drugiego końca peronu. Dla systemów wizji komputerowej ta sama scena jest polem minowym. Gdy dziesiątki osób nakładają się na siebie w pojedynczej klatce, standardowe modele detekcji i śledzenia zaczynają zawodzić. Ramki otaczające zlewają się. Tożsamości się zamieniają. Ludzie znikają za innymi i nigdy nie powracają z tą samą etykietą.

Ta przepaść między czystymi warunkami laboratoryjnymi a chaotyczną rzeczywistością jest dokładnie tym, co wyzwanie CVPR19 Tracking and Detection Challenge miało za zadanie zasypać. Zamiast testować modele na rzadkich, dobrze oświetlonych scenach, gdzie każda osoba stoi w izolacji, wyzwanie wymusiło na nich pracę w gęstym środowisku, gdzie wysoka gęstość prowadzi bezpośrednio do okluzji, a okluzja powoduje trudne do naprawienia błędy w śledzeniu tożsamości. Badacze od tego czasu wykorzystują ten benchmark jako poligon doświadczalny, aby znaleźć lepsze sposoby radzenia sobie z tymi błędami, zanim wymkną się one spod kontroli.

Co tak naprawdę sprawdza to wyzwanie

Wyzwanie CVPR19 nie traktowało tłumu jako pojedynczego problemu. Rozbiło ono trudność na cztery obszary koncentracji, które obnażają różne słabości standardowych potoków przetwarzania.

Dokładność detekcji obiektów w tłumie. Na rzadko zaludnionym parkingu detektor może narysować czystą ramkę wokół każdego pieszego. W zatłoczonym korytarzu stadionu ta sama sieć często reaguje na nakładające się tułowia, albo łącząc kilka osób w jedną wielką ramkę otaczającą, albo całkowicie pomijając częściowo ukryte ciała. Wyzwanie ocenia, czy model potrafi nadal lokalizować poszczególne osoby, gdy widoczna pozostaje jedynie głowa, ramię lub bark.

Stabilność śledzenia wielu obiektów. Śledzenie jest łatwe, gdy jedna osoba porusza się po pustym pokoju. Staje się brutalnie trudne, gdy kamera musi monitorować pięćdziesiąt osób przechodzących jednocześnie przez plac. Wyzwanie sprawdza stabilność trackera, mierząc, czy trajektorie pozostają spójne, gdy ludzie przecinają się nawzajem. Pojedyncza klatka niepewności może spowodować, że tracker przejmie błędną tożsamość lub wygeneruje duplikujący się ślad, który utrzymuje się przez minuty.

Radzenie sobie z częstymi okluzjami. Okluzja w tłumie nie jest sporadyczną przeszkodą. Jest stała i dynamiczna. Jeden pieszy zasłania drugiego przez trzy klatki, potem w lukę wchodzi trzecia osoba, a pierwotny pieszy pojawia się ponownie pod innym kątem. Statyczne okluzje, takie jak filary czy zaparkowane samochody, są przewidywalne. Ludzkie tłumy nieustannie się zmieniają, a wyzwanie kładzie nacisk na regenerację. Gdy ktoś wyłania się zza grupy, czy model go rozpoznaje, czy traktuje go jako zupełnie nową osobę?

Utrzymywanie tożsamości podczas ruchu. Trwałość tożsamości zależy od czegoś więcej niż tylko rozpoznawania twarzy. Gdy ludzie poruszają się w gęstej scenie, zmienia się ich skala, ich poza zmienia się z frontalnej na profilową, a oświetlenie różni się w różnych częściach otoczenia. Wyzwanie sprawdza, czy system potrafi zachować ten sam identyfikator dla osoby, która przechodzi dwadzieścia metrów przez gęsty tłum, nawet jeśli ta osoba była wielokrotnie zasłonięta i widoczne pozostają jedynie fragmenty jej wyglądu.

Od benchmarku do realnego wpływu

Poprawa wydajności na tych czterech polach nie jest jedynie ćwiczeniem akademickim. Lepsze modele bezpośrednio wpływają na to, jak systemy autonomiczne i narzędzia nadzoru działają w rzeczywistych warunkach.

Rozważmy pojazd autonomiczny zbliżający się do zatłoczonego przejścia dla pieszych podczas festiwalu. Piesi nie idą uporządkowanymi rzędami. Gromadzą się, pchają wózki i wychodzą jeden za drugim. Jeśli system śledzenia pojazdu straci tożsamość pieszego w momencie, gdy ten schowa się za inną osobą, samochód nie będzie mógł przewidzieć, gdzie ten pieszy się pojawi. Może założyć, że zagrożenie zniknęło, lub co gorsza, pomylić ukrytego pieszego z kimś innym i błędnie obliczyć jego trajektorię. Stabilne śledzenie w tłumie to wymóg bezpieczeństwa, a nie luksus.

Sieci monitoringu mierzą się z analogicznym problemem. Operator bezpieczeństwa obserwujący węzeł przesiadkowy nie potrzebuje systemu, który potrafi wykryć ludzi w pustym korytarzu. Potrzebuje takiego, który będzie dokładnie liczył osoby podczas ewakuacji stacji, gdy setki pasażerów kierują się do jednego wyjścia. Jeśli okluzja powoduje ciągłe zmiany tożsamości, system generuje bezużyteczne dane: ta sama osoba jest rejestrowana jako pięć oddzielnych jednostek, a grupy ludzi jako pojedyncze plamy. To niszczy wszelką późniejszą analizę, niezależnie od tego, czy mierzysz przepływ tłumu, identyfikujesz podejrzane zachowania, czy koordynujesz akcję ratunkową.

Korzyści płyną również z robotyki handlowej i magazynowej. Pojazdy automatycznie prowadzone (AGV) muszą poruszać się alejkami, w których pracownicy zbierają zapasy. W tych wąskich przestrzeniach częściowe zasłonięcie występuje stale. Robot, który straci z oczu pracownika za regałem, może zaplanować trasę zbyt blisko niego, gdy ta osoba wyjdzie zza przeszkody. Umiejętność utrzymania tożsamości mimo krótkotrwałego zniknięcia sprawia, że interakcja człowiek-robot jest bezpieczna.

Techniczna rzeczywistość stojąca za wynikami

Badacze biorący udział w benchmarku CVPR19 szybko nauczyli się, że traktowanie detekcji i śledzenia jako oddzielnych etapów mnoży współczynnik błędów. Detektor, który gubi częściowo zasłoniętą osobę, pozbawia tracker danych. Tracker, który polega wyłącznie na bliskości przestrzennej, przypisze błędną tożsamość pierwszej widocznej części ciała, która wyłoni się zza przeszkody.

Z tego powodu wyzwanie to zachęciło do zintegrowanego podejścia. Zespoły skupiły się na reprezentacjach cech, które przetrwają fragmentację. Jeśli deskryptor całego ciała zawodzi, gdy nogi są ukryte, model musi mocniej polegać na tym, co pozostaje widoczne, np. na tułowiu lub wzorcu chodu. Inni postawili na rozumowanie czasowe, wykorzystując modele ruchu do przewidywania, gdzie prawdopodobnie pojawi się zasłonięta osoba, aby system mógł wznowić śledzenie bez czekania na ponowną detekcję całego ciała.

Wyzwanie to uwypukliło również znaczenie heurystyk odzyskiwania. W scenach o niskiej gęstości tracker może bezpiecznie założyć, że nowa detekcja w pobliżu starej pozycji należy do tej samej osoby. W tłumie takie założenie tworzy efekt domina wymian tożsamości. Lepsze systemy nauczyły się wstrzymywać się przed ponownym przypisaniem tożsamości, zbierając kilka klatek dowodów po ustąpieniu okluzji, zanim ostatecznie potwierdzą dopasowanie.

Dlaczego gęstość jest testem uczciwości

Wizja komputerowa nie ma niedoboru benchmarków. To, co czyni wyzwanie CVPR19 Tracking and Detection Challenge pamiętnym, to fakt, że pozbawia ono komfort pustych teł i odizolowanych obiektów. Model, który osiąga tu dobre wyniki, udowodnił, że potrafi poradzić sobie z szumem wizualnym definiującym rzeczywiste środowiska ludzkie. Gęstość jest testem uczciwości. Obnaża ona kruche założenia dotyczące separacji obiektów i stałej widoczności.

Jeśli chcesz zobaczyć, jak poradziły sobie konkretne metody i jakie architektury okazały się obiecujące pod takim naciskiem, możesz przeczytać pełną analizę tutaj. A jeśli budujesz rozwiązania w tej dziedzinie i chcesz porozmawiać o szczegółach z innymi, którzy zmagają się z tymi samymi problemami z okluzją, dołącz do społeczności uczącej się tutaj. Praca nad śledzeniem w tłumie jest daleka od ukończenia, a prawdziwym testem zawsze jest to, co dzieje się, gdy scena staje się zatłoczona.