Pemahaman video mengajukan dua soalan sukar secara serentak. Apakah yang ada di dalam bingkai, dan ke mana ia pergi? Sistem penglihatan komputer secara tradisinya menjawab soalan-soalan ini satu demi satu. Pertama, ia melakukan segmentasi, memisahkan objek daripada piksel. Kemudian, ia melakukan penjejakan, menghubungkan objek-objek tersebut merentasi masa. Pembahagian ini mewujudkan geseran. Ralat daripada peringkat pertama meresap ke peringkat kedua. Sempadan beralih. Identiti bertukar. Apabila orang atau kenderaan bertindih, keseluruhan pipeline terhenti.
Kerja penyelidikan baru-baru ini mengenai formulasi multi-cut menawarkan jalan yang berbeza. Daripada menyambung dua model, ia membingkai segmentasi dan penjejakan sebagai satu masalah pengoptimuman tunggal. Hasilnya ialah sempadan yang lebih ketat, pertukaran identiti yang lebih sedikit, dan pipeline yang kekal stabil apabila babak menjadi sesak.
Masalah dengan Pipeline
Kebanyakan sistem pengeluaran menjalankan pengesanan atau segmentasi terlebih dahulu, kemudian menyerahkan output kepada modul penjejakan. Penyerahan itulah tempat segalanya menjadi salah. Model segmentasi yang dilatih pada imej pegun mungkin menghasilkan topeng (mask) yang sedikit terlalu besar pada bingkai sepuluh dan sedikit terlalu kecil pada bingkai sebelas. Penjejak yang hanya melihat pusat kotak atau jarak pembenaman (embedding distances) perlu memutuskan sama ada kedua-dua topeng tersebut milik objek yang sama. Ia tidak mempunyai cara untuk memberi maklum balas dan memberitahu penyegmentasi bahawa sempadan tersebut kelihatan salah. Kedua-dua sistem ini tidak berkomunikasi.
Pengasingan ini menjadi sukar apabila objek berinteraksi. Bayangkan lintasan jalan dengan pejalan kaki yang berselirat antara satu sama lain, atau lengan robot yang mencapai melampaui timbunan kotak untuk memegang bahagian tertentu. Dalam saat-saat ini, penjejak tradisional bergantung pada model gerakan atau ciri rupa untuk mengekalkan identiti. Apabila oklusi (occlusion) berlarutan lebih daripada beberapa bingkai, petunjuk tersebut runtuh. Penjejak sama ada mencipta identiti baharu untuk objek yang sama atau memindahkan identiti tersebut kepada objek yang berbeza. Sementara itu, penyegmentasi terus menghasilkan topeng, tanpa menyedari bahawa label telah terpesong. Membersihkan pesongan tersebut memerlukan pemprosesan pasca yang berat atau anotasi manual, yang menjejaskan tujuan automasi.
Model tradisional sering hilang jejak tepat pada masanya apabila objek bertindih. Ralat tersebut bukan rawak; ia adalah bersifat struktural. Pipeline yang menganggap masa sebagai perkara sampingan pasti akan bergelut dengan kesinambungan.
Apa yang Dibawa oleh Multi-Cut
Formulasi multi-cut meruntuhkan tembok antara segmentasi dan penjejakan. Daripada menghasilkan urutan topeng yang tidak bersambung dan kemudian menjahitnya bersama selepas itu, kaedah ini membina graf yang merangkumi ruang dan masa. Setiap kawasan objek yang berpotensi dalam setiap bingkai menjadi nod. Tepi (edges) menghubungkan kawasan yang mungkin milik entiti yang sama, sama ada dalam satu bingkai tunggal mahupun merentasi bingkai berturutan. Algoritma tersebut kemudian mencari cara optimum untuk memotong tepi tersebut supaya komponen bersambung yang berbaki membentuk objek konsisten yang bergerak secara semula jadi melalui video.
Oleh kerana keputusan adalah bersifat global, pembetulan sempadan pada bingkai lima belas boleh dipengaruhi oleh bukti pada bingkai lima. Jika dua orang berselisih jalan, formulasi tersebut tidak perlu meneka berdasarkan halaju sahaja. Ia mempertimbangkan rupa, bentuk, gerakan, dan koheren sempadan secara serentak. Kualiti topeng dan kualiti penjejakan dioptimumkan di bawah objektif yang sama. Apabila penyelesai (solver) menetapkan sesuatu identiti, ia telah menyemak bahawa piksel yang berkaitan masuk akal secara spatial. Gandingan ini membolehkan rangka kerja pulih daripada oklusi yang akan merosakkan pendekatan pipeline.
Menghubungkan data visual secara langsung kepada logik penjejakan menutup gelung maklum balas. Segmentasi memaklumkan penjejakan, dan kekangan penjejakan membersihkan segmentasi. Anda mendapat hasil yang lebih tepat dengan lebih sedikit pembetulan manual kerana sistem tidak lagi meneka secara terasing pada setiap langkah.
Di Mana Ini Muncul dalam Praktik
Manfaat formulasi bersatu bukan sekadar teori. Ia penting dalam tiga bidang khusus yang sering muncul semasa penggunaan.
Ketekalan bingkai-ke-bingkai. Dalam analitik sukan, siluet atlet perlu kekal tepat supaya metrik biomekanik seperti panjang langkah atau sudut sendi dapat diekstrak dengan boleh dipercayai. Jika segmentasi goyah secara bebas daripada penjejakan, kinematik yang terhasil akan menjadi bising (noisy). Formulasi bersatu menghapuskan kegoyahan tersebut dengan menganggap garis luar atlet sebagai satu entiti berterusan merentasi keseluruhan klip.
Suasana sesak. Aplikasi pengawasan dan pengiraan orang ramai hilang ketepatan apabila orang ramai berkumpul rapat. Penjejak yang berasingan sering menggabungkan identiti atau mencipta objek halimunan dalam ruang di antara badan. Dengan menghubungkan bukti visual secara langsung ke dalam logik penjejakan, pendekatan multi-cut mengekalkan identiti objek dengan lebih baik dalam suasana sesak. Individu kekal berbeza walaupun kotak sempadan (bounding box) mereka hampir bertindih sepenuhnya.
Integriti sempadan. Dalam robotik, sistem ambil-dan-letak (pick-and-place) memerlukan kontur objek yang tepat untuk merancang pegangan. Model segmentasi yang mengabaikan konteks temporal mungkin menyertakan sebahagian daripada latar belakang atau memotong bahagian bucu item. Apabila segmentasi dan penjejakan berkongsi satu objektif yang sama, model tersebut belajar bahawa sempadan haruslah stabil secara temporal. Topeng (mask) yang terhasil akan mengikut tepi sebenar dengan lebih kemas, yang bermaksud kurang kegagalan pegangan dan kurang keperluan untuk margin keselamatan yang konservatif.
Membina Saluran (Pipeline) yang Lebih Baik
Bagi jurutera yang bekerja dalam analisis video atau robotik, peralihan ini mempunyai implikasi konkrit terhadap cara anda merangka seni bina sistem anda.
Berhenti menganggap pengesanan, segmentasi, dan penjejakan sebagai tiga mikroperkhidmatan berasingan yang menghantar tensor melalui tali sawat. Sebaliknya, carilah rangka kerja (framework) yang mendedahkan objektif bersama. Jika anda sedang membina saluran (pipeline) tersuai, pertimbangkan sama ada struktur graf anda boleh mengekodkan afiniti spatial dan kesinambungan temporal dalam fungsi kerugian (loss) yang sama. Walaupun anda tidak melaksanakan penyelesai (solver) multi-cut sepenuhnya sendiri, prinsip ini tetap terpakai. Tambahkan kekangan yang mengaitkan rupa bentuk merentasi masa kembali ke dalam kualiti topeng bagi setiap bingkai.
Uji secara agresif pada oklusi. Video demo dengan objek terasing yang bergerak dalam corak ringkas tidak akan mendedahkan kelemahan pendekatan saluran (pipeline). Kumpulkan urutan di mana sasaran bertindih, di mana pencahayaan berubah semasa oklusi, dan di mana objek masuk semula dari luar skrin. Inilah saat-saat yang membezakan saluran yang sekadar "dicantumkan" dengan saluran yang benar-benar bersepadu.
Sediakan strategi anotasi anda dengan teliti. Model bersama sering memerlukan struktur ground truth yang berbeza daripada set data segmentasi tulen atau penjejakan tulen. Anda mungkin perlu melabel identiti instans secara konsisten merentasi bingkai, bukan sekadar kelas piksel bagi setiap imej. Pelaburan dalam pelabelan awal tersebut akan membuahkan hasil kemudian melalui pengurangan pembetulan manual semasa pelaksanaan.
Kesimpulan Utama
Menganggap segmentasi dan penjejakan sebagai tugasan berasingan adalah munasabah apabila kuasa pengkomputeran dan kapasiti model adalah terhad. Kini tidak lagi. Formulasi multi-cut menunjukkan bahawa kedua-dua tugas tersebut sebenarnya adalah satu: mencari objek koheren yang kekal merentasi masa. Dengan menyelesaikannya bersama, anda akan mendapat topeng yang menghormati pergerakan dan jejak yang menghormati bentuk. Hasilnya ialah saluran pemahaman video yang mengurangkan ralat antara bingkai, mencipta sempadan yang lebih kemas di sekeliling objek yang bergerak, dan kekal tepat melalui realiti oklusi dan kesesakan yang mencabar.
