يطرح فهم الفيديو سؤالين صعبين في آن واحد: ما الذي يوجد في الإطار، وإلى أين يتجه؟ لطالما أجابت أنظمة الرؤية الحاسوبية على هذين السؤالين بشكل منفصل؛ فهي تبدأ بالتجزئة (segmentation)، حيث تقوم بفصل الأجسام عن البكسلات، ثم تنتقل إلى التتبع (tracking)، لربط تلك الأجسام عبر الزمن. هذا الانفصال يخلق نوعًا من الاحتكاك، حيث تتسرب الأخطاء من المرحلة الأولى إلى الثانية، فتتغير الحدود وتتبدل الهويات. وعندما يتداخل الأشخاص أو المركبات، يتوقف مسار المعالجة بأكمله.

تقدم الأبحاث الحديثة حول صيغ الـ multi-cut مسارًا مختلفًا؛ فبدلاً من ربط نموذجين معًا، تقوم هذه الصيغة بصياغة التجزئة والتتبع كمسألة تحسين واحدة. والنتيجة هي حدود أكثر دقة، وتبديلات أقل في الهويات، ومسار معالجة متماسك حتى عندما تصبح المشاهد مزدحمة.

المشكلة في مسارات المعالجة

تقوم معظم أنظمة الإنتاج بتشغيل الكشف أو التجزئة أولاً، ثم تسلم المخرجات إلى وحدة التتبع. وهنا تكمن نقطة الخلل؛ فقد ينتج نموذج التجزئة المدرب على صور ثابتة قناعًا أكبر قليلاً من اللازم في الإطار العاشر، وأصغر قليلاً في الإطار الحادي عشر. ويضطر المتتبع، الذي ينظر فقط إلى مراكز الصناديق أو مسافات التضمين (embedding distances)، إلى اتخاذ قرار بشأن ما إذا كان هذان القناعان ينتميان إلى نفس الجسم. ليس لدى المتتبع وسيلة للاعتراض وإخبار نموذج التجزئة بأن الحدود تبدو خاطئة، فكلا النظامين لا يتواصلان مع بعضهما البعض.

يصبح هذا الانفصال مكلفًا عندما تتفاعل الأجسام. تخيل عبورًا في الشارع حيث يتداخل المشاة مع بعضهم البعض، أو ذراعًا روبوتية تمتد فوق كومة من الصناديق للإمساك بقطعة معينة. في هذه اللحظات، تعتمد أدوات التتبع التقليدية على نماذج الحركة أو سمات المظهر للحفاظ على الهوية. ولكن عندما يستمر الاحتجاب (occlusion) لأكثر من بضعة إطارات، تنهار تلك الإشارات؛ فيقوم المتتبع إما باختراع هوية جديدة لنفس الجسم أو نقل الهوية إلى جسم آخر. وفي هذه الأثناء، يستمر نموذج التجزئة في إنتاج الأقنعة، غير مدرك تمامًا أن التصنيفات قد انحرفت. وتتطلب معالجة هذا الانحراف عمليات معالجة لاحقة مكثفة أو توسيمًا يدويًا، مما يفقد الأتمتة الغرض منها.

غالبًا ما تفقد النماذج التقليدية مسار التتبع تحديدًا عندما تتداخل الأجسام. هذه الأخطاء ليست عشوائية، بل هي أخطاء هيكلية؛ فمسار المعالجة الذي يعامل الوقت كأمر ثانوي محكوم عليه بالمعاناة مع الاستمرارية.

ما الذي تقدمه صيغة الـ multi-cut

تذيب صيغة الـ multi-cut الجدار الفاصل بين التجزئة والتتبع. فبدلاً من إنتاج سلسلة من الأقنعة المنفصلة ثم محاولة ربطها لاحقًا، تقوم هذه الطريقة ببناء مخطط (graph) يمتد عبر الزمان والمكان. تصبح كل منطقة جسم محتملة في كل إطار عبارة عن عقدة (node). وتربط الحواف (edges) بين المناطق التي قد تنتمي إلى نفس الكيان، سواء داخل إطار واحد أو عبر إطارات متتالية. ثم تجد الخوارزمية الطريقة المثلى لقطع تلك الحواف بحيث تشكل المكونات المتصلة المتبقية أجسامًا متسقة تتحرك بشكل طبيعي عبر الفيديو.

ولأن القرار شامل، يمكن لتصحيح الحدود في الإطار الخامس عشر أن يتأثر بالأدلة الموجودة في الإطار الخامس. إذا تقاطع مسار شخصين، فلا تضطر الصيغة إلى التخمين بناءً على السرعة وحدها، بل توازن بين المظهر والشكل والحركة وتماسك الحدود في آن واحد. يتم تحسين جودة القناع وجودة التتبع تحت هدف واحد. وعندما يستقر المحلل (solver) على هوية معينة، يكون قد تحقق بالفعل من أن البكسلات المقابلة منطقية من الناحية المكانية. وهذا الاقتران هو ما يسمح للإطار باستعادة المسار من حالات الاحتجاب التي قد تؤدي إلى تعطل مسار المعالجة التقليدي.

إن ربط البيانات المرئية مباشرة بمنطق التتبع يغلق حلقة التغذية الراجعة؛ حيث توفر التجزئة معلومات للتتبع، وتقوم قيود التتبع بتنقية التجزئة. وبذلك تحصل على نتائج أكثر دقة مع عدد أقل من التصحيحات اليدوية، لأن النظام لم يعد يخمن بمعزل عن غيره في كل خطوة.

أين يظهر هذا في الممارسة العملية

فوائد الصيغة الموحدة ليست نظرية فحسب، بل هي مهمة في ثلاثة مجالات محددة تظهر باستمرار عند النشر الفعلي.

الاتساق من إطار إلى إطار. في التحليلات الرياضية، يجب أن يظل ظل الرياضي دقيقًا حتى يمكن استخراج المقاييس الميكانيكية الحيوية، مثل طول الخطوة أو زوايا المفاصل، بشكل موثوق. إذا تذبذبت التجزئة بشكل مستقل عن التتبع، فستصبح الكينماتيكا (kinematics) الناتجة مشوشة. وتقضي الصيغة الموحدة على هذا التذبذب من خلال التعامل مع الخطوط الخارجية للرياضي ككيان واحد مستمر عبر المقطع بأكمله.

المشاهد المزدحمة. تفقد تطبيقات المراقبة وعدّ الحشود دقتها عندما يتجمع الأشخاص معاً. غالباً ما تدمج أدوات التتبع المنفصلة الهويات أو تنشئ أجساماً وهمية في الفجوات بين الأجساد. ومن خلال ربط الأدلة المرئية مباشرة بمنطق التتبع، يحافظ نهج multi-cut على هوية الكائن بشكل أفضل في المشاهد المزدحمة. تظل الأفراد متميزة حتى عندما تتداخل صناديق الإحاطة (bounding boxes) الخاصة بهم بشكل شبه كامل.

سلامة الحدود. في مجال الروبوتات، يحتاج نظام الالتقاط والوضع (pick-and-place) إلى حدود دقيقة للكائنات لتخطيط عمليات الإمساك. قد يتضمن نموذج التجزئة (segmentation model) الذي يتجاهل السياق الزمني جزءاً من الخلفية أو يقص زاوية من العنصر. عندما تتشارك التجزئة والتتبع في هدف واحد، يتعلم النموذج أن الحدود يجب أن تكون مستقرة زمنياً. تلتصق الأقنعة (masks) الناتجة بالحواف الحقيقية بشكل أكثر دقة، مما يعني فشلاً أقل في عمليات الإمساك وحاجة أقل لهوامش أمان تحفظية.

بناء مسارات عمل (Pipelines) أفضل

بالنسبة للمهندسين العاملين في تحليل الفيديو أو الروبوتات، فإن هذا التحول له تداعيات ملموسة على كيفية تصميم هيكلية نظامك.

توقف عن التفكير في الكشف (detection)، والتجزئة (segmentation)، والتتبع (tracking) كخدمات مصغرة منفصلة تمرر الموترات (tensors) عبر حزام ناقل. ابحث بدلاً من ذلك عن أطر عمل تظهر هدفاً مشتركاً. إذا كنت تبني مسار عمل مخصصاً، ففكر فيما إذا كانت بنية الرسم البياني (graph structure) الخاصة بك يمكنها ترميز كل من التقارب المكاني (spatial affinity) والاستمرارية الزمنية (temporal continuity) في نفس دالة الخسارة (loss). حتى لو لم تقم بتنفيذ حلّال multi-cut بالكامل بنفسك، فإن المبدأ لا يزال سارياً. أضف قيوداً تربط المظهر بمرور الوقت بجودة القناع لكل إطار.

اختبر بقوة في حالات الحجب (occlusion). لن يكشف فيديو تجريبي يحتوي على أجسام معزولة تتحرك في أنماط بسيطة عن نقاط ضعف نهج مسارات العمل المتسلسلة. اجمع تسلسلات تتداخل فيها الأهداف، وتتغير فيها الإضاءة أثناء الحجب، وتدخل فيها الأجسام مجدداً من خارج الشاشة. هذه هي اللحظات التي تميز مسار العمل "الملصق ببعضه" عن المسار الموحد حقاً.

جهز استراتيجية التوسيم (annotation) الخاصة بك بعناية. غالباً ما تحتاج النماذج المشتركة إلى هياكل "الحقيقة الأرضية" (ground truth) مختلفة عن مجموعات بيانات التجزئة البحتة أو التتبع البحت. قد تحتاج إلى تسمية هويات المثيلات (instance identities) بشكل متسق عبر الإطارات، وليس فقط فئات البكسل لكل صورة. الاستثمار في هذا التوسيم مسبقاً يؤتي ثماره لاحقاً من خلال تقليل التصحيح اليدوي أثناء النشر.

الخلاصة الحقيقية

كان التعامل مع التجزئة والتتبع كمهام مستقلة منطقياً عندما كانت القدرة الحوسبية وسعة النماذج محدودة، لكن الأمر لم يعد كذلك الآن. تظهر صياغة multi-cut أن المهمتين هما في الواقع مهمة واحدة: العثور على أجسام متماسكة تستمر عبر الزمن. من خلال حلهما معاً، ستحصل على أقنعة تحترم الحركة ومسارات تحترم الشكل. النتيجة هي مسار عمل لفهم الفيديو يقلل الأخطاء بين الإطارات، ويخلق حدوداً أكثر نظافة حول الأجسام المتحركة، ويظل دقيقاً وسط الواقع الفوضوي للحجب والحشود.