视频理解同时面临两个难题:画面中有什么?它要去哪里?传统的计算机视觉系统通常是依次解决这两个问题的。首先进行分割,从像素中提取出物体;然后进行跟踪,将这些物体在时间维度上连接起来。这种分离会产生摩擦。第一阶段的错误会渗透到第二阶段。边界发生偏移,身份发生切换。当人或车辆发生重叠时,整个流水线就会陷入停滞。
最近关于多切分建模(multi-cut formulations)的研究提供了一条不同的路径。它不再是简单地将两个模型串联起来,而是将分割和跟踪建模为一个统一的优化问题。其结果是更紧凑的边界、更少的身份切换,以及在场景拥挤时仍能保持稳定的流水线。
流水线架构的问题
大多数生产系统首先运行检测或分割,然后将输出传递给跟踪模块。而这种交接正是问题所在。一个在静态图像上训练的分割模型,可能会在第 10 帧产生一个略大的掩码(mask),而在第 11 帧产生一个略小的掩码。一个仅观察边界框中心或嵌入距离(embedding distances)的跟踪器必须决定这两个掩码是否属于同一个物体。它无法反馈并告诉分割器边界看起来不对。这两个系统之间是互不沟通的。
当物体发生交互时,这种分离的代价会变得非常高昂。想想行人穿梭交织的十字路口,或者机械臂越过一堆箱子去抓取特定零件的场景。在这些时刻,传统的跟踪器依赖运动模型或外观特征来维持身份。当遮挡持续超过几帧时,这些线索就会失效。跟踪器要么为同一个物体创造一个新身份,要么将身份错误地嫁接到另一个物体上。与此同时,分割器继续生成掩码,完全没有意识到标签已经发生了漂移。清理这种漂移意味着需要繁重的后处理或人工标注,这违背了自动化的初衷。
传统模型往往恰恰在物体重叠时丢失目标。这些错误并非随机,而是结构性的。一个将时间视为事后补充的流水线,注定会在连续性方面面临挑战。
多切分建模带来的优势
多切分建模打破了分割与跟踪之间的壁垒。该方法不再是先生成一系列不连续的掩码然后再进行缝合,而是构建了一个跨越时空的图(graph)。每一帧中的每个潜在物体区域都成为一个节点。边将可能属于同一实体的区域连接起来,无论是在单帧内部还是在连续帧之间。然后,算法寻找切割这些边的最优方式,使得剩余的连通分量能够形成在视频中自然移动的一致物体。
由于决策是全局性的,第 15 帧的边界修正可以受到第 5 帧证据的影响。如果两个人擦肩而过,该建模方式不必仅凭速度进行猜测。它会同时权衡外观、形状、运动和边界连贯性。掩码质量和跟踪质量在同一个目标函数下进行优化。当求解器确定一个身份时,它已经检查过相应的像素在空间上是否合理。正是这种耦合,让该框架能够从那些会导致流水线方法失效的遮挡中恢复过来。
将视觉数据直接与跟踪逻辑相连,从而形成了一个闭环反馈。分割为跟踪提供信息,而跟踪约束则优化分割结果。由于系统不再在每一步都进行孤立的猜测,因此可以用更少的人工修正获得更准确的结果。
实际应用场景
统一建模的优势不仅仅停留在理论层面。在部署过程中经常遇到的三个特定领域中,它们发挥着至关重要的作用。
帧间一致性。 在体育分析中,运动员的轮廓需要保持精确,以便可靠地提取步幅或关节角度等生物力学指标。如果分割与跟踪脱节并产生抖动,最终得到的运动学数据就会变得充满噪声。统一建模通过将运动员的轮廓视为整个片段中一个连续的实体,从而消除了这种抖动。
拥挤场景。 当人群聚集在一起时,监控和人群计数应用的准确性会下降。独立的追踪器经常会合并身份,或者在人体间的缝隙中产生虚假目标。通过将视觉证据直接链接到追踪逻辑中,multi-cut 方法在拥挤场景中能更好地维持物体身份。即使边界框几乎完全重叠,个体依然保持清晰可辨。
边界完整性。 在机器人技术中,拾取与放置系统需要精确的物体轮廓来规划抓取。忽略时序上下文的分割模型可能会包含部分背景,或者切掉物体的某个角落。当分割和追踪共享同一个目标时,模型会学习到边界应当在时间上保持稳定。由此产生的掩码能更精准地贴合真实边缘,这意味着更少的抓取失败以及更低的安全余量需求。
构建更优的流水线
对于从事视频分析或机器人技术的工程师来说,这种转变对您构建系统架构的方式具有具体的指导意义。
不要再将检测、分割和追踪视为在传送带上传递张量的三个独立的微服务。相反,应当寻找能够提供联合目标的框架。如果您正在构建自定义流水线,请考虑您的图结构是否可以在同一个损失函数中同时编码空间亲和性和时序连续性。即使您不亲自实现完整的 multi-cut 求解器,这一原则仍然适用。通过添加约束,将随时间变化的特征与逐帧掩码的质量联系起来。
针对遮挡情况进行高强度的测试。一段仅包含物体以简单模式移动的演示视频,无法揭示流水线式方法的弱点。请收集目标重叠、遮挡期间光照发生变化、以及物体从屏幕外重新进入的序列。正是这些时刻,将一个拼凑而成的流水线与一个真正统一的流水线区分开来。
仔细准备您的标注策略。联合模型通常需要与纯分割或纯追踪数据集不同的真值(ground truth)结构。您可能需要跨帧一致地标注实例身份,而不仅仅是每张图像的像素类别。前期在标注上的投入,会在部署阶段减少人工修正的工作量,从而获得回报。
核心启示
在计算资源和模型容量匮乏的时代,将分割和追踪视为独立的任务是有道理的。但现在不再如此了。multi-cut 建模方式表明,这两项任务本质上是一项任务:寻找在时间中持续存在的连贯物体。通过将它们结合在一起解决,您可以获得尊重运动规律的掩码和尊重形状特征的追踪轨迹。其结果是一个视频理解流水线,它能减少帧间误差,在运动物体周围创建更清晰的边界,并在遮挡和拥挤的复杂现实中保持准确。
