测试时几何约束提升视觉模型性能
Self-Geometry 是一种测试时(test-time)插件,在 ETH3D 基准测试中,它将视觉基础模型的深度得分提升了高达 37.3%,位姿(pose)得分提升了 9.2%。
诸如 VGGT 之类的视觉基础模型可以通过单次前向传播预测场景深度和相机位姿。这种便利是有代价的:它们独立处理每个视图,忽略了将同一场景的多张图像联系在一起的极线约束(epipolar constraints)。现有的“自一致性”技巧试图发现模型自身输出中的矛盾,但当初始预测偏差过大时,修正过程就会失效。
Self-Geometry 避免了这一缺陷。它首先提取重叠图像之间的二维点对应关系,并将这些匹配项视为伪真值(pseudo ground truth)。在推理过程中,它运行一个轻量级优化器,通过调整模型的深度和位姿输出,以满足两个损失项:
- 多视图一致性 —— 同一个 3D 点必须正确投影到每个视图中。
- 极线一致性 —— 立体几何中经典的视线规则。 由于没有梯度回传到骨干网络(backbone),因此原始权重保持不变。
在 ETH3D 基准测试中,该方法将 VGGT 的位姿准确度提升了 9.2%,深度准确度提升了 37.3%。其他模型的提升幅度分别为 5.0% 和 25.1%。这种改进在六种架构和四个公开数据集上均有效,表明该方法并不局限于单一的网络设计。
权衡
该技术依赖于可靠的二维匹配。无纹理表面、重复图案或移动物体可能会破坏对应关系集,从而削弱修正效果。运行时间是另一个障碍:基于 LoRA(低秩自适应)的实现方案在 RTX PRO 6000 GPU 上处理每个场景需要不到两分钟——这远无法满足实时 SLAM 或 AR 的帧率需求。
展望未来
如果社区将几何自适应作为标准的后处理步骤,许多现有模型无需昂贵的重新训练即可立即获得性能提升。基准测试套件也需要包含 Self-Geometry 基准,以反映测试时细化(test-time refinement)可行的实际部署情况。
核心结论: 一种适度的测试时几何合理性检查可以从现成的视觉模型中提取显著更高的准确度,但其对高质量匹配的依赖以及非实时的运行速度,限制了其在延迟敏感型系统中的即时应用。
