Test zamanı geometrik kısıtlamalar görme modellerini iyileştiriyor

Self-Geometry, bir test zamanı eklentisi olarak, ETH3D benchmark testinde görme temel modellerinin derinlik skorlarını %37,3'e kadar, poz skorlarını ise %9,2'ye kadar artırıyor.

VGGT gibi görme temel modelleri, sahne derinliğini ve kamera pozunu tek bir ileri geçişte (forward pass) tahmin eder. Bu kolaylığın bir bedeli vardır: Her görünümü bağımsız olarak ele alırlar ve aynı sahnenin birden fazla görüntüsünü birbirine bağlayan epipolar kısıtlamaları göz ardı ederler. Mevcut "kendi kendine tutarlılık" (self-consistency) yöntemleri, modelin kendi çıktılarındaki çelişkileri tespit etmeye çalışır; ancak ilk tahmin çok hatalı olduğunda düzeltme işlemi çöker.

Self-Geometry bu kusurdan kaçınır. Önce üst üste binen görüntüler arasında 2-D nokta eşleşmelerini çıkarır ve bu eşleşmeleri yalancı yer gerçekliği (pseudo ground truth) olarak kabul eder. Çıkarım (inference) sırasında, modelin derinlik ve poz çıktılarını iki kayıp terimini karşılayacak şekilde ayarlayan hafif bir optimize edici çalıştırır:

  1. Çoklu görünüm tutarlılığı – aynı 3-D nokta, her görünüme doğru şekilde yansıtılmalıdır.
  2. Epipolar tutarlılık – stereo geometrinin klasik görüş hattı kuralı. Backbone'a (ana gövdeye) herhangi bir gradyan akışı sağlanmaz, bu nedenle orijinal ağırlıklar değişmeden kalır.

ETH3D benchmark testinde yöntem, VGGT'nin poz doğruluğunu %9,2 ve derinlik doğruluğunu %37,3 oranında artırır. Diğer modellerde ise %5,0 ve %25,1 oranında kazanımlar görülür. Bu iyileşme, altı farklı mimari ve dört halka açık veri seti genelinde geçerliliğini koruyarak yaklaşımın tek bir ağ tasarımına bağlı olmadığını kanıtlar.

Ödünleşimler

Teknik, güvenilir 2-D eşleşmelere dayanır. Doku içermeyen yüzeyler, tekrarlayan desenler veya hareket eden nesneler eşleşme setini bozabilir ve düzeltmeyi zayıflatabilir. Çalışma süresi bir başka engeldir: LoRA tabanlı (low-rank adaptation) bir uygulama, bir RTX PRO 6000 GPU üzerinde sahne başına iki dakikanın altında tamamlanır; bu da canlı SLAM veya AR'nin kare hızı ihtiyaçlarının çok gerisindedir.

Geleceğe Bakış

Eğer topluluk, geometrik adaptasyonu standart bir son işleme (post-processing) adımı olarak benimserse, birçok mevcut model maliyetli yeniden eğitimlere gerek duymadan anında performans kazanabilir. Benchmark setleri de, test zamanı iyileştirmenin mümkün olduğu gerçekçi dağıtımları yansıtmak için bir Self-Geometry temel hattı (baseline) içermelidir.

Özetle: Mütevazı bir test zamanı geometrik mantık kontrolü, hazır görme modellerinden önemli ölçüde daha fazla doğruluk elde edebilir; ancak temiz eşleşmelere ve gerçek zamanlı olmayan hızlara olan bağımlılığı, gecikmeye duyarlı sistemlerde anında kullanımını sınırlar.