I vincoli geometrici al momento del test migliorano i modelli di visione
Self-Geometry, un modulo aggiuntivo per il test-time, aumenta i punteggi di profondità e posa dei modelli foundation di visione fino al 37,3% per la profondità e al 9,2% per la posa sul benchmark ETH3D.
I modelli foundation di visione come VGGT predicono la profondità della scena e la posa della telecamera in un singolo forward pass. Questa comodità ha un prezzo: trattano ogni vista in modo indipendente e ignorano i vincoli epipolari che legano più immagini della stessa scena. Le attuali tecniche di "self-consistency" cercano di individuare contraddizioni nei risultati dello stesso modello, ma quando la previsione iniziale è molto errata, la correzione fallisce.
Self-Geometry evita questo difetto. Estrae innanzitutto le corrispondenze di punti 2D tra immagini sovrapposte e tratta tali corrispondenze come pseudo ground truth. Durante l'inferenza, esegue un ottimizzatore leggero che regola gli output di profondità e posa del modello per soddisfare due termini di loss:
- Consistenza multi-vista – lo stesso punto 3D deve proiettarsi correttamente in ogni vista.
- Consistenza epipolare – la classica regola della linea di vista della geometria stereo. Nessun gradiente fluisce all'indietro nel backbone, quindi i pesi originali rimangono invariati.
Sul benchmark ETH3D, il metodo aumenta l'accuratezza della posa di VGGT del 9,2% e l'accuratezza della profondità del 37,3%. Altri modelli registrano incrementi del 5,0% e del 25,1%. Il miglioramento si mantiene su sei architetture e quattro dataset pubblici, dimostrando che l'approccio non è legato a un singolo design di rete.
Compromessi
La tecnica si basa su corrispondenze 2D affidabili. Superfici prive di texture, pattern ripetitivi o oggetti in movimento possono corrompere l'insieme delle corrispondenze e indebolire la correzione. Il tempo di esecuzione è un altro ostacolo: un'implementazione basata su LoRA (low-rank adaptation) termina in meno di due minuti per scena su una GPU RTX PRO 6000, ben lontano dalle esigenze di frame rate per lo SLAM o l'AR in tempo reale.
Prospettive future
Se la comunità adottasse l'adattamento geometrico come fase standard di post-processing, molti modelli esistenti potrebbero ottenere miglioramenti immediati delle prestazioni senza un costoso riaddestramento. Anche le suite di benchmark dovrebbero includere un baseline di Self-Geometry per riflettere scenari di deployment realistici in cui il raffinamento al momento del test è fattibile.
In sintesi: Un modesto controllo di coerenza geometrica al momento del test può estrarre una precisione significativamente maggiore dai modelli di visione pronti all'uso, ma la sua dipendenza da corrispondenze pulite e da velocità non in tempo reale ne limita l'adozione immediata in sistemi critici per la latenza.
