Vikwazo vya kijiometri wakati wa majaribio (test-time) vinaongeza ufanisi wa mifumo ya kuona

Self-Geometry, nyongeza ya wakati wa majaribio (test-time add-on), huongeza alama za kina (depth) na mkao (pose) za mifumo ya msingi ya kuona (vision foundation models) kwa hadi 37.3% kwa kina na 9.2% kwa mkao kwenye kipimo cha ETH3D.

Mifumo ya msingi ya kuona kama VGGT hutabiri kina cha mandhari na mkao wa kamera katika hatua moja ya mbele (single forward pass). Urahisi huu una gharama yake: huchukulia kila mtazamo kama kitu cha pekee na kupuuza vikwazo vya epipolar (epipolar constraints) ambavyo huunganisha picha nyingi za mandhari moja. Mbinu za sasa za "kujikubali" (self-consistency) hujaribu kutambua migongano katika matokeo ya mfumo wenyewe, lakini utabiri wa awali unapokuwa mbali sana na ukweli, marekebisho hayo hushindwa.

Self-Geometry huepuka kasoro hiyo. Kwanza, huchimba uhusiano wa nukta za 2-D (2-D point correspondences) kati ya picha zinazovuka na huchukulia ulinganifu huo kama ukweli wa bandia (pseudo ground truth). Wakati wa utambuzi (inference), huendesha mrekebishaji mwepesi (lightweight optimizer) ambao unarekebisha matokeo ya kina na mkao ya mfumo ili kutimiza vigezo viwili vya upotevu (loss terms):

  1. Ulinganifu wa mitazamo mingi (Multi-view consistency) – nukta moja ya 3-D lazima iakisiwe kwa usahihi katika kila mtazamo.
  2. Ulinganifu wa epipolar (Epipolar consistency) – sheria ya kawaida ya mstari wa uoni (line-of-sight) ya kijiometri ya stereo. Hakuna gradient zinazorejea kwenye mfumo mkuu (backbone), hivyo uzito wa awali (original weights) unabaki bila kuguswa.

Katika kipimo cha ETH3D, mbinu hii huongeza usahihi wa mkao wa VGGT kwa 9.2% na usahihi wake wa kina kwa 37.3%. Mifumo mingine huona ongezeko la 5.0% na 25.1%. Maboresho haya yanadumu katika usanifu sita na seti nne za data za umma, ikionyesha kuwa mbinu hii haitegemei usanifu mmoja wa mtandao.

Mapungufu na Faida

Mbinu hii inategemea ulinganifu wa 2-D unaoaminika. Nyuso zisizo na umbo (texture-less surfaces), mifumo inayojirudia, au vitu vinavyocheza vinaweza kuharibu seti ya uhusiano na kudhoofisha marekebisho. Muda wa utendaji ni kikwazo kingine: utekelezaji unaozingatia LoRA (low-rank adaptation) hukamilika kwa chini ya dakika mbili kwa kila mandhari kwenye GPU ya RTX PRO 6000—jambo ambalo ni mbali na mahitaji ya kasi ya fremu (frame-rate) ya SLAM au AR ya moja kwa moja.

Mtazamo wa Baadaye

Ikiwa jamii itakubali mabadiliko ya kijiometri kama hatua ya kawaida ya usindikaji wa baadae (post-processing), mifumo mingi iliyopo inaweza kupata ufanisi wa haraka bila mafunzo upya ya gharama kubwa. Seti za vipimo pia zitahitaji kujumuisha msingi wa Self-Geometry ili kuakisi utumiaji halisi ambapo uboreshaji wa wakati wa majaribio (test-time refinement) unawezekana.

Muhtasari: Ukaguzi mdogo wa kijiometri wakati wa majaribio (test-time geometric sanity check) unaweza kutoa usahihi mkubwa zaidi kutoka kwa mifumo ya kuona iliyopo sokoni, lakini utegemezi wake kwenye ulinganifu safi na kasi isiyo ya wakati halisi unazuia utumiaji wa haraka katika mifumo inayohitaji mwitikio wa haraka (latency-critical systems).