ટેસ્ટ-ટાઇમ ભૂમિતિના નિયંત્રણો (geometry constraints) વિઝન મોડલ્સમાં સુધારો કરે છે
Self-Geometry, જે એક ટેસ્ટ-ટાઇમ એડ-ઓન છે, તે ETH3D બેન્ચમાર્ક પર વિઝન ફાઉન્ડેશન મોડલ્સના ડેપ્થ (depth) અને પોઝ (pose) સ્કોર્સમાં ડેપ્થ માટે 37.3% અને પોઝ માટે 9.2% સુધીનો વધારો કરે છે.
VGGT જેવા વિઝન ફાઉન્ડેશન મોડલ્સ સિંગલ ફોરવર્ડ પાસમાં સીન ડેપ્થ અને કેમેરા પોઝનું અનુમાન કરે છે. આ સુવિધાની એક કિંમત ચૂકવવી પડે છે: તેઓ દરેક વ્યુને સ્વતંત્ર રીતે જુએ છે અને એપોલર કન્સ્ટ્રેઇન્ટ્સ (epipolar constraints) ને અવગણે છે જે એક જ સીનના અનેક ફોટાઓને જોડે છે. હાલની "સેલ્ફ-કન્સીસ્ટન્સી" (self-consistency) ટ્રિક્સ મોડલના પોતાના આઉટપુટમાં વિરોધાભાસ શોધવાનો પ્રયાસ કરે છે, પરંતુ જ્યારે પ્રારંભિક અનુમાન ખોટું હોય, ત્યારે સુધારો નિષ્ફળ જાય છે.
Self-Geometry તે ખામીને ટાળે છે. તે સૌ પ્રથમ ઓવરલેપિંગ ઈમેજીસ વચ્ચે 2-D પોઈન્ટ કોરેસ્પોન્ડન્સ (point correspondences) કાઢે છે અને તે મેચને 'સ્યુડો ગ્રાઉન્ડ ટ્રુથ' (pseudo ground truth) તરીકે ગણે છે. ઇન્ફરન્સ દરમિયાન, તે એક લાઇટવેઇટ ઓપ્ટિમાઇઝર ચલાવે છે જે મોડલના ડેપ્થ અને પોઝ આઉટપુટને બે લોસ ટર્મ્સ (loss terms) સંતોષવા માટે એડજસ્ટ કરે છે:
- મલ્ટી-વ્યુ કન્સીસ્ટન્સી (Multi-view consistency) – સમાન 3-D પોઈન્ટ દરેક વ્યુમાં યોગ્ય રીતે પ્રોજેક્ટ થવો જોઈએ.
- એપોલર કન્સીસ્ટન્સી (Epipolar consistency) – સ્ટેરિયો ભૂમિતિનો ક્લાસિક લાઇન-ઓફ-સાઇટ નિયમ. બેકબોનમાં કોઈ ગ્રેડિયન્ટ્સ પાછા વહેતા નથી, તેથી મૂળ વેટ્સ (weights) અસ્પૃશ્ય રહે છે.
ETH3D બેન્ચમાર્ક પર, આ પદ્ધતિ VGGT ની પોઝ એક્યુરેસીમાં 9.2% અને ડેપ્થ એક્યુરેસીમાં 37.3% નો વધારો કરે છે. અન્ય મોડલ્સમાં 5.0% અને 25.1% નો વધારો જોવા મળે છે. આ સુધારો છ આર્કિટેક્ચર્સ અને ચાર પબ્લિક ડેટાસેટ્સમાં જોવા મળે છે, જે દર્શાવે છે કે આ અભિગમ કોઈ એક નેટવર્ક ડિઝાઇન પૂરતો મર્યાદિત નથી.
ટ્રેડ-ઓફ્સ (Trade-offs)
આ ટેકનિક વિશ્વસનીય 2-D મેચ પર આધારિત છે. ટેક્સચર-લેસ સપાટીઓ, પુનરાવર્તિત પેટર્ન અથવા હલતા પદાર્થો કોરેસ્પોન્ડન્સ સેટને બગાડી શકે છે અને સુધારાને નબળો પાડી શકે છે. રનટાઇમ એ બીજો અવરોધ છે: RTX PRO 6000 GPU પર LoRA-આધારિત (low-rank adaptation) અમલીકરણ પ્રતિ સીન બે મિનિટથી ઓછા સમયમાં પૂર્ણ થાય છે—જે લાઈવ SLAM અથવા AR ની ફ્રેમ-રેટ જરૂરિયાતોથી ઘણું દૂર છે.
ભવિષ્યની દિશામાં (Looking ahead)
જો સમુદાય જિયોમેટ્રિક એડેપ્ટેશનને સ્ટાન્ડર્ડ પોસ્ટ-પ્રોસેસિંગ સ્ટેપ તરીકે અપનાવે છે, તો ઘણા હાલના મોડલ્સ ખર્ચાળ રીટ્રેનિંગ વગર તાત્કાલિક પ્રદર્શન મેળવી શકે છે. બેન્ચમાર્ક સુટ્સમાં પણ વાસ્તવિક ડિપ્લોયમેન્ટને પ્રતિબિંબિત કરવા માટે Self-Geometry બેઝલાઇનનો સમાવેશ કરવો પડશે, જ્યાં ટેસ્ટ-ટાઇમ રિફાઇનમેન્ટ શક્ય હોય.
મુખ્ય વાત (Takeaway): એક સામાન્ય, ટેસ્ટ-ટાઇમ જિયોમેટ્રિક સેનિટી ચેક ઓફ-ધ-શેલ્ફ વિઝન મોડલ્સમાંથી નોંધપાત્ર રીતે વધુ ચોકસાઈ મેળવી શકે છે, પરંતુ ક્લીન મેચિસ અને નોન-રિયલ-ટાઇમ સ્પીડ પર તેની નિર્ભરતા લેટન્સી-ક્રિટિકલ સિસ્ટમ્સમાં તાત્કાલિક સ્વીકૃતિને મર્યાદિત કરે છે.
