Forskere har udviklet en ny metode, der markant forbedrer den geometriske konsistens i moderne 3D-vision-modeller – uden at kræve ekstra træning eller per-scene optimering. Metoden, kaldet Self-Geometry, er designet som et plug-and-play-lag, der kan lægges oven på eksisterende modeller og forbedrer både positions- og geometriestimering på tværs af seks forskellige vision foundation-modeller (VFM'er) og fire benchmarks.
Vision foundation-modeller som VGGT og π³ forudsiger dybde, kameraposition og punktkort i et enkelt gennemløb uden per-scene optimering, hvilket giver stærk generalisering. Men de lider af en fundamental svaghed: De håndhæver ikke eksplicit multi-view geometrisk konsistens under træning, fordi det er beregningsmæssigt dyrt. Det betyder, at modellerne kan producere inkonsistente resultater, når de ser samme scene fra flere vinkler.
Tidligere forsøg på at løse dette ved testtid har brugt implicit selv-konsistens fra modellens egne output – men det giver begrænset forbedring, især på scener, hvor modellen i forvejen er unøjagtig. Self-Geometry går en anden vej: Den bruger 2D-pixelkorrespondancer som pseudo-ground truth og pålægger eksplicit multi-view geometriske begrænsninger. Det sker gennem tre komponenter: Geometric Disentanglement Optimization, der kombinerer multi-view-konsistens og epipolar-konsistens med gradient-disentanglement for at undgå konflikter; Frame Angular-Neighbor, en view-sampler baseret på SO(3) geodesiske afstande; og Lightweight TTA, der tilpasser modellerne via LoRA.
Resultaterne viser konsistente forbedringer i både positions- og geometriestimering på tværs af seks VFM'er (VGGT, π³, DA3-Giant/Large/Base/Small) og fire benchmarks (7Scenes, ETH3D, ScanNet++, HiRoom). Detaljerne er beskrevet i den originale paper på Hugging Face.
For beslutningstagere betyder det, at 3D-vision-modeller kan blive væsentligt mere pålidelige i praktiske anvendelser – fra robotnavigation og AR/VR til autonome systemer – uden at skulle investere i dyr omskoling eller specialiseret optimering. Metoden er designet til at være let at integrere i eksisterende pipelines, hvilket kan accelerere adoptionen af geometrisk præcise 3D-modeller i produktionsmiljøer.
