Self-Geometry 補強 3D VFM 幾何一致性

同一個場景睇落都幾準,跨視角一對就出現幾何唔一致,正正係 Self-Geometry 想補上的缺口。它用測試階段微調,幫現成 3D Vision Foundation Models 把深度、位姿同 pointmap 對齊。

icon

單張推理已經夠快,但去到多視角場景,depth、camera pose 同 pointmap 未必互相講得通,之後做重建、定位或者室內掃描就會累積誤差。Self-Geometry 屬於 3D 視覺模型適配流程,重點唔係重新訓練一個新模型,而係喺測試階段替現有 3D Vision Foundation Models 補回明確幾何約束。

它採用 GT-Free 的 Test-Time Adaptation (TTA),直接由 2D pixel correspondences 生成 pseudo ground-truth,再把 Multi-View Consistency、Epipolar Consistency 同 Gradient Disentanglement 組合起來,減少幾種幾何訊號互相拉扯。配合基於 SO(3) geodesic distance 的 Frame Angular-Neighbor 抽幀方式,以及用 LoRA 做 Lightweight TTA,部署理解上比較直接:你可以把它視為加喺 VGGT、π³、DA3-Giant/Large/Base/Small 之上的後處理適配層,而唔係取代原本 backbone。

同類做法常見會依賴模型自己輸出的隱式一致性訊號,Self-Geometry 則改為在測試時加入顯式 multi-view geometry constraints。取捨亦好清楚:它換來較穩定的 pose estimation 同 geometry estimation 改善,但仍然要針對每個 scene 做一次短時間適配,未必適合極端低延遲或單張即時推理流程。

現有資料指出,它在六個 VFMs 同四個 benchmarks,包括 7Scenes、ETH3D、ScanNet++、HiRoom,都有一致提升,而且每個 scene 的適配可在兩分鐘內完成。互動示例亦提供 baseline 與 Self-Geometry 的 pointmap、depth-map 對照,以及相對 TCO、Free-Geometry 的 depth-error、pointmap-error 視覺比較,較適合做 3D reconstruction、camera localization、室內空間感知,或者想保留既有 VFM 而補強幾何一致性的研究團隊同工程項目。

  • 針對預訓練 3D VFM 的多視角幾何不一致問題,而唔係另起一個新模型
  • 用 2D pixel correspondences 當 pseudo ground-truth,避免依賴真實標註
  • 可直接套用到 VGGT、π³、DA3 系列,核心形式屬於 plug-and-play TTA
  • 已公開互動比較與定性結果,重點放在 depth、pointmap 與 pose 的一致改善

項目主頁 · GitHub

Categories: 開源, 3D, 框架