GaMO 稀疏視角 3D 重建

GaMO:Geometry-aware Multi-view Diffusion Outpainting for Sparse-View 3D Reconstruction,是一套專門為「稀疏視角 3D 重建」設計的全新框架,主打關鍵字就是:幾何感知、多視角、Diffusion 外擴(outpainting)、零訓練、超省時間。傳統方法通常會在新相機位上生成人工視角,來補足原始影像的不足,但這樣很容易在多視角之間出現幾何不一致、邊界破碎、甚至幽靈般的重影,同時計算成本也相當驚人。 GaMO 反其道而行,直接「從原本的相機視角往外長」,也就是針對每張輸入影像做視野擴張,保留原始內容不動,只在周邊補齊缺失區域,天然就比較容易維持幾何一致性。

技術上,GaMO 利用多視圖條件化的 diffusion 模型,再配合幾何感知去噪策略,先透過粗略 3D 重建拿到幾何先驗,再在影像層面做多視圖 outpainting,最後用這些擴張後的影像做精緻 3D 重建。 這樣的設計有幾個亮點:第一,完全不需要針對特定場景再訓練(zero-shot inference),直接使用現成的多視圖 diffusion 模型即可;第二,在 Replica、ScanNet++ 等資料集上,GaMO 在 PSNR、SSIM、LPIPS 等指標上刷新了現有 SOTA,同時比其它 diffusion 式方法快上約 25 倍,整個流程控制在 10 分鐘內完成。 對需要做室內掃描、VR/AR 場景建模、機器人導航環境重建的團隊來說,GaMO 提供了一種更務實、計算友善,又兼顧幾何品質的新選項。

Categories: 開源, 視覺模型, 影像模型, 影像處理