Segment-Snap:讓 AI 看懂3D 場景怎樣開門

由室內3D掃描推斷可動部件、運動方式和把手位置,Segment–Snap把幾何線索與語義判斷接在同一條流程內。

Paper on arXiv

一張室內3D掃描不應只告訴你有門櫃,還要指出哪個部件會動、沿甚麼方向移動,以及人應在哪裏操作。Segment–Snap 屬於3D場景互動理解模型,處理的正是可動部件、運動類別、鉸鏈位置和把手之間的關係。

項目採用三個獨立訓練的 predictor 讀取同一個 RGB point cloud:Movable-part predictor 負責部件分割及旋轉、平移類別;Dense handle predictor 尋找細小把手;Joint part-handle predictor 再提出與部件相關的把手候選。把手位置會協助判斷旋轉部件的鉸鏈線,部件的幾何和類別則反過來改善把手標籤,兩個方向各行一次,沒有迭代式 feedback。

固定的 training-free decoder 會為可靠部件支援擬合方盒,利用垂直軸先驗推斷旋轉,並以表面法線處理平移;這令模型毋須另行訓練 motion regression。Joint predictor 的 parent parts 只作內部脈絡,最終輸出仍以獨立 Movable-part predictor 的部件結果為準,取捨相當清楚。

• Handles → part motion +27.25 個百分點,主要改善 hinge placement
• Parts → extra handles +5.01 個百分點,補充把手 proposals
• Part classes → handle labels +0.98 個百分點,修正部分 motion-class 判斷
• 三項結果來自 Articulate3D validation,指標為 motion AP 或 handle AP,增幅不可直接相加

測試時可按資料準備文件處理場景,再使用 Hugging Face 提供的 pretrained checkpoints 和 repository 內的 training configurations,重現公開 Articulate3D validation 實驗。項目較適合研究3D視覺、機械人感知、具身互動或需要分析門櫃等室內物件操作方式的團隊;它提供的是研究參考實作,並非可直接接駁家居控制系統的完整產品。

項目主頁 · GitHub · 模型

Categories: 開源, 香港理工大學, 模型, 模型訓練, 香港, 3D