
當桌面堆滿不同物件,機械人要聽得明「拎紅色杯旁邊嗰支筆」這類指令,難處不只在辨認物件,仲要同時算準 3D 空間位置同抓取角度。SeededGrasp 針對的正是這類語言引導抓取場景,重點不是端到端硬推整個動作,而是先找對目標,再生成穩定抓取姿態。
它的做法相當清晰:先用預訓練 Vision-Language Model(VLM)把文字指令轉成影像中的 2D 種子點,再投影到 3D 點雲,交給輕量的 flow-matching grasp model 產生 6DOF 抓取姿態。這種拆分方式把高層語意判斷同低層幾何執行分開,減少重新訓練整個系統的成本,也較容易支援多種 embodiment。
相比直接由 VLM 預測抓取,SeededGrasp 保留語言理解的直觀操作,同時補回空間推理不足;相比把 VLM 同抓取模型一併訓練,它對語言標註資料與算力的需求更克制。團隊亦公開多 embodiment 桌面抓取數據集,包含超過 2.56M 個 cluttered scenes 抓取姿態,涵蓋 Franka Panda、Allegro Hand 同 Robotiq 3-Finger。
- 用簡單文字指令指定目標,適合雜亂桌面抓取情境
- 以 2D 種子點連接 VLM 與 3D 抓取生成,降低端到端訓練負擔
- 支援多種 embodiment,不限單一夾爪或手型
- 公開 2.56M grasp dataset,補足多 embodiment 訓練資源
- 模擬成功率達 72%,真實環境抓取實驗達 78%
對機械人操作、語言介面同 grasp planning 有興趣的讀者,會較容易感受到這個項目的價值:它沒有把所有問題塞進同一個大模型,而是用較節制的架構處理語意與幾何之間的落差。現階段重點仍在桌面雜亂場景抓取,但它已經展示出多 embodiment 擴展同資料效率上的實用方向。