JEPA 以潛在世界模型加速機器人決策

JEPA 不再逐幀生成畫面,而是在抽象特徵中預測世界如何變化,降低機器人規劃的算力成本。

Og image

機器人或自動駕駛系統需要預測動作帶來的後果,單靠文字推理難以掌握物體移動、空間關係與物理變化。聯合嵌入預測架構(Joint Embedding Predictive Architecture,JEPA)屬於潛在動態世界模型,直接在抽象特徵空間推演未來狀態,避開逐步生成高解析度畫面的成本。

世界模型通常要完成渲染、模擬與規劃三類工作,JEPA 主要集中於模擬和預測。它不重建像素,而是從視覺或感測資料抽取高層次表徵,再預測下一個潛在狀態;這種做法有助減少噪聲影響,亦讓智能體能在較低成本下進行多步策略推演。

文章將世界模型分為三大類:直接生成未來觀測的模型、在潛在空間運作的模型,以及明確表示物件、深度和幾何佔據的結構化模型。JEPA、I-JEPA、V-JEPA 和 DINO-WM 屬於預測表徵路線,Dreamer 和 PlaNet 則以重構型狀態空間支援想像式訓練。

  • JEPA 適合機器人快速規劃及強化學習 roll-out
  • 不生成像素,換取較低算力需求和較高推演效率
  • 視覺生成模型較擅長畫面還原,JEPA 偏向狀態預測
  • 自動駕駛仍可能需要結合 OccWorld 等空間幾何模型

選擇架構時要視乎瓶頸在視覺逼真度、運算預算,還是 3D 空間與物理精準度。JEPA 能有效處理抽象動態,但若項目需要可視化未來畫面或精確描述物體幾何,便可能要配合觀測生成模型或結構化世界模型。

項目主頁

Categories: AI productions, 多模態模型, 世界模型, Google, NVIDIA, 強化學習