
機器人或自動駕駛系統需要預測動作帶來的後果,單靠文字推理難以掌握物體移動、空間關係與物理變化。聯合嵌入預測架構(Joint Embedding Predictive Architecture,JEPA)屬於潛在動態世界模型,直接在抽象特徵空間推演未來狀態,避開逐步生成高解析度畫面的成本。
世界模型通常要完成渲染、模擬與規劃三類工作,JEPA 主要集中於模擬和預測。它不重建像素,而是從視覺或感測資料抽取高層次表徵,再預測下一個潛在狀態;這種做法有助減少噪聲影響,亦讓智能體能在較低成本下進行多步策略推演。
文章將世界模型分為三大類:直接生成未來觀測的模型、在潛在空間運作的模型,以及明確表示物件、深度和幾何佔據的結構化模型。JEPA、I-JEPA、V-JEPA 和 DINO-WM 屬於預測表徵路線,Dreamer 和 PlaNet 則以重構型狀態空間支援想像式訓練。
- JEPA 適合機器人快速規劃及強化學習 roll-out
- 不生成像素,換取較低算力需求和較高推演效率
- 視覺生成模型較擅長畫面還原,JEPA 偏向狀態預測
- 自動駕駛仍可能需要結合 OccWorld 等空間幾何模型
選擇架構時要視乎瓶頸在視覺逼真度、運算預算,還是 3D 空間與物理精準度。JEPA 能有效處理抽象動態,但若項目需要可視化未來畫面或精確描述物體幾何,便可能要配合觀測生成模型或結構化世界模型。