世界模型 (World Models) 具身智能 自動駕駛 JEPA 架構解析
核心摘要:世界模型(World Models)的核心任務是讓 AI 能夠預測物理環境隨時間演變的動態,並評估智能體(Agent)採取動作後帶來的後果。模型架構的本質差異取決於它「跨時間向前傳遞(Carry Forward)」的資訊形式:生成的具體觀測、緊湊的潛在狀態,或是顯式的實體與空間幾何結構。

1為什麼現有推理模型仍不足以應對物理世界?

在文字生成、程式碼撰寫與多模態對話中,現代大語言模型(LLM)已展現出驚人的推理能力。然而,當 AI 走出數位世界、進入工廠製造機器人或自駕車(如 Waymo)等實體場景時,單純依賴邏輯推理與文字代理人是遠遠不夠的——它們最顯著的短板在於難以可靠預測真實物理環境的演變規律。

實體世界的狀態隨時都在變遷:物體的運動與靜止遵循牛頓力學、化學物質相互反應、生物系統適應環境。世界模型正是為了解決此痛點而生,它的目標是壓縮巨量的視覺與物理互動經驗,學習時空背後隱含的因果邏輯與物理約束條件。

2世界模型的三大核心功能與運作閉環

如學者李飛飛(Dr. Fei-Fei Li)所歸納,成熟的世界模型涵蓋三大核心功能維度,而「模擬」則是連結視覺與決策的關鍵橋樑:

✓
渲染 (Render):生成世界的外觀像素(如影片生成模型),呈現視覺層面的逼真度。
✓
模擬 (Simulate):精準表達空間幾何、實體屬性與受力位移,維持物理定律的一致性。
✓
規劃 (Plan):依據當前狀態預測與預期目標,推演出最優的下一步決策行為。

在標準動態迴圈中,世界模型的推演邏輯遵循結構化的狀態轉換過程:

world_model_loop.sh
1. 環境狀態 (State S_t)        --> 世界在特定時刻的客觀客觀全貌
2. 智慧體觀測 (Observation O_t) --> 攝影機、感測器獲取的局部視覺或訊號
3. 狀態預測 (Predict S_t+1)     --> 世界模型利用觀測與動作預測未來演化
4. 規劃與行動 (Action A_t)      --> 智能體決定並執行策略動作
5. 物理反饋 (Transition)        --> 動作作用於環境,產生新狀態 S_t+1 與新觀測 O_t+1

3三大核心架構分類體系

世界模型並不存在單一的統一架構,學界與工業界主要根據模型在時間推移中「向前傳遞(Carry Forward)的載體」將其劃分為三大流派:

A. 觀測生成模型 (Observation-Generating Models)

此類模型透過直接產生未來的具體觀測(如次影格畫面、自回歸視覺 Token 或像素雜訊擴散)來推進世界狀態。這類架構常見於模擬器與互動式影音生成,代表系統包含 Google DeepMind 的 GenIE 3、NVIDIA 的 Cosmos-Predict2.5 以及自回歸架構 IRIS。

B. 潛在動態模型 (Latent Dynamics Models)

為了避開在每一步都花費昂貴算力去渲染高解析度像素,潛在動態模型將環境狀態壓縮為低維緊湊的向量特徵,直接在潛在空間(Latent Space)中進行狀態推演:

  • 重構型狀態空間 (Reconstructive RSSM):例如 Dreamer V1–V4 與 PlaNet,內部預測潛在狀態同時具備重構觀測的能力,使 Agent 能在「想像」中進行數千步策略訓練。
  • 非重構預測表徵 (Predictive Representations):例如 Yann LeCun 主導的 JEPA 與 DINO-WM,拋棄像素重構,只在抽象特徵空間預測高層次語意,具備極高的抗噪能力與算力效率。
  • 任務導向型 (Task-Oriented):例如 DeepMind 的 MuZero 與 EfficientZero V2,僅學習與獎勵、價值評估直接相關的動態轉移。

C. 結構化世界模型 (Spatial & Object-Centric Models)

將世界明確建模為可識別的實體、空間深度與幾何佔據(Occupancy)。此類架構特別著重於 3D 空間關係與實體交互,代表系統包含 World Labs 的 Atlas(將稀疏觀測轉化為可探索 3D 空間)以及自動駕駛領域廣泛運用的 OccWorld。

4世界模型主流架構橫向評比

下表系統化梳理了不同架構流派的核心運作機制與代表性模型案例:

架構族群 底層機制類型 核心推進方式 代表系統 / 模型案例
觀測生成型 視覺 Token 自回歸 以自回歸方式逐步預測未來的離散視覺標記 IRIS, Dreamer 4
觀測生成型 擴散與流匹配 (Diffusion / Flow) 透過去噪演算法或連續流模型生成未來影像幀 DIAMOND, Genie 3, Cosmos-Predict2.5
潛在動態型 重構型狀態空間 (RSSM) 預測緊湊潛在狀態並視需求解碼還原像素觀測 PlaNet, Dreamer V1–V3, DayDreamer
潛在動態型 預測表徵型 (JEPA) 完全不還原像素,僅在抽象潛在特徵空間預測動態 I-JEPA, V-JEPA, DINO-WM
潛在動態型 任務導向型 (Task-oriented) 僅學習與獎勵、回報及價值預測緊密相關的轉移 MuZero, EfficientZero V2, Newt
結構化模型 空間與幾何感知 (Spatial-aware) 顯式表示深度、空間體素佔據 (Occupancy) 與視角幾何 OccWorld, World Labs Atlas
結構化模型 以物件為中心 (Object-centric) 追蹤獨立實體屬性、位置及其物理相互作用 C-SWM, SlotFormer, SlotDiT

5技術選型指引:你該選擇哪種架構?

選擇世界模型架構時,首要考量並非「哪種模型最新」,而是「你的應用場景瓶頸是在於視覺模擬、算力預算,還是空間物理精準度」。

在實際落地開發時,建議遵循以下工程選型策略:

  • 機器人快速規劃與強化學習:優先選用潛在動態模型(如 Dreamer 或 JEPA 架構)。在潛在空間進行 roll-out 無需負擔龐大的像素渲染開銷,能大幅加速推演速度。
  • 自動駕駛模擬與極端邊界測試:如 Waymo 或車廠數據生成系統,需融合空間幾何模型(OccWorld)與擴散生成模型,既維持真實 3D 空間物理約束,又可合成逼真、罕見的天候與危險路況。
  • 機器人靈巧操作與物件交互:著重以物件為中心(Object-Centric)的架構,以確保機械手臂在推動、抓取零件時,系統能精確追蹤物體間的幾何接觸與力學反應。