UA-NWM 不確定性無人機導航

無人機朝目標圖片飛行,最難唔係預測一條路,而係判斷目標畫面是否仍屬合理路徑。UA-NWM 解決「模型解釋唔到」的誤差。

Repository image for DurYi/UA-NWM

戶外無人機導航最易出錯的位置,在於前方畫面未必只有一種合理變化。UA-NWM 把這個問題當成 world model 的評分工作處理,面向 aerial image-goal navigation,唔再只估一個未來畫面再同目標硬碰硬,而係判斷目標圖片是否落在模型預測的未來狀態分佈之內。

它最值得留意的技術點,是用 Hierarchical Error Projection(HEP)把預測與目標之間的差距拆成可由不確定性子空間解釋的部分,同埋解釋唔到的殘差,最後只用後者作為 trajectory cost。呢種做法同單點預測式 ranker 的分別很直接:同樣見到偏差,UA-NWM 會先問偏差是否屬於合理未來變化,而唔係一概當成走錯路。

模型本身會預測未來的 DINO latent features,配合 deterministic future feature map 同 uncertainty subspace 做單次 forward scoring,避免靠隨機抽樣多個未來狀態先完成比較。同一個 checkpoint 可配合兩種 inference strategy,包括 uncertainty-aware 的 UA-NWM 與 deterministic baseline,適合研究團隊直接比較兩種評分邏輯帶來的差異。

  • 適合 UAV 導航、戶外機械人感知,以及要由目標圖片反推行進路線的團隊
  • 重點唔係生成最像的未來畫面,而係判斷目標是否仍在合理未來分佈內
  • 提供 AirGoal-10k 的 training、evaluation、trajectory ranking、CEM/MPC planning 與 visualization workflow
  • deploy/ 內有真實部署用的 server-side policy wrapper,但原始資料未完整交代整套部署步驟

它已對應 AirGoal-10k,並包含真機 UAV demo、資料集連結與 pretrained checkpoints;受益最大的是需要處理大範圍戶外場景、多解未來觀測,以及想把 world model 直接接到規劃器如 CEM/MPC 的團隊。

項目主頁 · GitHub · 模型

Categories: 開源, Image, 模型訓練, 世界模型, 百度, Dataset 數據集, 清華大學

WorldTrace 令世界模型影片記住更遠場景

影片世界要模型生成得夠長,往往先開始失憶。WorldTrace 針對呢個斷層,想保住長時段生成同遠距場景回想能力。

Og image

做長時間影片生成時,Video World Models 最易出現的問題唔係畫面唔夠靚,而是走出訓練長度之後開始「唔認得之前見過乜」。WorldTrace 針對的正是呢種視覺記憶失效:它屬於 Video World Models 的記憶機制改良方法,重點是令 Key-Value (KV) cache 裡已壓縮的內容,過了原本訓練範圍之後仍然可以被模型重新定位和讀取。

核心思路不是再訓練一個新生成器,而是用 training-free 方式處理記憶可尋址性。研究指出,問題關鍵在 temporal Rotary Positional Embeddings (RoPE) 偏移超出訓練 horizon 後,注意力機制即使保留了舊畫面資訊,都未必再讀得到;再加上在 RoPE 旋轉空間直接平均 key,會令不同 phase 互相抵消,令記憶內容變得模糊。WorldTrace 透過固定、仍屬 in-distribution 的 slot 位置保存壓縮記憶,避免記憶「存在但搵唔返」。

同一套記憶框架下,它分成兩個方向:WorldTrace-Field 用 rotation-invariant 的歷史聚合方式,支援較連貫的長 rollout;WorldTrace-Landmark 則保留較接近原樣的 scene traces,讓模型隔了更長時間後,仍有機會回想曾經到過的場景。這種分工反映出一個很實際的取捨:有些情境重視連續生成的穩定性,有些則更需要精準回憶特定地點或視覺片段。

  • 針對訓練 horizon 以外的記憶失效,而不是單純提升畫質
  • 保持壓縮後的 KV memory 可尋址,重點在 fixed in-distribution slot positions
  • WorldTrace-Field 偏重長序列生成的一致性
  • WorldTrace-Landmark 偏重遠距離場景召回與保留視覺痕跡
  • 原始資料將它描述為 training-free,未見提供安裝、下載或部署流程

這類方法較適合需要長時間互動、持續追蹤場景變化,或者要求模型記得自己曾經去過哪裡的工作流,例如互動式模擬、可探索影片環境與長時段世界狀態建模。現有資料亦提到它獲 ICML 2026 F2S Workshop Best Paper。

項目主頁 · 項目

Categories: NVIDIA, Video, Embedding, 模型訓練, 世界模型, Dataset 數據集, 框架

WorldTrace 令影片世界模型記住更遠場景

影片世界要模型生成得夠長,往往先開始失憶。WorldTrace 針對呢個斷層,想保住長時段生成同遠距場景回想能力。

Og image

做長時間影片生成時,Video World Models 最易出現的問題唔係畫面唔夠靚,而是走出訓練長度之後開始「唔認得之前見過乜」。WorldTrace 針對的正是呢種視覺記憶失效:它屬於 Video World Models 的記憶機制改良方法,重點是令 Key-Value (KV) cache 裡已壓縮的內容,過了原本訓練範圍之後仍然可以被模型重新定位和讀取。

核心思路不是再訓練一個新生成器,而是用 training-free 方式處理記憶可尋址性。研究指出,問題關鍵在 temporal Rotary Positional Embeddings (RoPE) 偏移超出訓練 horizon 後,注意力機制即使保留了舊畫面資訊,都未必再讀得到;再加上在 RoPE 旋轉空間直接平均 key,會令不同 phase 互相抵消,令記憶內容變得模糊。WorldTrace 透過固定、仍屬 in-distribution 的 slot 位置保存壓縮記憶,避免記憶「存在但搵唔返」。

同一套記憶框架下,它分成兩個方向:WorldTrace-Field 用 rotation-invariant 的歷史聚合方式,支援較連貫的長 rollout;WorldTrace-Landmark 則保留較接近原樣的 scene traces,讓模型隔了更長時間後,仍有機會回想曾經到過的場景。這種分工反映出一個很實際的取捨:有些情境重視連續生成的穩定性,有些則更需要精準回憶特定地點或視覺片段。

  • 針對訓練 horizon 以外的記憶失效,而不是單純提升畫質
  • 保持壓縮後的 KV memory 可尋址,重點在 fixed in-distribution slot positions
  • WorldTrace-Field 偏重長序列生成的一致性
  • WorldTrace-Landmark 偏重遠距離場景召回與保留視覺痕跡
  • 原始資料將它描述為 training-free,未見提供安裝、下載或部署流程

這類方法較適合需要長時間互動、持續追蹤場景變化,或者要求模型記得自己曾經去過哪裡的工作流,例如互動式模擬、可探索影片環境與長時段世界狀態建模。現有資料亦提到它獲 ICML 2026 F2S Workshop Best Paper,但公開內容目前集中在方法動機與設計,效能細節在這份摘要材料中仍然有限,閱讀時應留意完整論文是否提供更完整的量化結果與測試設定。

項目主頁 · 項目

Categories: NVIDIA, Video, Embedding, 模型訓練, 世界模型, Dataset 數據集, 框架

HelloWorld:按一下 F,讓影片世界角色回望你

HelloWorld 讓影片世界模型中的角色回應鏡頭,並以時間控制維持場景與鏡頭運動的連貫性。

Teaser

按一下 F,畫面角色可以轉身望向鏡頭、揮手、點頭或作簡短問候,同時維持場景細節和鏡頭軌跡。HelloWorld 屬於 video world model,處理的是虛擬角色如何對使用者作出具時間位置的社交回應,而不只是生成一段靜態互動片段。

它以 self-distillation training 微調基礎影片生成模型,使用模型自行合成、同時包含社交互動和 camera motion 的資料,讓模型學會 camera-pose conditioning,並減少互動品質下降的取捨。推理階段加入 training-free temporal control,透過 temporal cross-attention mask 將角色回應限制在 F 按鍵觸發的時間窗口內。

目前 Code & Benchmark 標示為 Coming soon,因此讀者暫時較適合先觀看 Demo Video 和論文,了解互動效果及方法;現有資料未提供安裝流程、硬件要求或可直接部署的版本。這亦意味著它更接近研究原型,尚未能按一般開源工具的方式即時整合到自己的工作流。

HelloWorldBench 包含 400 個樣本,除了三項傳統指標,亦加入 ActAcc、TimeAcc 和 GazeDev,分別聚焦動作準確度、時間準確度及視線偏差。較適合研究影片世界模型、遊戲角色互動或虛擬場景控制的團隊;對需要現成產品方案的人,程式碼尚未公開仍是主要限制。

  • 單一 F 按鍵觸發角色面向鏡頭回應
  • self-distillation 同時保留互動品質和鏡頭運動
  • temporal cross-attention mask 不需重新訓練即可控制回應時段
  • HelloWorldBench 以 400 個樣本量度社交互動
  • 程式碼與基準測試仍未提供,部署可行性有待確認

GitHub · Paper

Categories: 開源, Video, 模型訓練, 世界模型, Dataset 數據集

awesome-agentic-world-model:由 World Model 走向可互動的 Agent-Centric World Proxy

這份開源索引把世界建模重新連接到代理人的規劃、學習與驗證流程,亦清楚標出目前仍未解決的取捨。

Repository image for worldbench/awesome-agentic-world-model

需要持續試錯的 AI agent,未必每次都要真的操作環境;有時預測未來狀態、渲染視角、模擬執行結果,甚至取回技能或驗證計劃,已足以支援下一步決策。這個項目屬於開源研究索引與分類框架,實際處理的是如何整理 Agentic world modeling 相關工作,讓讀者按代理人需要的資訊尋找合適方法。

它不會像可直接下載的模型或部署服務般產生結果,價值在於把傳統被動預測下一個物理狀態的 World Model,延伸為面向代理人的 Agent-Centric World Proxy。相比只回答「下一刻會發生甚麼」,World Proxy 也可以回答「這個計劃能否執行」、「應取回哪段經驗」或「下一步應觀察甚麼」,但不同研究的成熟度和驗證方式仍然不一致。

分類採用兩條軸線:六種 Proxy functions 包括 Dynamics、Spatial、Execution、Memory / Experience、Skill 及 Reward / Verification;三個 empowerment levels 則分為 L1 inference-time guidance、L2 training-time optimization,以及 L3 Agent-Proxy co-evolution。這個關係有助分辨模型是在決策時提供提示、訓練時改善能力,還是與 agent 一同持續演化。

  • 用途:按功能及能力層級尋找研究工作
  • 內容:整理模型、論文、arXiv ID、發表場合與年份
  • 維護:接受新增項目、分類修正及連結更正
  • 限制:本身沒有推理 API、安裝流程或統一性能基準

它適合研究人員、建立 agent pipeline 的工程團隊,以及需要比較 Dynamics、Memory 或 Verification 方法的人;但若目標是立即部署系統,仍須自行選擇並安裝清單內的個別模型或工具。

項目目前更像一張持續更新的研究地圖,而非完成度一致的 benchmark。它的優點是提供共同語言,將 world modeling 從單一狀態預測重新放回規劃、學習和互動成本的脈絡;限制則是清單依賴社群維護,分類邊界仍會隨 Agentic world modeling 發展而變動。

項目主頁 · GitHub

Categories: 開源, Agentic, API, 模型訓練, 世界模型, Skill 技能, Dataset 數據集

WorldExam:檢驗世界模型影片的反應力

它不只看畫面像不像,還會測模型能否保住世界一致性與反應。WorldExam 把世界模型影片拆成四層診斷。

WorldExam overview

WorldExam 把重點放在世界模型(world models)影片最常被忽略的地方:畫面好看之外,世界有沒有維持住,場景會不會對動作作出合理反應。它屬於基準測試項目,用來評估可控制影片生成在外觀、操控、空間一致性與內在反應上的表現。

它提供 1,474 個測試案例,涵蓋 camera-driven、action-driven、language-driven 三種控制介面,並劃分為四個診斷層次與八個任務。使用時可依照項目提供的測試案例與統一評估流程,檢查模型在不同場景、不同視角和不同互動條件下的穩定度。

和只看視覺質素或指令跟隨的做法相比,WorldExam 更在意模型有沒有維持空間一致性,以及能否推斷場景應有的反應。它把 scene revisit、terrain interaction、object interaction、social interaction 等情境都納入,適合做影片生成、世界模型、互動式內容與機械人視覺相關研究的團隊。

  • 同時測外觀、操控與世界反應,不只看畫面順不順眼
  • 支援三種控制介面,較貼近不同應用流程
  • 測試案例覆蓋室內外、3D render、電影鏡頭、動畫與 dashcam
  • 有任務級與整體指標,方便比較不同模型
  • 對想看模型有沒有「懂場景」的團隊特別有用

項目主頁 · GitHub

Categories: 開源, 香港中文大學, 3D, 世界模型, 框架, Dataset 數據集

PhiZero 用物理語言先推演再生成影片

PhiZero唔係直接由畫面猜下一格,而係先用一套離散物理語言推演世界點變,再把結果還原成影片。對想做互動模擬同世界模型的人,呢個取向幾值得留意。

Og image

生成影片最難處理的,往往唔係畫面清唔清,而係物件點移動、碰撞同延續。PhiZero 屬於世界模型(World Model),焦點放在「先理解世界狀態點轉變,再生成畫面」,用較細緻的 physical language 去表達變化,減少直接由像素預測帶來的不穩定感。

它想解決的問題很明確:自然語言太粗略,難以完整描述複雜物理過程;純視覺生成又未必能穩定保留因果同動作連貫性。PhiZero 於是從大量無標註影片學出一套 compact discrete representation,先把相鄰影片狀態之間的轉變編碼成 physical language,再交由模型根據首幀畫面同文字動作意圖,預測之後的狀態序列,最後渲染成影片。

它採用 reason-then-render 流程。前段由 Physical Language Tokenizer 抽取相鄰 latent video states 的有序特徵,配合 FSQ 離散化成 physical language;後段由以 Qwen3-VL-4B 初始化的 autoregressive VLM 負責推演,再用訓練好的 diffusion decoder 輸出影片。這種拆法的價值,在於同一套 transition representation 可以重用在 physically realistic generation、action-conditioned simulation、interactive rollouts 同 zero-shot transfer,而唔係只限單一生成任務。

  • 先推演世界轉變,再生成影片,重點放在因果與動作連續性
  • physical language 來自無標註 in-the-wild videos,自監督學習轉變結構
  • 以 Qwen3-VL-4B 作為 reasoner 基礎,並擴充 25K atomic symbols 詞彙
  • 同一表示方式可支援生成、模擬、互動 rollout 同 transfer

現有資料顯示,PhiZero 的訓練資料同時結合真實與模擬影片,並經過逐步篩選,令模型由廣泛視覺經驗收斂到較多動態互動片段。官方頁面已展示 demos,但程式碼仍標示為即將推出,所以現階段較適合把它看成一個值得關注的世界模型方向:它不是單靠更大影片模型硬推結果,而是嘗試先建立可推理、可重用的物理語言介面。

項目主頁 · Paper

Categories: Qwen, Video, 視覺模型, 世界模型

Temporal-Distance-JEPA 訓練世界模型能懂「時間距離」

香港浸會大學團隊把 JEPA 世界模型由「會預測」推近一步到「更識規劃」。Temporal-Distance-JEPA 針對離線示範缺少回報訊號的痛點,直接從軌跡次序挖出可用的進度成本。

Repository image for HKBU-KnowComp/Temporal-Distance-JEPA

香港浸會大學 HKBU KnowComp 的 Jiaxin Bai 公開了 Temporal-Distance-JEPA 論文重現項目,核心不是再做一個更複雜的世界模型,而是修正 JEPA 規劃常見的落差:訓練時學短期 latent prediction,規劃時卻往往直接拿 latent Euclidean distance 當成目標進度。這個項目屬於模型研究重現項目,處理的是離線示範沒有 reward 時,planner 點樣判斷哪條想像路徑更接近目標。

作者保留 LeWM encoder–predictor 與 SIGReg backbone,但不再只依賴 embedding 幾何,而是從 reward-free demonstration logs 挖出 directed temporal cost。做法沿住論文邏輯很清楚:同一條 trajectory 的先後步序提供 positive targets,跨 trajectory 配對充當 heuristic negatives,再用 rollout-consistency 令學到的成本更貼近 planner horizon。這種 framing 直接回應舊範式把 latent L2 當成進度代理的限制,因為拓撲主導任務未必適合只看幾何距離。

結果在 Two-Room、Reacher 這類 topology-dominated tasks,規劃時直接部署 mined cost d_psi;到了 Push-T、OGB-Cube 這類 contact-rich tasks,則改用同一個 temporally trained checkpoint 上的 latent l2 planning。locked evaluation 下,Two-Room 成功率提升到 100.0%,高於 LeWM 的 97.4%;OGB-Cube 亦比 LeWM 高 14.2 分,並且整體上對 LeWM 與 RC-aux baseline 都能持平或更好。

  • 建基於 stable-worldmodel、stable-pretraining 與 LeWM 既有布局,重點在訓練目標與規劃成本的重新對齊
  • 公開庫是 paper-reproduction release,保留 Python CLI,但刻意不附 cluster/Slurm 包裝
  • 資料以 HDF5 形式放在 STABLEWM_HOME,涵蓋 Push-T、Two-Room、Reacher、OGB-Cube
  • 採用 10 epochs,並附有 locked results、cost matrix、diagnostics 等結果資料

這個庫比較像給已有研究工作流的人接手重跑:有 Python 環境、requirements、Hydra config、資料位置與 checkpoint 輸出方式,但沒有替不同排程系統準備現成封裝。歷史上的 contrastive SoftJEPA 相容程式仍可能留在 losses.py 或 jepa.py,不屬於公開配置;換句話說,閱讀與重現時要以 td_jepa 設定為準。對做 world model、offline RL、latent MPC 的研究團隊來說,這個項目最有價值的地方,是它把「表示學到什麼」與「規劃要怎樣排序未來」重新綁在一起。

GitHub · Paper

Categories: 開源, 香港, Embedding, Python, 模型訓練, 世界模型, 中國, 浸會大學

Gemini Robotics 2 想令機械人動作更完整

重點唔止係識睇同識答,而係令機械人連身體控制都更連貫。Gemini Robotics 2 指向的是把感知、推理同動作放入同一條工作流。

CSJxggUnu5m5TfompiXP2z7YLThhUvDn2 kBueCZv6HCEWWefUt WLzM6wxnTV1sTGqBbvmXDnOTB12W18NDr2NgFVXvHKCiTtjfXpyzuOYPJZXlg=w1440

機械人最難處理的,往往不是單一步驟,而是由看見環境、理解指令,到整個身體協調完成動作的連續過程。Gemini Robotics 2 聚焦的正是這個落差,嘗試把 whole body intelligence 帶入機械人,讓系統不只會辨識和規劃,還能更自然地連動身體控制。

Google DeepMind 把它放在 Gemini Robotics 這條 physical AI 路線之下,定位清楚偏向機械人操作與互動。相比只處理螢幕、語言或單一機械臂任務的做法,這個方向更重視整體行為是否連貫,包括感知、推理、用工具與跟環境互動能否接上同一套能力。

對研究機械人、embodied AI 同 VLA 工作流的人來說,這類項目最有參考價值的地方,在於它瞄準真實場景中的協調問題,而不是只展示單點能力。文章提供的內容仍屬簡介層面,未見完整評測細節、量化指標或部署條件,所以現階段較適合當成技術方向觀察,而不是直接當作可落地規格。

  • 把機械人的感知、推理與身體動作放到同一條能力鏈
  • 核心關注點是 whole body intelligence,而不只是語言或視覺理解
  • 屬於 Gemini Robotics 系列,延伸 Google DeepMind 的 physical AI 佈局
  • 現有公開資訊偏介紹性,性能與限制仍有待更多技術資料補充

整體來看,Gemini Robotics 2 反映出機械人模型正在由「識唔識做判斷」走向「能唔能夠完整做完一個動作」。對需要長步驟操作、工具使用與環境互動的場景,這種整合式能力會比單一模組升級更值得留意。

項目主頁

Categories: Google, Gemini, NanoBanana, Agentic, Video, Audio, 安全, Robotic, 世界模型, VLA, Skill 技能

Wonder:Adobe 把影片變成可探索世界

輸入一張圖或一段片,Wonder會延伸出可持續探索的互動場景。重點不只係生成畫面,而係鏡頭移動之後,世界仍然記得之前見過嘅內容。

huggingface logo

由一張圖片或一段影片出發,Wonder會建立一個可以邊走邊看的互動式 Video World Model,處理的是「鏡頭一直移動,但場景仍要連貫」這個難題。你向前推、左右轉,甚至回到之前看過的位置,畫面都要盡量保持幾何、外觀同動態一致,而唔係每一格重新幻想一次。

呢個項目吸引的地方,在於它兼顧了互動感同穩定性。官方資料指出,Wonder支援 image-to-video 同 video-conditioned generation,提供 6-DoF camera control,並以接近固定延遲維持最長一分鐘的探索;對想做可遊走場景、遊戲世界原型、動畫預覽,或者互動式視覺敘事的人來講,呢種體驗比單次生成短片更有用。

為咗令鏡頭控制唔只停留喺抽象指令,Wonder把相機平移與旋轉轉成可對齊畫面的密集視覺證據,再配合 3D scaffold 同 environment map 去建立可導航空間。它亦保留完整歷史的 KV caches,再用 sparse attention 抽取相關記憶,令系統可以在不明顯拖慢回應下,維持較長距離的一致性。

  • 支援 I2V+V2V multimodality,可由圖片或影片開始生成互動世界
  • 提供 6-DoF camera control,重點是可探索而唔係只看固定鏡頭片段
  • 以 sparse attention 配合完整歷史記憶,改善長時段連貫性
  • 官方展示為 16 FPS rollout,頁面上的 32 FPS 影片屬線性插幀後處理

訓練部分用了 Mixture-of-Students 設計,並以 GAN Control Regularization 處理蒸餾時的 camera drift,目標是同時保住控制能力同長期一致性。現階段公開資訊以示範與技術報告為主,Code 同 HuggingFace 尚未釋出;不過單看定位,Wonder已經清楚指向一類更接近「可互動世界」而唔係「一次性影片生成」的世界模型方向。

項目主頁

Categories: 開源, Video, Image, 3D, 模型訓練, 視頻模型, 世界模型

Page 1 of 6
1 2 3 6