StateFlow 把預視化變成可反覆編修 3D 世界

想像先搭好一個可重用的3D世界,再慢慢改鏡頭、物件同事件。StateFlow想處理的,正是生成式預視化最常見的連貫性問題。

StateFlow teaser

影像預視化最麻煩的地方,往往不是生成一條片,而是改完場景、換完鏡頭之後,前後內容仲要講得通。StateFlow屬於面向 previsualization 的 3D world-state modeling 框架,它把場景視為可持續保存的 3D world states,令同一個世界可以反覆建構、演化、再取用,而唔使每次修改都由頭生成。

呢個做法先處理內容一致性,再處理畫面輸出。StateFlow用 object-centric structured 3D state 去描述世界,每個物件都帶有 geometry、spatial pose 同 semantic attributes,將底層世界內容同最終 render observations 分開,於是場景結構、物件關係、動態事件同 cinematic camera direction 可以分步調整。

整個流程分成三段。State Construction 針對 2D 內容提升到 3D 世界時容易出現的歧義,用 prior-guided、conflict-aware dual-view initialization 建立較一致的起始世界;State Evolution 把使用者修改轉成 structured state transitions,保留 world memory,避免每次編修都重建整個場景;State Access 則配合 render-feedback reflection,把鏡頭意圖修正成視覺上可行的 cinematic trajectories。

  • 把一次性影片生成,改成可編修、可重用的 persistent world
  • 同一套世界狀態可支援 video production 同 3D game prototyping
  • 重點不只是生成畫面,而係保住場景結構、物件關係同時間上的連貫性
  • 鏡頭控制加入 render-feedback reflection,提升拍攝路徑的可行性

使用場景相當清楚:要先做分鏡、試鏡頭、試事件節奏的創作團隊,或者想由 3D scene 快速走到 playable prototype 的遊戲項目,都會較受用。現有內容著重方法展示、應用示例同與 baselines 的 3D scene generation 對比,但未見完整論文與量化細節公開,所以目前較適合視為一個值得留意的工作流方向,而唔係已完全定型的產品規格。

項目主頁

Categories: 北京大學, 視頻模型, Video, World-Action Model, 框架, 3D

MiLMMT-v1.0:小米升級開源翻譯模型:支援至 46 種語言

小米把旗下開源多語翻譯項目 GemmaX 升級至 MiLMMT-v1.0,支援語言一舉擴至 46 種,並透過強化學習與模型合併提升翻譯品質。

gemmax

過去想用開源 LLM 做多語翻譯,往往要遷就 20 多種語言的覆蓋,遇上東歐、非洲或東南亞較少見的語種就容易撞牆。MiLMMT-v1.0 把覆蓋範圍一口氣推至 46 種,這個改變對做跨國內容本地化、跨境電商文案,或是需要處理多語客戶查詢的團隊尤其受用。

這個項目屬於多語翻譯模型(multilingual machine translation model),並非框架或工具,核心目標是讓 Gemma3 等開放權重模型在多語翻譯場景下,貼近商用翻譯引擎的水準。它以 Gemma3-1B 與 Gemma3-4B 為基底,先做持續預訓練,再用翻譯指令微調,最後透過強化學習(GRPO)配合 xCOMET、OpenLID、CometKiwi 等無參考指標作為獎勵訊號。

與傳統依賴大型封閉模型、或需要平行語料的監督式微調不同,MiLMMT 強調 reference-free 後訓練:不需要人工對照譯文也能用 LLM-as-judge 改善翻譯結果。同時配合模型合併(model merging),在 1B 規模的小模型上嘗試兼顧多語泛化與低資源語種的穩定性,這點對硬體資源有限、想自建翻譯服務的工作場景相當關鍵。

重點摘要:

  • 支援語言從 28 種擴展至 46 種,覆蓋更多低資源語種
  • 基於 Gemma3-1B / Gemma3-4B 開放權重,可離線部署
  • 採用 GRPO 強化學習搭配 xCOMET、OpenLID 等無參考獎勵
  • 提供 Hugging Face Spaces 線上 Demo,亦有 RL launcher 與獎勵服務腳本可重現訓練流程
  • 相關論文已上 arXiv,紀錄後訓練與模型合併的實證結果

對本地化團隊、開發者或研究人員而言,這個項目提供了一條毋須依賴商業 API 的多語翻譯路線,1B 等級的模型體積亦令自部署門檻大幅降低。

項目主頁 · GitHub · 模型

Categories: 開源, 模型, 中國, 小米-Xiaomi

UA-NWM 不確定性無人機導航

無人機朝目標圖片飛行,最難唔係預測一條路,而係判斷目標畫面是否仍屬合理路徑。UA-NWM 解決「模型解釋唔到」的誤差。

Repository image for DurYi/UA-NWM

戶外無人機導航最易出錯的位置,在於前方畫面未必只有一種合理變化。UA-NWM 把這個問題當成 world model 的評分工作處理,面向 aerial image-goal navigation,唔再只估一個未來畫面再同目標硬碰硬,而係判斷目標圖片是否落在模型預測的未來狀態分佈之內。

它最值得留意的技術點,是用 Hierarchical Error Projection(HEP)把預測與目標之間的差距拆成可由不確定性子空間解釋的部分,同埋解釋唔到的殘差,最後只用後者作為 trajectory cost。呢種做法同單點預測式 ranker 的分別很直接:同樣見到偏差,UA-NWM 會先問偏差是否屬於合理未來變化,而唔係一概當成走錯路。

模型本身會預測未來的 DINO latent features,配合 deterministic future feature map 同 uncertainty subspace 做單次 forward scoring,避免靠隨機抽樣多個未來狀態先完成比較。同一個 checkpoint 可配合兩種 inference strategy,包括 uncertainty-aware 的 UA-NWM 與 deterministic baseline,適合研究團隊直接比較兩種評分邏輯帶來的差異。

  • 適合 UAV 導航、戶外機械人感知,以及要由目標圖片反推行進路線的團隊
  • 重點唔係生成最像的未來畫面,而係判斷目標是否仍在合理未來分佈內
  • 提供 AirGoal-10k 的 training、evaluation、trajectory ranking、CEM/MPC planning 與 visualization workflow
  • deploy/ 內有真實部署用的 server-side policy wrapper,但原始資料未完整交代整套部署步驟

它已對應 AirGoal-10k,並包含真機 UAV demo、資料集連結與 pretrained checkpoints;受益最大的是需要處理大範圍戶外場景、多解未來觀測,以及想把 world model 直接接到規劃器如 CEM/MPC 的團隊。

項目主頁 · GitHub · 模型

Categories: 開源, 清華大學, 世界模型, 模型訓練, Image, Dataset 數據集, 百度

SimWAM:把 AI 影片變成自動駕駛規劃

華中科大與東風研發團隊提出的 SimWAM,將影片專家和動作專家共同訓練,再丟掉影片分支只保留規劃器。它把未來畫面學到的動態先驗,轉成較低延遲的軌跡預測。

Overview of the SimWAM architecture with isolated attention

華中科技大學與東風研究團隊合作提出 SimWAM,重點是把影片生成的能力轉成自動駕駛規劃訊號,而不是在推理時硬做未來影像生成。它屬於 World-Action Model (WAM),直接處理端到端自動駕駛中的軌跡預測與規劃問題,目標是減少延遲,同時保留對交通動態的理解。

訓練時,系統會把預訓練影片專家和輕量動作 DiT 一起做 joint flow matching,讓未來畫面學到的動態先驗滲入動作表示。兩邊共享注意力流,但用 isolated attention mask 令未來片段和動作 token 不會互相偷看,推理時就可以直接丟掉影片分支,只留下動作專家。

  • 研究團隊來自 Huazhong University of Science & Technology 和 Dongfeng Research & Development Institute。
  • 推理階段不需要未來場景生成,也不需要額外動作模組。
  • 動作專家可獨立縮放,影片骨幹亦可替換,結構相對靈活。
  • 在 NAVSIM 上取得 91.5 PDMS,並可 zero-shot 遷移到 nuScenes。
  • 強化學習部分用 FlowGRPO 去優化組合式駕駛獎勵,只更新動作專家的 LoRA adapters。

它最值得留意的地方,不在於把模型堆得更大,而是把訓練用的影片訊號和部署用的規劃器切開,令系統在保留動態理解的同時減少推理負擔。官方沒有完整列出安裝步驟,因此較適合先按論文與程式庫說明理解其訓練和部署流程。

GitHub · 模型

Categories: 開源, 視覺模型, VLA, 中國

RVC WebUI:低門檻變聲框架的實用與代價

這個語音音色轉換框架把訓練、推理和即時變聲放進同一個網頁介面,重點是讓少量語音資料也能做出可用效果。它的強項在於速度、易用性和模型融合,代價是硬件與延遲條件仍會影響體驗。

Repository image for RVC-Project/Retrieval-based-Voice-Conversion-WebUI

RVC(Retrieval-based Voice Conversion)WebUI 把語音音色轉換、變聲推理和即時變聲收進同一套 Web 介面,適合要快速做 AI 歌聲、配音修音或聲音風格替換的人。它不是單純展示效果,而是把訓練、檢測、推理和即時輸出串成一條可操作流程,降低了進入門檻。

這個項目主打少量資料也能訓練出可用模型,官方建議至少準備 10 分鐘低底噪語音。它採用 top1 檢索去替換輸入特徵,減少音色洩漏,並用 InterSpeech2023-RMVPE 做人聲基頻提取,處理哑音問題時速度快、資源占用也較小。

支援 Python 3.12 x64;Ubuntu 24.04、Windows 與 Linux 都有對應路徑,A 卡和 I 卡則走 CPU 依賴方案,Windows 亦可用 DirectML。即時變聲延遲官方標示可達端到端 170ms,配合 ASIO 輸入輸出設備時可進一步降到 90ms,但對硬件驅動支援要求較高。

  • 可用少量語音資料訓練,門檻比傳統聲音模型低
  • WebUI 同時覆蓋訓練、推理與即時變聲
  • ckpt-merge 允許用模型融合去調整音色
  • 可接入 pymss/MSST 分離人聲與伴奏
  • 更適合配音、歌聲轉換、直播變聲與聲音原型測試

GitHub

Categories: 開源, 數字人, 模型, Linux, Python, 語音, 中國

AVE-Compass:音畫編輯終於有了更嚴格的驗收尺

AVE-Compass 把音效、畫面與指令完成度放在同一套測試中,揭示編輯模型最容易忽略的失真與不同步問題。

AVE-Compass overview

音畫編輯模型最難兼顧「改得夠準」與「其他內容不走樣」。AVE-Compass 是一套針對自由格式音訊影片編輯的診斷基準及評估工具,檢查模型有沒有完成指定修改,同時保留非目標畫面和聲音,亦會捕捉音畫不同步與感知瑕疵。

測試範圍包括145段來源影片、196條經人工核實的音畫指令、2,688項細緻 checklist,以及28種編輯操作,涵蓋聯合音畫、語音、純影片和純音訊修改。它以 Multimodal Large Language Model (MLLM)-as-Judge 配合跨模態、影片及音訊自動指標,分開計算 Instruction Following、Fidelity Preserving、Editing Intent 和 Realism。

MiniMax H3 Turbo LoRA Faster Sampling Steps & Prompt Agent Skill

使用者可從 AVE-Compass-v2 資料集取得樣本,再按設定檔和輸入模板交予評估 pipeline,輸入來源影片、指令、checklist 及模型產生的編輯結果。樣本以共享的識別值配對,來源影片則由 instruction JSON 解決;未啟用或缺失的客觀指標會維持未設定,不會被當成虛構的零分。

重點可整理為:
– Editing Intent 同時要求完成修改及保留非目標內容,避免模型不作修改卻取得偏高保存分數。
– 音訊執行和音畫時間同步是常見失分位置。
– AVE-Agent 加入 planning 和 self-reflection,對複雜指令的 Editing Intent、Instruction Following 及音訊處理有較明顯改善。
– 基準適合研究團隊比較模型,也適合影片生成產品建立回歸測試。

它的價值不在於只給一個總分,而是把「改錯了甚麼」拆開呈現;代價是需要模型輸出影片、完整評估資源及相應 MLLM,部署門檻高於單純像素或音質比較。對正在開發跨模態編輯模型的團隊,AVE-Compass 更像一套找出失敗原因的驗收框架,而不只是排行榜。

項目主頁 · GitHub

Categories: 開源, 南京大學, Agentic, 多模態模型, 語音, Dataset 數據集

Ego2Robot 把人類影片轉成機械人訓練數據

Ego2Robot將第一身人類操作影片轉化成大規模機械人訓練數據,改善 VLA 模型面對陌生環境時的泛化能力。

Ego2Robot pipeline overview

機械人要應付陌生場景,往往需要大量而且多樣化的示範數據;Ego2Robot選擇從第一身人類操作影片取材,將人手動作轉換成不同機械人形態可以使用的訓練資料。這個數據合成項目面向 Vision-Language-Action(VLA)模型預訓練,處理人類影片與機械人動作、視覺外觀不一致的問題。

流程分為動作對齊、視覺對齊和品質篩選三部分。系統會把拇指、食指、中指指尖及手腕等關鍵點重新映射到夾爪的 TCP、開合幅度和方向,再以 Savitzky–Golay 及 SLERP 平滑動作;視覺處理則結合 SAM 3、ProPainter、機械人底座姿態搜尋和 IK solving,把機械人手臂合成到已修補的人類場景中。

項目支援已有手部姿態標註的數據集,也可以從原始影片估算姿態,後者使用 WiLoR 逐幀重建和 DynHaMR 時序最佳化。統一流程可以平行產生 15 種 robot morphologies,累積 18,561 小時訓練數據,涵蓋較多任務、場景和機械人配置。

重點包括:
– 同時支援 curated datasets 和 in-the-wild videos
– 以多層 quality curation 篩走動作及視覺合成中的低質資料
– RoboTwin 2.0 加入視覺外觀、場景佈局、機械人形態和任務語義等干擾軸
– 與機械人數據聯合預訓練後,多種 out-of-distribution 情況下的泛化能力提升
– 改善效果亦在真實機械人部署中獲得驗證

對需要建立通用機械人操作模型的研究團隊,Ego2Robot提供了一條減少真人示範收集成本的路線。不過,合成數據的品質仍取決於手部姿態估算、動作重定向、逆運動學和場景合成是否準確,因此它較適合作為真實機械人數據的補充,而不是完全取代實體部署資料。

項目主頁

Categories: 阿里巴巴, 視覺模型, 多模態模型, 模型訓練, Qwen, Video, VLA, Robotic, 中國, Dataset 數據集

DeepVoyager-VL 把視覺線索放回搜尋流程中

DeepVoyager-VL不只是睇圖再答題,而係會用新取得嘅視覺證據決定下一步搜尋。對長流程多模態檢索項目而言,呢個改動幾關鍵。

Comparison of multimodal search data synthesis paradigms

當一個多模態 agent 要連續查多步資訊,最易失準嘅位置往往唔係答題,而係中途搵錯線索。DeepVoyager-VL處理嘅正正係呢個問題:佢屬於長流程多模態 deep-search 框架,讓新取得嘅圖片證據直接影響下一輪檢索,而唔係只喺輸入開頭或答案結尾先用到視覺資訊。

呢種做法令佢同一般把視覺訊息包裝成前置條件嘅方法有明顯分別。DeepVoyager-VL背後用 EventVoyage-VL 生成帶有中間視覺依賴嘅長流程問題,再用整理過嘅 trajectories 做 Supervised Fine-Tuning(SFT),而唔加額外 reinforcement learning 階段;取捨好清楚,訓練流程較可重現,但效果仍然要靠資料合成質素同軌跡篩選撐住。

倉庫而家已經放出 paper、project page,同可重現嘅 Megatron SFT training bundle,亦提供 DeepVoyager-VL-8B 同 DeepVoyager-VL-30B-A3B 模型,以及 EventVoyage-VL dataset。想理解點樣驗證,最直接係沿住現成模型、資料集同訓練 bundle 睇完整流程;README 亦提到 SWIFT RUNTIME=bundled 會使用儲存庫內嘅 source trees,定位上比較接近研究與訓練復現項目,而唔係即開即用嘅消費級產品。

  • 核心改動:把 vision in the loop 放入搜尋中段,圖片可按需要先載入或裁切
  • 資料來源:EventVoyage-VL 先做 structure-before-language synthesis,再抽出可監督軌跡
  • 訓練路線:以 supervised-only 為主,冇再疊 reinforcement learning 階段
  • 結果:8B 同 30B-A3B 平均分別為 54.8 同 58.6,並在十個 benchmark 入面分別拿下八個同九個最佳成績

分數本身已經講到定位:DeepVoyager-VL不只是追求更大模型,而係想改善「見到新圖之後,下一步應該搵乜」呢個決策環節。較受益嘅會係做多步檢索、多模態問答、研究型 agent pipeline 嘅團隊;要留意嘅限制亦同樣直接,成效高度依賴合成資料點樣把中途視覺依賴編排得夠真實,離開相關 benchmark 之後,泛化深度仲要靠後續驗證。

項目主頁 · GitHub

Categories: 開源, 香港科技大學, 北京大學, 華為, Agentic, 模型, 多模態模型, 模型訓練, 框架, Dataset 數據集

MBM:跨類別動作轉移突破

你可以把它理解成一套跨類別影片動作轉移框架,重點是外形差很多時仍保住動作與身份。

Framework

想把一段動作搬到另一個角色或畫面,最怕形態差太遠時連身份都一併扭曲。MBM 走的是一套 motion transfer 研究框架,重點是把跨類別動作轉移做得更穩,讓 reference video 的動作可以連同 text,必要時再加一張 reference image,一起驅動生成。

它分兩段處理:Stage I 先學 heterogeneous abstract motion conditions,再 bootstrap cross-category motion pairs;Stage II 再用 raw reference videos 把這套監督內化。推理時直接靠 reference video、text 和 optional reference image,不需要 explicit motion extraction 或 test-time optimization。

它和只在相近外形之間搬動作的做法不同,目標是連 same-category、near-category 到 far-category 都盡量維持 motion fidelity 與 target preservation。資料同時提到 OpenVMT-Dataset 和 OpenVMT-Bench,前者是 instance-level motion-equivalent cross-content pairs,後者則用逐步拉大的 category gap 去測。

  • 兩階段框架先學抽象動作,再把監督內化到生成流程
  • 推理端直接吃 reference video、text、optional reference image,流程較短
  • 主打跨類別動作轉移,適合影片生成、角色動作遷移、動畫合成
  • 在大形態差距下仍可維持較好的動作保真與目標保留

項目主頁 · GitHub

Categories: 開源, 北京大學, AI productions, Video, Image, 框架

[技術文章] StyleForge 以反事實推理統一室內家具風格配搭

面對固定間隔的室內佈局,StyleForge 不再逐件揀家具,而是連同整個房間一齊判斷風格協調。你可以把它理解成一個會追蹤跨家具衝突的選件框架。

Hero image preview

固定佈局的室內家具風格配搭,難點唔係搵到單件外觀相符嘅家具,而係放埋一齊之後會唔會撞色、撞材質,甚至整體氣質唔夾。StyleForge 就係針對呢個問題而設,喺唔改變家具類別、位置、朝向同比例嘅前提下,幫系統為每個家具槽位揀出更一致嘅組合。

現有做法多數只係逐件檢索,或者靠靜態關係去描述房間,結果容易忽略全局配搭。StyleForge 改用 scene-level structured selection framework,先由凍結嘅 multimodal large language model(MLLM)抽取風格線索,再由可學習嘅候選分佈配合 dynamic hypergraph style field,捕捉家具之間更高階嘅依賴。

佢另一個重點係 counterfactual style preference learning。做法係將每個候選視為當前風格場入面嘅局部替換,然後用 Mahalanobis energies 去評估同上下文嘅相容性,訓練時再交替優化風格場同候選 logits;推理時只更新房間專屬嘅候選 logits,逐步修正跨槽位衝突。

  • 同時考慮單件相關性同整體房間協調
  • 用動態 hypergraph 去表達跨家具依賴
  • 以反事實推理檢查候選喺場景中的相容性
  • 推理階段只調整房間專屬 logits,模型主體保持凍結
  • 喺 3D-FRONT 上做出較一致嘅固定佈局家具安排

作者喺 3D-FRONT 上展示咗更高嘅 furniture retrieval 表現,同時亦提升 scene-level style coherence。對做虛擬室內設計、3D 內容製作,或者需要穩定室內擺設嘅 immersive embodied environments,呢種「先睇整體,再揀單件」嘅方法會更貼近實際需要。

Paper

Categories: 框架, 3D, 中國

Page 3 of 15
1 2 3 4 5 15