VideoGen-Agent 讓影片生成懂得規劃、驗證與修正

影片生成不再只靠一次輸出,VideoGen-Agent會分步使用工具,檢查結果後再修正畫面與內容。

VideoGen-Agent logo

面對需要維持人物身份、物理關係、場景構圖或事件次序的提示詞,一次生成往往難以兼顧所有要求。VideoGen-Agent以多模態代理配合強化學習,讓影片生成流程加入規劃、工具操作和視覺驗證,逐步處理這些容易出錯的部分。

代理會在多輪互動中協調 augmentation、generation 和 verification 工具,根據提示詞及中途觀察結果決定下一步行動。訓練先以教師生成的工具使用軌跡建立基本行為,再透過 multitask agentic reinforcement learning 改善工具選擇和生成品質,並以混合獎勵同時評估工具呼叫有效性、任務配合程度及影片效果。

VABench 包含600個提示詞,涵蓋程序知識、單一及多個實體的身份保持、物理一致性、場景構圖和多鏡頭時間結構。以 Seedance 1.0 T2V 作為基礎生成器時,VideoGen-Agent分數由56.5提升至75.6;推理時換用 Toolset 2,即使不重新訓練代理,分數仍升至86.1,人類評審在雙選比較中有84.3%偏好升級後的配置。

• 以多步驟代理流程取代單次影片生成
• 結合 augmentation、generation 和 verification 工具
• 針對身份、物理一致性及事件順序等難題作出驗證
• VABench涵蓋600個多類型提示詞
• 程式碼及資料集當時仍標示為即將推出

這種做法較適合需要精準遵循複雜提示詞的影片創作、研究評測及工具驅動工作流。它仍依賴可用的生成與驗證工具,代理表現亦會受基礎模型、工具能力和評估方式影響,不能把分數提升直接視為所有影片場景都能獲得相同效果。

項目主頁

Categories: 香港中文大學, Agentic, AI productions, Video, 提示詞

YuE2 補上真實音訊 Tokenizer,支援歌曲翻唱微調

YuE2取得音訊編碼與真實錄音適配能力,可將自家錄音轉成語義碼,再微調歌手風格。

Og image

當你餵給 YuE 一段參考音訊(例如某歌手的演唱片段或特定樂器風格,要求接續生成)時:必須先用 Tokenizer 將參考音訊「壓成代碼」傳入模型。若 Tokenizer 品質不佳,音色在第一步壓縮時就失真了。

這個 v4 工具能更高保真地將輸入聲音轉為 Token,讓後續模型捕捉到的音色特徵更貼近原音。

錄音轉換、歌手風格微調和歌曲翻唱,原本受限於 YuE2 沒有隨附的 audio → semantic-token encoder。這個項目基於 m-a-p/YuE2-3B 及 m-a-p/MERT-v2-FullSong,加入音訊 Tokenizer 與 NAR-branch LoRA,讓 YuE2-3B 可以處理自家錄音,並以真實製作音訊調整解碼效果。

Tokenizer 取用 MERT-v2-FullSong 第 20 層特徵,先按音軌作 instance normalization,再以 8 層、d=512 的 Transformer,在 512-frame 視窗內轉換成 32,768 種 YuE2 semantic codes,特徵率為 25 Hz。留出歌曲測試的 top-1 exact match 為 16.1%,但近似 code 產生的聲音接近,NAR round-trip 聽感測試約達 95%。

  • tokenizer_head_joint_v4.pt.safetensors.bf16.safetensors:音訊編碼 head
  • nar_lora_joint_v4.pt.safetensors.bf16.safetensors:NAR 解碼分支 LoRA
  • _comfyui.safetensors:配合 ComfyUI 的 YuE2 權重布局
  • LoRA rank 為 32,覆蓋 28 層 NAR attention、MLP,以及完整替換的 vae2llmllm2vae

.bf16 版本約為完整精度檔案的一半,head 與 fp32 的輸出一致率為 98.6%。項目附有 scripts/ckpt_io.py、訓練迴圈和推論腳本;ComfyUI 可把 LoRA 載入 YuE2 checkpoint 的 MODEL 輸出,強度設為 1.0,CLIP 輸入不受影響。頁面沒有提供 GGUF 檔案、檔案大小、上下文長度、Ollama、LM Studio、llama.cpp 或 MTP draft speculation 支援資料,亦沒有列出可供選擇的量化級別。

模型先以 4,765 首 YuE2 自行生成歌曲訓練,再適配真實音訊;因此它的價值集中於提升真實錄音的編碼與 NAR 解碼,而非取代 YuE2-3B 的完整生成能力。授權為 CC-BY-NC-4.0,商業用途需要另行確認授權條件。

模型

Categories: 開源, ComfyUI, 模型, 模型訓練, Audio, 工具, 廣東話, Tokenize

Grounded-Action-Model:讓機械人先理解物件位置,再決定如何動作

Grounded Action Model 把語言、點和框選提示轉成同一套 3D 物件表示,提升機械臂面對場景變化時的穩定性。

A language instruction, a 2D point or a 2D box is resolved by a pretrained 3D grounding model into image tokens and dete

面對物件被移位、場景重新排列,機械臂未必只需要更長的指令,而是要準確知道目標在哪裏。Grounded Action Model(GAM)屬於機械人基礎模型,透過 3D grounding 將語言、2D 點或 2D 框選轉成同一套以物件為中心的觀察,再預測連續動作。

GAM 使用凍結的 promptable 3D detector,提取目標物件的視覺特徵和 metric geometry,並與機械人狀態歷史交給 multi-stream transformer,輸出 action chunks。相較於由 Vision-Language-Action Models(VLAs)或 World-Action Models(WAMs)從示範中隱性學習位置關係,GAM 把 3D 位置直接放進控制流程,也可由高層 planner 透過不同提示方式控制,支援較長流程和需要記憶的操作。

A language instruction, a 2D point or a 2D box is resolved by a pretrained 3D grounding model into image tokens and dete

目前可參考的結果包括:
– RoboTwin 2.0 的 50 項任務平均成功率為 55.3%,場景隨機化時為 47.6%。
– LIBERO-PRO 的 16 種擾動設定平均成功率為 61%,目標重新放置時改善較明顯。
– 雙臂 YAM 面對視覺變化仍成功 17/20 次;Franka 配合 Molmo2 planner,長流程任務的 OOD step completion 為 49.8%。

Grounded-Action-Model 適合研究機械人操作、視覺變化和高低層控制協作的團隊,但目前 GitHub 仍只有論文與項目頁面,training and inference code、pretrained checkpoints 及 real-robot setup 尚待公開,因此暫時不能按儲存庫直接安裝或重現結果。數據主要來自指定基準和兩款機械人,能否延伸到其他硬件與未見過的操作,仍要等待程式碼及更多測試。

項目主頁 · GitHub

Categories: 開源, 模型, 視覺模型, 多模態模型, 模型訓練, 微軟, VLA, World-Action Model, Robotic, 3D,

physics:拆解 Wan2.1 的物理失誤

籃球彈跳變成半空漂浮,問題可能早在去噪頭幾步由注意力決定。這個研究以 RoPE 調整改善影片動態。

teaser

一個籃球由半空跌落後,理應撞地再彈起,Wan2.1-T2V 卻可能生成漂浮、突然停頓或半空反彈。這個 GitHub 項目屬於影片生成模型的可解釋性研究,實際處理的是 text-to-video diffusion models 如何在早期去噪階段規劃物件軌跡,以及錯誤位置為何會一路鎖定。

研究把視線集中在 Wan2.1-T2V-1.3B 的最初五個去噪步驟,透過 video-to-object-token cross-attention 追蹤物件位置,再配合 convergence speed 和 causal contribution 找出負責形成軌跡的 attention heads。分析指出,Self-attention 中的 Rotary Position Embedding (RoPE) 會令空間注意力衰減過快,早期錯誤候選位置因此壓過鄰近影格較合理的路徑。

修正方法不依賴外部物理模擬器或額外 foundation-model teacher,而是在早期步驟降低 height/width RoPE frequency,測試時前五步使用 λ^{h/w}=0.70;需要訓練時則以只作用於 self-attention 和 cross-attention 的 Low-Rank Adaptation (LoRA) 配合 λ^{h/w}=0.75。LoRA 設定為 r=64、alpha=32,並以首 10% 去噪步驟佔 0.9 機率的混合 timestep sampler 加強早期學習。

測試這個項目時可沿用 Wan 官方模型與提示詞,以不同 random seeds 比較原模型、training-free 頻率調整及 LoRA 版本的籃球跌落等片段;程式透過 runtime monkey patches 修改行為,不需要改動官方 Wan source。提供的資訊確認有 training-free 和 training-based 實驗,但未列出完整數值指標,因此更適合視為機制分析與可重現的研究原型,而非已證明能處理所有物理場景的通用修補方案。

  • 物件軌跡主要在最初五個去噪步驟形成
  • Cross-attention 負責引入物件語義,self-attention 協助選擇候選區域
  • RoPE 空間衰減過強,會令錯誤位置過早固定
  • 可用早期頻率縮放,或加入只改注意力層的 LoRA
  • 適合研究影片生成、模型可解釋性及物理一致性的團隊

項目主頁 · GitHub

Categories: 開源, AI productions, Embedding, 模型, 視頻模型, 模型訓練, Video, 提示詞

WorldCrafter 記住你走過的世界

WorldCrafter把單張圖片或文字提示變成可操控鏡頭的連續場景,改善長時間探索時畫面失憶與視角不一致的問題。

鏡頭移開再回望時,生成場景仍能維持空間關係,正是 WorldCrafter 要處理的核心卡位。它屬於影片世界模型,能從單張圖片或文字提示建立可探索場景,並按照鏡頭控制生成後續畫面,減少長時間移動、回訪視角時的內容漂移。

WorldCrafter以可由鏡頭查詢的隱式 3D-aware memory 保存過往觀察,讓指定視角決定哪些歷史資訊交給影片生成器;記憶編碼器與姿態條件讀取模組會把不同視角的資料整理成目標視角適用的 memory tokens。它不依賴顯式深度估計或幾何 warping,近期 temporal context則負責維持動態物件和連續動作。

WorldCrafter Video Demo

提供 WorldCrafter-Base,以及經蒸餾、面向較快推理的 WorldCrafter-Fast。兩者可在 Linux、Python 3.11、NVIDIA GPU 和相容 CUDA 驅動環境運行,模型權重放在 Hugging Face;Fast 版本較適合互動式串流,但硬件要求和生成速度仍取決於本地配置。

  • 支援圖片轉可探索世界,也支援文字轉可探索世界
  • 可控制鏡頭、揭示未見區域,並回到曾經觀察的視角
  • 設計同時兼顧靜態場景、動態場景和長時間探索
  • 評測涵蓋145個場景及725條鏡頭軌跡

評測中,WorldCrafter在長時間回訪一致性和鏡頭控制準確度上優於參與比較的基線,整體 VBench 分數亦最高;項目展示的點雲與鏡頭軌跡重建,則用來檢查生成影片的幾何連貫性。研究團隊來自 Tencent ARC Lab 與北京大學,較適合研究生成式世界模型、可控影片、虛擬場景探索及互動內容的團隊測試。

項目主頁 · GitHub · 模型

Categories: 開源, 北京大學, 騰訊, AI productions, 模型, 世界模型, NVIDIA, Video, Image, 3D, Linux, Dataset 數據集

Gricea:把 AI 研究變成可重用的開放工作流

Gricea讓研究團隊設計、執行及分析人機對話實驗,並保留可重用的研究脈絡。

image

研究人員測試 AI 對信任、偏見或使用習慣的影響時,往往要自行處理分支流程、隨機分組、對話介面與事件記錄。Gricea提供一個開放平台,讓團隊在同一套工作流內設計受控的 Conversational AI 研究、收集互動資料,並比較不同研究設計。Gricea 就是把這整套東西做成一個可運行、可分享的研究實驗。

用一個例子說明,假設你想研究:「廣東話 AI 客服,用 GPT 類模型還是本地模型,使用者會覺得較有幫助?」

你通常要自己做很多東西:
-做一個受試者能使用的聊天網頁
-設定 chatbot 用哪個模型、system prompt、知識庫與工具
-把受試者隨機分兩組:A 組用模型 A,B 組用模型 B
-安排任務,例如「請 AI 幫你處理退貨」
-收集聊天紀錄、完成時間、滿意度問卷
-確保別人日後可以用同一個流程再做一次

平台以可編輯的視覺流程建立器編排研究,支援 within-subject 和 between-subject 設計、隨機化、條件分支及邏輯控制。研究人員亦可加入 LLM 聊天介面、bias manipulation、RAG-based context retrieval 和 streaming responses,觀察模型設定或對話脈絡改變後,參與者行為如何變化。

• 記錄訊息、點擊及其他行為事件
• 連結參與者路徑、回應、replay 和研究層級分析
• 以 consent 版本管理、遮罩 replay,限制研究資料存取

Gricea 同時提供參與者管理、資料分析、研究分享及公開研究瀏覽功能,公開項目可以作為其他研究的模板。研究團隊可研究「奉承式 AI 如何改變信任」等問題,也可比較 RAG 介面、對話風格或教育問卷設計;平台的價值在於保留完整 study artifact,方便其他人檢視、修改及重新部署。對需要可重現流程、細緻互動記錄和社群協作的 Conversational AI 研究尤其合適,但資料貢獻仍涉及私隱及同意範圍,研究團隊需要自行界定收集與分享的界線。

項目主頁 · Paper

Categories: Agentic, RAG

CrossView Warp : H3 LoRA 影片新視角

輸入原片與鏡頭偏移,就能生成同一場景的新視點;代價是需要 ComfyUI、深度變形及額外工作流程配合。

Og image

想從影片另一個鏡頭角度觀看同一場景,這個 LoRA 可直接處理方位角(azimuth)及仰角(elevation)偏移。它基於 MiniMaxAI/MiniMax-H3 微調,屬於 Ref2VA 影片生成用途,並非獨立的完整模型。

模型會同時讀取兩段影片:經過 CrossView Warp 的深度變形片段負責提供場景幾何,原始片段則保留人物身份與外觀。深度資訊由 MoGe Inference 產生,再交給 ComfyUI-CrossViewWarp 節點處理;生成結果對未被原片覆蓋的區域仍需要提示詞引導,因此新視角越大,畫面補全的不確定性亦可能增加。

使用流程集中於 ComfyUI:安裝 CrossViewWarp node,先取得 MoGe 幾何資料,再把 warp 與 source 調整至相同尺寸;載入 MiniMax-H3_Ref2VA-LoRA-CrossView-Warp_v1_3500.safetensors 到 ref2va checkpoint,並以 MiniMax H3 Add GuideMiniMax H3 Reference To Video 串接,frame_idx 設為 0。LoRA strength 建議由 0.8 開始,頁面建議範圍為 0.8 至 1.0,觸發詞是 crossview

  • 已確認的基礎模型:MiniMaxAI/MiniMax-H3
  • 主要檔案:MiniMax-H3_Ref2VA-LoRA-CrossView-Warp_v1_3500.safetensors
  • 頁面未列出 GGUF 檔案、量化級別、mmproj、檔案大小或量化建議,因此不能推斷 Q4_K_M 等本地推理配置
  • 頁面只明確提供 ComfyUI 工作流程,未確認 llama.cpp、Ollama、LM Studio、MTP draft speculation 或效能基準支援

它把 CrossView-Warp 概念移植到 MiniMax-H3,核心價值在於以幾何變形和原片外觀互補,協助影片生成模型維持場景連貫性。頁面提供多個 compare_* 影片作為 warp、原片與結果的並排示例;授權則標示為 minimax-h3-community-license

模型

Categories: 開源, ComfyUI, AI productions, Video, 提示詞, , MiniMax

YuE2-ComfyUI:本地生成完整歌曲,能改樂譜再翻唱

輸入風格與歌詞,便能在 ComfyUI 生成歌曲及可讀樂譜,讓創作流程多一個可修改的環節。

The score editor over the canvas, titled Score -- YuE2 Generate Song, with the line The notes this node sings. Nothing i

把歌詞接入節點、設定曲風後,YuE2-ComfyUI 便能在本機生成完整歌曲與可讀樂譜。這套音樂生成節點工具把 YuE2-3B 接入 ComfyUI,適合想在同一工作流程反覆試作的音樂創作者。

它先寫出 ABC 樂譜,再生成演奏內容,最後透過變分自編碼器(Variational Autoencoder,VAE)解碼成 48 kHz 立體聲。樂譜也可修改後送回節點演唱,讓旋律調整有更具體的入口。

  • YuE2 Generate Song 接收風格、歌詞及 seed。
  • 歌詞可從文字節點接入,以 [Verse]、[Chorus] 標示段落。
  • YuE2 Write Song 可從一句構想撰寫風格與歌詞。
  • YuE2 Options 提供選填設定,主節點會自動尋找本機權重。

項目示例在 RTX 5090 上花 40.2 秒生成 75 秒歌曲,但單一示例不足以推算其他硬件的速度。提供的內容未列出完整安裝步驟、最低顯示記憶體需求或音質比較;準備納入製作流程前,仍需確認本機能否載入模型。

GitHub

Categories: 開源, ComfyUI, AI productions, 工具, Content Creator, 音樂, 廣東話

RefineEdit : 免訓練 Prompt-to-Prompt 編修

RefineEdit 以文字提示生成來源與編輯結果,毋須額外訓練或遮罩,但未能直接處理任意真實照片。

compare

由 source prompt 改成 editing prompt 時,RefineEdit 會先生成來源圖,再重用中間 refinement state,讓 1024 × 1024 編輯結果較容易保留原有內容。這個項目屬於免訓練的 prompt-to-prompt 影像編輯方法,實際處理的是文字驅動編輯中「改變指定內容」與「維持畫面穩定」之間的取捨。

GRN 負責生成流程,HBQ tokenizer 和 UMT5 encoder 會一同載入;RefineEdit 本身沒有額外 checkpoint。source-anchored bit routing 先選出可編輯座標,再配合 adaptive spatial freezing(AdaSF)及 finite bit locking(FBL)限制後續變化,毋須外部 editing mask。

RefineEdit 需要 Linux、支援 BF16 的 CUDA GPU,以及官方 GRN 預訓練權重;A100 80 GB 是參考配置,項目並不適合低記憶體 GPU 或 CPU 推理。FlashAttention 2 可加速原始流程,未能安裝時可改用 PyTorch scaled dot-product attention,但速度、記憶體消耗和數值結果都可能不同。

  • 不需額外訓練、RefineEdit checkpoint 或外部遮罩
  • 只支援由提示詞內部生成的來源 refinement trajectory
  • 不直接編輯任意真實圖片,應用範圍比一般照片編輯流程窄
  • 附有 mask summary/step PNG 及 adaptive bit lock stats.csv,方便檢查座標選擇和鎖定狀態

它適合研究文字生成影像編輯、需要可重現實驗的團隊,以及已有 GRN 推理環境的開發者。儲存庫未提供統一 benchmark 數字,不能單靠 1024 × 1024 輸出判斷畫質;不同 attention backend 即使使用相同 seed,也不保證產生逐像素一致的結果。

GitHub

Categories: 開源, 模型訓練, NVIDIA, Image, 提示詞, Linux, Python, , Dataset 數據集

OmniVChat:測試 AI 能否同時聽懂及看懂

直接把聲音和影像交給AI,回覆是否仍有根據?OmniVChat 提供評分工具,但測試與訓練分數不能混用。

OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue

讓AI直接接收用戶的聲音和影像,再以文字回答,OmniVChat(Omni Video Chat)提供了檢驗這類對話的評估與訓練獎勵工具。問題藏在影音之中,不另附文字提問、外部影像描述或自動語音辨識(Automatic Speech Recognition,ASR)轉錄,適合測試多模態模型能否連結所見所聞。

OmniVChat-Bench包含2,800段合成對話,按分層準則評分,涵蓋五類能力:

  • Dialogue-State & Link Perception(DSLP):理解對話狀態與連結。
  • Multimodal Entity Alignment(MEA):把說話對應至正確的可見實體。
  • Model Self-Awareness(MSA):交代自身身分與物理限制。
  • Anti-Hallucination(AH):回答以影音證據為依據。
  • Emotion Recognition(ER):結合面部與聲線辨識情緒。

評估分數r(y)介乎0至1,以Subcategory Mean匯報;OmniVChat-RL共用評分核心,另加格式、效率與風格獎勵,範圍為0至1.5,兩者不能直接比較。

研究團隊可先查看儲存庫的評分程式與範例,再到Hugging Face取得完整標註及媒體。這個項目只提供程式碼、範例與文件;合成對話的結果亦不足以單獨判斷模型在真人影音互動中的可靠程度。

GitHub

Categories: 開源, 香港中文大學, 阿里巴巴, 多模態模型, Video, Audio, 工具, , 語音

Page 1 of 157
1 2 3 157