GRNEdit 用少量參數做通用影片編輯

想改影片風格、背景或局部內容,又唔想整段重生成,GRNEdit 提出一條較慳參數的路線。它把可編輯範圍先用 binary evidence 拆清,再逐步細修畫面。

Xidian University

一段影片要改風格、換背景、刪走局部人物,最難通常唔係生成新畫面,而係改得準之餘,原本動作、主體身份同未編輯部分都要保持穩定。GRNEdit 屬於影片編輯框架,處理的正是這類通用影片編輯問題,而且走的是 Generative Refinement Networks 配合 binary evidence 的路線,不是靠大幅加參數去硬推效果。

GRNEdit 先用 binary evidence 分開哪些區域應該被改、哪些內容要盡量維持,之後再沿住 refinement 過程逐步生成目標語意、結構同細節。這樣做的取捨,在於它把編輯能力壓縮到相當輕量的增量上;公開資訊表示,相對 GRN backbone 只增加少於 3% 額外參數,但聲稱可跟領先的影片編輯模型競爭。

從示例看,GRNEdit覆蓋 global style、背景替換、local removal、加入新元素,以及移除字幕等多種任務,重點不是單一特效,而是同一套框架處理不同編輯指令。較適合研究影片生成、內容製作流程,或者想把多種編輯模式收斂到同一模型系統的團隊參考;不過目前公開內容仍以推理程式碼和預印本為主,training code 與 model weights 都未提供,部署與重現門檻仍然存在。

  • 以 binary evidence 先界定可編輯範圍,再逐步 refinement
  • 相對 GRN backbone,只需少於 3% 額外參數
  • 同一框架支援風格化、換背景、移除、添加與複合編輯
  • 公開資料主打推理與結果展示,完整訓練與權重尚未釋出

模型權重暫未開放,但有足夠資訊足夠理解它的方法定位。對關注影片編輯模型的人來說,GRNEdit最有意思的地方,是它把「改動範圍判定」放到生成前段處理,嘗試用更小的參數成本換取更穩定的時序保留與更通用的編輯能力。

項目主頁 · GitHub

Categories: 開源, 模型, 視覺模型, 視頻模型, 模型訓練

MiniMax-H3-Text-Embeddings ?

這不是傳統 NLP 或 RAG 領域中所指的「文本向量嵌入(Text Embedding)」模型。

Og image

這不是傳統 NLP 或 RAG 領域中所指的「文本向量嵌入(Text Embedding)」模型。MiniMax-H3-Text-Embeddings 實際上是 DiffSynth-Studio 團隊為 MiniMax-H3 影片生成大模型所設計的「視覺特效/風格控制向量(Diffusion Templates / Textual Inversion)」。

MiniMax-H3 是一個高達 33B 參數的大型多模態生成模型,若要透過訓練 LoRA 來控制風格或特效,顯存與算力成本非常高。DiffSynth-Studio 團隊採用了類似 Textual Inversion(文字翻轉/概念嵌入) 的做法:

  1. 極輕量替代方案:將特定特效(如火爆、風暴、環繞鏡頭等)預先訓練或編碼成特徵 Tensor。
  2. 直接注入文字特徵層:這些檔案體積非常小,能在推理階段直接替換或疊加到 MiniMax-H3 的 Text Encoder 輸出上。
  3. 模組化與組合:使用者可以像掛載外掛一樣,組合多個特效 Embedding 來控制生成的影片視覺效果。

3. 總結建議

  • 如果你是在找 RAG / 知識庫 / 搜尋用的文本嵌入模型:請忽略此模型,這不是向量檢索工具。
  • 如果你是在使用 DiffSynth-Studio 進行 MiniMax-H3 影片生成:這是用來快速套用影片特效、節省顯存並替代重型 LoRA 的控制模組。

項目主頁

Categories: 開源, RAG, Embedding, 視頻模型, MiniMax

StateFlow 把預視化變成可反覆編修 3D 世界

想像先搭好一個可重用的3D世界,再慢慢改鏡頭、物件同事件。StateFlow想處理的,正是生成式預視化最常見的連貫性問題。

StateFlow teaser

影像預視化最麻煩的地方,往往不是生成一條片,而是改完場景、換完鏡頭之後,前後內容仲要講得通。StateFlow屬於面向 previsualization 的 3D world-state modeling 框架,它把場景視為可持續保存的 3D world states,令同一個世界可以反覆建構、演化、再取用,而唔使每次修改都由頭生成。

呢個做法先處理內容一致性,再處理畫面輸出。StateFlow用 object-centric structured 3D state 去描述世界,每個物件都帶有 geometry、spatial pose 同 semantic attributes,將底層世界內容同最終 render observations 分開,於是場景結構、物件關係、動態事件同 cinematic camera direction 可以分步調整。

整個流程分成三段。State Construction 針對 2D 內容提升到 3D 世界時容易出現的歧義,用 prior-guided、conflict-aware dual-view initialization 建立較一致的起始世界;State Evolution 把使用者修改轉成 structured state transitions,保留 world memory,避免每次編修都重建整個場景;State Access 則配合 render-feedback reflection,把鏡頭意圖修正成視覺上可行的 cinematic trajectories。

  • 把一次性影片生成,改成可編修、可重用的 persistent world
  • 同一套世界狀態可支援 video production 同 3D game prototyping
  • 重點不只是生成畫面,而係保住場景結構、物件關係同時間上的連貫性
  • 鏡頭控制加入 render-feedback reflection,提升拍攝路徑的可行性

使用場景相當清楚:要先做分鏡、試鏡頭、試事件節奏的創作團隊,或者想由 3D scene 快速走到 playable prototype 的遊戲項目,都會較受用。現有內容著重方法展示、應用示例同與 baselines 的 3D scene generation 對比,但未見完整論文與量化細節公開,所以目前較適合視為一個值得留意的工作流方向,而唔係已完全定型的產品規格。

項目主頁

Categories: 北京大學, 視頻模型, Video, World-Action Model, 框架, 3D

Ex-Omni-2D 直接對話生成同步發聲與表情的數字人影片

Ex-Omni-2D 讓對話模型同時輸出文字、個人化語音與表情同步的頭像影片,以多碼本語音單元串接語音與畫面,並提供 Teacher 與 Prefix-Streaming Student 兩種部署模式。

Ex-Omni-2D framework

想讓 AI 數字人不只是「會打字」,而是真的「邊說邊演」?香港中文大學(深圳)與 LIGHTSPEED 合作開源的 Ex-Omni-2D,正是針對這個目標設計。它是一個開源對話框架,接受多模態查詢、參考圖像與參考音訊後,先由語言模型輸出一份結構化的 Visual Thought Plan(VTP),再依此生成文字回應、個人化語音,並產出嘴形與動作同步的頭像影片。

傳統做法通常把語音合成與人物影片視為兩條獨立管線,需要額外對齊文字、聲音與嘴形,容易出現時間錯位。Ex-Omni-2D 的差異在於採用 16 個 codebook 構成的原生多碼本語音單元,作為語音與影片共享的聲學與時序介面:同一組語音單元既驅動 TTS,也作為影片生成器的緊緻條件,從而降低跨模態錯位的風險。

影片生成路徑提供兩種互補模式:Full-sequence Teacher 採雙向注意力,追求最高畫質;Prefix-Streaming Student 則是蒸餾而來的少步數 block-causal 版本,支援 2、4、8 步串流推論,方便在工作站、GPU 伺服器甚至 Hugging Face Spaces 上做漸進式部署。

這個項目的重點:

  • 對話原生影片:視覺行為直接從多模態對話上下文規劃,不必再手動撰寫影片提示詞。
  • 結構化 VTP:明確定義首幀、場景、情緒、動作風格與動作細節,方便後續控制與除錯。
  • 共享語音介面:16 個 codebook 同步驅動語音合成與人物動作。
  • 品質與效率取捨:Teacher 負責最高畫質,Student 支援 2/4/8 步串流。
  • 彈性部署:同一套代碼可在個人工作站、GPU 伺服器或 HF Spaces 執行,並提供線上 Demo 試玩。

在串流場景中,作者指出 Prefix Streaming 從第 9 至 16 chunk 的一致性明顯較強,將 last-to-first consistency error 降低 21.4%,這對需要長時間維持角色身份一致的應用相當關鍵。論文亦提到 Prefix Streaming 能減少長序列累積形變,同時保留參考圖像的人物外觀。

較適合的對象包括需要快速打造可對話 AI 助手、虛擬主播、客服分身或教學數字人的團隊;對研究多模態對話、語音驅動動畫的人來說,這份開源代碼、模型權重與 arXiv 論文也是一個方便的起點。

項目主頁 · GitHub · 模型

Categories: 開源, 香港中文大學, 騰訊, 文字轉語音, AI productions, 數字人, 多模態模型, 視頻模型, Qwen, 香港, 語音

LTX-2.5 原生多鏡頭、4K HDR,一次看懂升級重點

LTX 最新開源基礎模型 LTX-2.5,主打原生多鏡頭銜接、4K HDR,並降低重試與算力成本,繼續走開放權重路線。

LTX-2.3 Examples Video

如果你是用開源模型做影片生成的開發者,LTX-2.5 這次更新解決的卡位頗明確:人物、環境、光線與聲音在多鏡頭之間斷裂的問題。它把多鏡頭生成變成原生能力,並加入自動時長預測,模型會按指令動作自行決定片段長度,省下人手剪接的麻煩。

對比起多數只能透過後製拼接的同類方案,LTX-2.5 在 prompt 跟隨度上也有明顯進步,能夠處理更複雜的創作指示,而且只需要更短的提示詞就能產生穩定結果。配合新的擴散影片解碼器,動態假影更少,畫面在高解析度與 HDR 下仍能逐格保持質感。

本地部署與微調是這次版本延續的核心承諾:開源權重可直接下載,預訓練基礎模型可在自家做 LoRA 微調,產出與後製則支援原生 RAW workflow,貼近專業調色與剪接流程。

從官方比較表來看,目前維持開放權重且不受地區限制的開源視頻生成選擇仍然有限,這也是 LTX-2.5 在定位上最值得留意的差異化。不過實際表現仍需視本地硬件配置與工作流整合程度而定。

重點摘要

  • 原生多鏡頭生成:人物、環境、光線與聲音在不同鏡頭間保持一致。
  • 自動時長預測:依據動作需要自動決定片段長度。
  • 4K HDR 與原生 RAW:支援專業調色與後製 pipeline。
  • Gemma 4 12B 文字編碼器:搭配自研提示詞增強器,提升 prompt 跟隨度。
  • 開源權重可下載:可在本地硬件運行,並支援 LoRA 微調。

項目主頁

Categories: 開源, AI productions, 數字人, 多模態模型, 視頻模型, 模型訓練, Video, Image, LTX

MiniMax H3 人像寫實 LoRA,強化近鏡表情與電影感

基於 MiniMax H3 的人像寫實 LoRA,重點唔係加花巧風格,而係令面部、皮膚同鏡頭動態更自然可信。

Og image

近鏡人像、多人同框對話、手部動作呢類鏡頭,最容易暴露影片生成模型嘅細節破綻。呢個 Hugging Face 項目明確係基於 MiniMaxAI/MiniMax-H3 嘅 LoRA adapter,針對真人角色畫面再微調,重點放喺面部穩定度、皮膚質感、微表情同帶少少手持感嘅電影式運鏡,亦保留 MiniMax H3 原生同步音訊能力。

頁面提供嘅核心資訊相當集中:它屬於 text-to-video,授權採用 minimax-h3-community-license,主要檔案是 h3-realism-people-t2v.safetensors。使用方法唔複雜,要先喺 prompt 開頭加入 trigger word r34l1sm,再透過 fal 的 MiniMax H3 LoRA 端點掛載,範例 scale 係 1.0;想保留多啲 base model 原本味道,可以降到 0.6 至 0.8。

同類 LoRA 最大分別,往往唔係畫面變得幾誇張,而係同一個 prompt、同一個 seed 之下,能否穩定改善人物可信度。呢個項目用 before/after 方式展示 19 組對照,強調唯一變數係 adapter 本身,連 trigger word 兩邊都有加,目的係證明提升主要來自微調權重,而唔係提示詞技巧。頁面亦講明它係前作 MiniMax-H3-Realism-LoRA 嘅後繼版本,並且改用更大、更加聚焦人物題材嘅資料集重新訓練。

  • 基礎模型:MiniMaxAI/MiniMax-H3,關係標記為 adapter
  • 主要用途:強化寫實人物、近鏡面部、群眾、手部與紀錄片感鏡頭
  • 主要檔案:h3-realism-people-t2v.safetensors
  • 推薦控制:trigger word r34l1sm,LoRA scale 以 1.0 為預設,可降至 0.6-0.8

要留意,項目本質上係影片生成用嘅 LoRA,唔係可直接本地量化部署嘅通用文字模型。換句話講,它嘅價值更接近一個針對 MiniMax H3 補強人物鏡頭表現嘅專用適配器,而唔係完整獨立模型;使用場景亦明顯偏向 fal 平台上的 text-to-video 工作流。

模型

Categories: 開源, AI productions, 視頻模型, Video, Audio, MiniMax

MiniMax H3 Turbo:4 步加速的影音生成 LoRA

MiniMax H3 的 ComfyUI 加速 LoRA,把 10 秒影片生成壓到固定 4 步。它適合要在速度、畫質和可控性之間取平衡的 T2V 與 I2V 工作流。

Og image

MiniMax H3 Turbo 走的是 ComfyUI 用途的加速路線,核心價值在於把 MiniMax H3 的文本生成影片(Text-to-Video, T2V)和圖像轉影片(Image-to-Video, I2V)流程固定到 4-step Euler 推理。它不是獨立模型,而是要配合 Comfy-Org/MiniMax-H3 的 BF16 base model 使用;頁面未提供更完整的 base model 參數規模或訓練細節,所以不能再往下猜。

這種設計的取捨很直接:步數少,生成時間通常更短,但對動作細節和穩定性的容錯也會更窄。頁面列出的比較都在同一個 BF16 base model、同一輸入與 10 秒、約 0.9MP 解析度條件下做,LoRA strength 固定 1.0;不同場景下,時間大概落在 174 到 190 秒之間,速度提升存在,但不是壓倒性。

重點摘要:
– 支援 T2V 與 I2V,I2V 走第一幀路徑,亦可用最後一幀收尾
– 固定 4-step Euler,重點是縮短推理流程而非擴大模型能力
– 需要配對 Comfy-Org/MiniMax-H3 的 BF16 base model
– 頁面未列出 GGUF、mmproj、上下文長度或量化檔案資訊
– 與 lightx2v LoRA 的比較屬同級加速方案,差距主要體現在時間與輸出取向

從檔案描述看,這個項目是 LoRA,不是完整 diffusion checkpoint,所以它的定位比較像「推理策略補丁」而不是全新模型。頁面也沒有提供 llama.cpp、Ollama 或 LM Studio 的支援資訊,顯示它主要面向 ComfyUI 工作流,而不是通用本地推理框架。

檔案命名上,頁面強調這是 v2 類型的更新版本脈絡;因此可確認的只有它圍繞 H3 的 joint audio-video diffusion path,並以固定 4 步作為加速契約。若要和原始 base model 比,差別不在功能範圍,而在於把生成速度和步數控制收緊,換取更快的工作流回饋。

模型

Categories: 開源, ComfyUI, 數字人, 視覺模型, 視頻模型, Video, Image, Audio, MiniMax

ComfyUI-Spectrum-MiniMax-H3:為 H3 加速 33%

將 1056x608 影片生成由 685 秒縮短至 464 秒,避開昂貴的 transformer 重算。它屬近似加速,但影片細節可能走樣。

Repository image for xmarre/ComfyUI-Spectrum-MiniMax-H3

每次跑 MiniMax H3 都要付出完整 transformer 計算成本,對要反覆試 prompt、鏡頭動作同參考音訊的人來說,等待本身就是工作流瓶頸。xmarre/ComfyUI-Spectrum-MiniMax-H3 針對的正是這一步:它屬於 ComfyUI 自訂節點工具,會在部分 solver steps 直接預測 post-transformer hidden features,減少原生 MiniMax H3 audio-video model 的重計算次數。

實測生成 1056×608 影片由 685 秒縮短至 464 秒。加入這 Node 後可惜仍未能解決「廣東話」問題!

它不是把整個模型 shortcut 掉,而是用 Chebyshev ridge model 去擬合已經算出的 hidden features,再對未來步數作 spectral forecasting;但當前步的 output heads、video reconstruction、audio reconstruction、sigma mapping 同回傳結構仍然照常執行。這個取捨很務實,因為它換到的是抽樣成本下降,不是完全無損加速,所以 README 已經講明輸出不會與原生 MiniMax H3 bit-identical。

作者後來把預設路徑改成 offline_smoothing_replay,核心原因不是追求更高畫質,而是先救回音訊品質。早期單次流程會令語音清晰度、自然度同穩定性下降,甚至出現 doubled syllables 同 stuttering;現時預設把 audio_blend_weight 維持在 0,並以第二次無 transformer 的 replay 處理 video blend,目的就是切斷後段 video-to-audio feedback 對聲音的干擾。不過,畫面軌跡仍可能改變,動作、視線、時間點,甚至眼睛、手指、四肢細節都有機會走樣。

安裝十分簡單,適合願意做 exact-seed A/B 比對的創作者、工作流調校者,或者已經在 ComfyUI 內使用 MiniMax H3 的團隊。README 也提到舊版 workflow 可能要手動開啟 offline_smoothing_replay,而且 broader checkpoints、prompts、samplers 同 reference inputs 仍未完成足夠驗證,現階段更像是一個有方向、有明確修正策略,但仍需按素材類型逐步確認的加速方案。

  • 以 spectral forecasting 預測部分 future solver steps,重點是減少 MiniMax H3 最昂貴的 transformer evaluations。
  • 保留當前步的原生輸出頭與音畫重建流程,因此屬於近似加速,不是無損複製原生結果。
  • 預設改用 offline_smoothing_replay,主要是修正早期版本對語音自然度與穩定性的破壞。
  • 音訊路線暫時較保守,但視覺結果仍可能出現 motion、pose 與細節結構偏移。
  • 較適合已在 ComfyUI 工作流內做反覆測試、願意接受 A/B 驗證成本的使用情境。

GitHub

Categories: 開源, ComfyUI, 視頻模型, Video, Audio, MiniMax

ComfyUI-MiniMaxH3-Easy:幫 H3 補回可用性

把 MiniMax H3 放進 ComfyUI 後,最麻煩的接線、引用同提示編排,被整理成較順手的一套介面。

Mixed media input

做影片生成時,最阻手往往唔係模型能力,而係節點圖愈接愈亂、參考素材愈加愈難管理。ComfyUI-MiniMaxH3-Easy 屬於 ComfyUI 自訂節點工具,集中處理 MiniMax H3 的 text-to-video、image-to-video 同 reference-to-video 工作流,將原本分散嘅媒體接線、參考標記同提示編輯收埋到同一個操作面。

呢個項目最實際嘅改動,在於保留 ComfyUI 彈性之餘,減少你每次都要手動整理素材順序。主節點用一個 Media 輸入口同時接收圖片、影片同音訊,仲會分開追蹤各自次序;一張圖會走 image-to-video,兩張圖就可用作 first/last-frame generation。做 reference-to-video 時,提示編輯器支援 @ 揀選已連接素材,執行時再自動轉成 MiniMax 建議嘅 <Picture N><Video N><Audio N> 格式,唔使自己逐個標籤維護。

  • 將多種媒體收進單一 Media 入口,節點圖會乾淨得多
  • @ 參考編輯器有預覽,較適合需要反覆改 prompt 嘅影片生成流程
  • # 對話區塊可直接寫成可編輯 block,送出時自動轉成 <d>...</d>
  • 可接 model-only LoRASage Attention patch,亦可直接連到模型相關節點

同類做法通常要求使用者自己記住引用格式、接線順序同素材對應,ComfyUI-MiniMaxH3-Easy 選擇用較重介面包裝,換來較低出錯率同較高可讀性。代價亦明顯:它改善嘅係 MiniMax H3 在 ComfyUI 入面嘅操作層,不是另起一個新模型,也未見提供生成品質、速度或資源佔用測試數字,因此價值主要落在工作流整理,而唔係模型性能突破。

較受惠嘅會係已經用開 ComfyUI、但又嫌 MiniMax H3 節點圖太碎太亂嘅創作者、影片實驗團隊同需要反覆比對參考素材嘅人。部署方式亦唔複雜,理解上可以當成安裝到 ComfyUI 內嘅一組工作流節點:接好模型或 LoRA、把圖片或影片餵入 Media、再用內建編輯器整理引用同對話內容,就可以直接進入生成流程。

GitHub

Categories: 開源, ComfyUI, 視頻模型, Video, Image, Audio, MiniMax

MiniMax-H3 Turbo LoRA 移植 ComfyUI,4 步生成同步聲畫

呢個版本唔係重新訓練主模型,而係把 MiniMax-H3 Turbo LoRA 轉成 ComfyUI 可直接載入的格式。重點在於 4-step 加速生成,同時保留聲畫同步能力。

Og image

想用更少步數生成影片同音訊,呢個頁面最值得留意的地方,是它明確基於 Comfy-Org/MiniMax-H3,而且屬於 adapter 形式的 LoRA,不是完整基礎模型。它針對 ComfyUI 使用的 pruned/curve-form MiniMax-H3 checkpoint 做兼容轉換,目的是讓原本由 larryvrh 發佈的 MiniMax-H3 Turbo LoRA — 4-step audio-video generation preview,可以透過 ComfyUI 內建的 MiniMax-H3 LoRA 載入流程使用。

技術上,核心價值在於把原始 Turbo LoRA 的 four-step distillationdual video/audio sampling 帶入 ComfyUI 工作流。4-step 代表生成步數大幅壓縮,推理延遲有機會下降;頁面同時指出 non-EMA 權重較銳利、較能保持快速動作,EMA 權重則較平滑,但因為當時 EMA 未完全成熟,畫面會較柔。呢種取捨直接影響你想要的觀感:動態表現優先,可先看 non-EMA;畫面過渡想更順,EMA 版本更值得比較。

檔案方面,頁面列出 4 個 .safetensors LoRA 權重,包括初始兼容轉換版,以及兩個 further-trained checkpoint-500 變體:minimax_h3_turbo_4step_pruned_comfyui.safetensorsminimax_h3_turbo_4step_ema_pruned_comfyui.safetensorsminimax_h3_turbo_4step_ckpt500_pruned_comfyui.safetensors,以及對應的 EMA checkpoint-500 版本。

  • 基礎模型已明示為 Comfy-Org/MiniMax-H3,屬於 LoRA adapter 兼容轉換
  • 主要能力是 text-to-video,並帶有 text-to-audioaudio-videosynchronized-audio 標籤
  • 重點方法來自原作者的 four-step distillation,目標是加速推理
  • 頁面提供 ComfyUI workflow 範例下載,定位很明確:直接服務 ComfyUI 用戶

這個 Hugging Face 頁面是第三方整理的 ComfyUI 相容版本,價值在於把原始 MiniMax-H3 Turbo LoRA 接入 ComfyUI 生態,方便直接測試 4-step 聲畫同步生成與 checkpoint-500 變體之間的差異。

項目主頁

Categories: 開源, ComfyUI, 視頻模型, Video, Audio, MiniMax

Page 3 of 16
1 2 3 4 5 16