
Qwen-Video-Edit 是一個 instruction-based video editing 項目,核心做法是把 Qwen-Image-Edit 直接搬去處理影片 latent,再用兩個可訓練 projection 接上 Wan 2.1 的 video-VAE。這樣做的價值很清楚:不用再依賴 video-pretrained transformer,也能按文字指令改影片內容。
安裝和測試路線已經整理得相當明確。train.py 走單機多 GPU 訓練,infer.py 負責長影片逐段編輯與 Wan 2.2 denoising-enhancement,dataset.py 則讀取 Ditto 格式的 source、edited、instruction 配對。
和一般影片編輯方法相比,差異在於它不是從頭學影片理解,而是借用影像編輯模型的先驗,再用 warm-started projections 與 grid positional encoding 去補上時間維度。這代表訓練成本和架構複雜度較低,但限制也在於效果仍仰賴 Wan 2.1 latent 空間、Ditto-1M 資料,以及後段 enhancement。
- 支援 LoRA 或 full fine-tuning,取捨在訓練成本與自由度之間
- 長影片可以分段套用不同指令,適合剪接、局部修改、旁白對齊內容
- 輸出 checkpoint 以 trainable-weights-only
.safetensors形式提供,載入流程較直接 - 另有 zero-training demo,可先看 image-grid 與 latent-grid 編輯行為
- 模型權重已公開,方便直接做復現或二次改造