
生成影片拉長到幾分鐘之後,角色樣貌、鏡頭方位同場景佈局愈來愈唔穩,往往不是畫質問題,而是模型早段寫入的歷史記憶愈來愈幫不到後面幀。Self Gradient Forcing(SGF)屬於訓練方法項目,核心是替自回歸影片擴散模型補回一段原本缺失的 context-gradient path,處理 long-video extrapolation 時常見的 identity drift、scene break 同 temporal instability。
作者點名現有做法多建基於 Self Forcing:模型用自己 rollout 出來的歷史作訓練,的確能減少 exposure bias,但 historical key-value cache 在後續生成裡只是 frozen rollout state,未能讓未來幀的損失回頭教早前的記憶應該怎樣寫得更有用。SGF 的做法是 bounded two-pass replay,第一輪先照推理方式無梯度 rollout,第二輪只重建抽樣步驟所需的 context-gradient,避開完整長序列反向傳播的成本,同時保住 causal memory 的可訓練性。
項目現時已放出訓練碼、推理碼同 checkpoint,底層接到 Wan2.1-T2V-1.3B 與 Wan2.1-T2V-14B,亦依賴 Causal-Forcing 的初始化權重。配置分成 framewise 同 chunkwise 兩路,預設推理可生成 963 個 latent frames,解碼後約 240 秒、16 fps,環境足夠時會用 8 GPUs,否則退回單卡串行生成;這個門檻說明它較接近研究與算力密集型內容生產流程,而不是輕量即開即用工具。
- 針對 Self Forcing 的 historical context-gradient gap,而不是單純調參延長影片
- 用 bounded two-pass replay 補監督,取捨在於訓練更複雜,但比全序列回傳梯度更可控
- 同時提供 framewise 與 chunkwise 設定,方便比較不同長片生成路線
- 依賴 Wan 基座模型與 Causal-Forcing 初始化,部署前要先備好對應權重
就已公開描述來看,SGF 的價值不在另起一套全新生成架構,而是在保留 native autoregressive training objective 的前提下,修正自生成記憶無法被未來損失有效監督的缺口。對研究 long-horizon video generation、需要單一 prompt 與 seed 維持數分鐘敘事一致性的團隊,這個項目有相當清晰的參考價值。