
用 autoregressive 方式逐段砌長片,視窗一滑過去就會連角色同場景都一齊唔見——LayerRecall 就係針對呢個痛點。佢屬於記憶路由模組,唔係新模型,定位係加喺現有影片 DiT 上面做補強。當一段 chunk 入面出現需要回憶嘅元素(例如主角、服飾、場景)時,佢會用 current-conditioned 嘅方式去 historical candidate pool 做 cosine retrieval,搵到相關嘅 K/V state 之後再注入返去揀過嘅記憶敏感層,例如 4、9、10、12、13、15、16、17、18、26 等。其餘本地 attention 就照舊行,唔會因為補歷史資料而擾亂局部連貫性。
想理解點解要分層注入,研究發現唔同 layer 對「當下」「近期」「遠距」context 嘅依賑差好遠,所以亂餵歷史 token 反而會害咗本地一致性。配合嘅 KV cache budget 大約係 80 個 latent frames,本地 attention 32 幀,當中 8 幀做 sink、8 幀做 current chunk。訓練上仲用咗 Cross-Horizon Prediction Matching(CHPM),由一段長 context reference 喺 prediction space 監督呢個有界嘅 router,等佢喺稀缺長片數據下都學到幾時去 recall 乜嘢。
100 條多 shot prompt 評估入面,LayerRecall 喺 MemoBench 同 MovieBench 攞到最佳綜合結果,VBench-Long 維持返 backbone 水準,可見長距離回復做得好而本地連貫無受犧牲。論文仲展示咗 memory-guided self-correction,模型會主動糾正返之前嘅錯處。
重點摘要
- 屬於記憶路由模組,設計上要喺現有影片 DiT 上加掛
- 只喺 memory-sensitive 層注入歷史 K/V,其他層保持本地 attention
- 訓練用 CHPM,用長 context reference 喺 prediction space 監督 router
- MemoBench 同 MovieBench 綜合表現領先,VBench-Long 維持 backbone 水準
- 適合做多鏡頭、跨時間角色同場景一致性嘅長影片生成工作
呢類工具對做長片創作、廣告分鏡或者角色需要反覆出場嘅團隊會幾實用;研究人員亦可以睇佢點樣將「selective injection」呢個取捨由啟發式變成可學習路由。