
以往 Video-to-Audio(V2A)模型總要在語意對不對、聲畫同步、音色好唔好聽、空間定位準唔準四個指標之間拉鋸,往往一個 loss function 包起晒,結果邊樣都做唔好。PrismAudio 想處理嘅就係呢個「目標纏結」問題。
佢最特別嘅做法係把生成過程拆成四個專門嘅 Chain-of-Thought 模組,分別對應語意、時間、美感、空間,每個模組配對一組針對性嘅 reward function,再用 RL 聯合優化。換句話講,模型唔再係靠單一總分亂試,而係四個維度各自有指引。
訓練成本係 RL 常見痛點。PrismAudio 提出 Fast-GRPO,用 ODE 同 SDE 混合採樣,比起一般 GRPO 實現大幅減低開銷,令多維度 RL 訓練變得貼地。
團隊亦同步推出 AudioCanvas 基準,包含 300 個單事件類別同 501 個多事件樣本,比現有數據集更貼近真實多樣場景。喺 VGGSound 同 AudioCanvas 上,PrismAudio 都拎到四個感知維度嘅 SOTA。
配搭 Sora 2、Veo 3 等頂級影片生成模型時,PrismAudio 可以補上立體聲音軌,令短片多一層沉浸感。對做 AI 影片、數字人、內容創作嘅人來說,多咗一件可以直接嵌入成片流程嘅音訊工具。
重點摘要
- 首次把強化學習引入 V2A 生成流程。
- 四個 Chain-of-Thought 模組對應語意、時間、美感、空間 reward,拆解目標纏結。
- Fast-GRPO 以 ODE-SDE 混合採樣降低 RL 訓練成本。
- 自建 AudioCanvas 基準涵蓋更多真實多事件場景。
- 喺 VGGSound 同 AudioCanvas 上四個感知維度都達到 SOTA,並可配合頂級影片模型輸出立體聲。
- 語義合理性(Semantic)
- 音視同步性(Temporal synchrony)
- 音質美感(Aesthetic quality)
- 空間準確度(Spatial accuracy)
作者的關鍵點是:現有模型通常把這些目標混在一個損失函數裡,會造成「目標互相干擾」(objective entanglement),而 PrismAudio 用 分解式 Chain‑of‑Thought(CoT)推理+多維度強化學習(RL) 來避免這個問題。