YingMusic-Singer 改歌詞也不用重唱

你可以把它理解成一個把歌詞、旋律和歌聲編輯放在同一條流程的框架,適合處理需要快速改詞、改旋律的歌聲生成工作。免手工對齊與零樣本能力,但 beta 版已停用,現時要改用 beta 分支。

pipeline

YingMusic-Singer 是一個 Zero-shot Singing Voice Synthesis (SVS) 與編輯框架,目標是解決歌聲合成裡最麻煩的對齊和標註成本。它把「用參考旋律生成新歌詞」和「直接改寫既有歌聲」放在同一套流程內,對要做快速原型、音樂內容改稿、或批量製作不同版本歌聲的團隊特別有吸引力。

它的核心做法是 Annotation-free Melody Guidance,不用再依賴昂貴的 phoneme-level alignment,亦不需要人工補 MIDI 標註。使用時可以餵入參考音訊,讓系統自動抽旋律;亦可以直接輸入 MIDI,令旋律來源更彈性。令它比傳統要逐句對齊的做法輕身很多,但也意味著成品質素會更依賴參考旋律本身是否清晰。

  • 支援 zero-shot 合成與編輯,兩種流程放在同一個框架內
  • 可由參考音訊自動抽旋律,亦可直接用 MIDI
  • 不需要針對目標聲線再做微調
  • beta 版已停用,現時要改用 beta 分支

技術上,它採用 Diffusion Transformer (DiT) 式生成模型,再配合預訓練旋律抽取模組,由參考音訊導出 MIDI 資訊,然後再做受控生成。加入 Flow-GRPO reinforcement learning 去改善發音清晰度、旋律準確度和音樂性,但現有公開資料未見完整量化表格。

項目主頁 · GitHub · 模型

Categories: 開源, 模型, 聲效, 語音, 音樂