
YingMusic-Singer 是一個 Zero-shot Singing Voice Synthesis (SVS) 與編輯框架,目標是解決歌聲合成裡最麻煩的對齊和標註成本。它把「用參考旋律生成新歌詞」和「直接改寫既有歌聲」放在同一套流程內,對要做快速原型、音樂內容改稿、或批量製作不同版本歌聲的團隊特別有吸引力。
它的核心做法是 Annotation-free Melody Guidance,不用再依賴昂貴的 phoneme-level alignment,亦不需要人工補 MIDI 標註。使用時可以餵入參考音訊,讓系統自動抽旋律;亦可以直接輸入 MIDI,令旋律來源更彈性。令它比傳統要逐句對齊的做法輕身很多,但也意味著成品質素會更依賴參考旋律本身是否清晰。
- 支援 zero-shot 合成與編輯,兩種流程放在同一個框架內
- 可由參考音訊自動抽旋律,亦可直接用 MIDI
- 不需要針對目標聲線再做微調
- beta 版已停用,現時要改用 beta 分支
技術上,它採用 Diffusion Transformer (DiT) 式生成模型,再配合預訓練旋律抽取模組,由參考音訊導出 MIDI 資訊,然後再做受控生成。加入 Flow-GRPO reinforcement learning 去改善發音清晰度、旋律準確度和音樂性,但現有公開資料未見完整量化表格。