ComfyUI-VoiceWorkbench:本地語音工作台:逐句修正音高與節奏

不用剪碎音檔,便可逐句調整音高、字詞時長、停頓和尾音,並比較不同錄音版本。

Voice Workbench

想修正一句旁白的語速、音高或句尾拖音時,ComfyUI-VoiceWorkbench 讓你在完整錄音上直接編輯,毋須把每個字剪開再重新拼接。這個項目屬於本地語音編輯工具,實際處理的是生成語音和錄音後期微調之間的卡位;編輯器可作為 ComfyUI 底部面板使用,也能獨立在本機運行。

聲音處理採用一次 Praat resynthesis pass,同時套用整段錄音的時長和音高變化,未修改的預覽則保留原始 WAV bytes。介面可調整 0.75 至 1.25 倍全局速度、全局音高及最多 64 個局部曲線點,亦能處理現有停頓和可靠的 voiced ending;編輯完成後可比較 Original、Edited 與不同生成 take,再回到較早版本。

  • 不用下載模型:內置例子可直接開啟和編輯,Windows 亦可調用已安裝的英文系統語音。
  • 適合本地工作流:支援 Python 3.10 或更新版本,並可接入 ComfyUI custom nodes。
  • 保留人工判斷:字詞邊界只是估算,無聲或不穩定區域不能可靠提供音高目標。
  • 有明確範圍限制:單聲道錄音約 0.15 至 60 秒,AI take 最多 200 字元;服務只綁定 loopback,並非公開共享伺服器。

可選的本地適配器把能力延伸至語音生成和表演編輯:IndexTTS2 支援參考聲線及情緒生成,AuK Base 用於整段錄音的表演編輯,Qwen3 forced aligner 則協助估算字詞邊界。這些元件不是開啟基本編輯器的必要條件,系統語音也不提供聲線複製或情感控制。

適合旁白製作、語音原型和 ComfyUI 使用者處理少量錄音,而不是多人共用的雲端配音平台。尾音延長最多 200 毫秒,目標音高及 voiced 區域亦有上下限;自動對齊不代表每個字都讀得正確,接受修改前仍要逐段聆聽。

GitHub

Categories: 開源, ComfyUI, 模型, Qwen, Audio, 工具, Python, 語音