MiniMax-Music3 開放權重音樂模型

你可以把它理解成一個把歌詞、風格與編曲意圖直接變成完整歌曲的模型,重點不只係出聲,仲要保住前後段落的連貫感。它適合做 demo、原型同內容製作,代價是控制得愈細,提示詞就要寫得愈具體。

MiniMax

MiniMax Music 3 是一個音樂生成模型,重點在於把「可唱、可編、可聽完整首歌」串成一體,直接產出最長五分鐘的完整歌曲。對內容創作團隊來講,它最有價值嘅位唔係單句旋律,而係可以連住 intro、verse、chorus 到 outro,維持人聲、節奏同編曲走向一致。

輸入通常分兩層:歌詞負責唱咩,同時可以加上 [Intro]、[Verse]、[Chorus] 呢類段落標記;另一層音樂描述就交代風格、情緒推進、人聲質感、樂器配置同空間感。官方亦建議用 Structured Caption,將 Global Metadata、Vocal Details、Arrangement 分開寫,方便模型對長段落做更穩定嘅控制。

它用 8B Global LLM 處理長距離結構,再配 0.6B Local LLM 補足逐幀聲學細節,並結合 Flow Matching 同 Flow-VAE 做連續 hidden-state 合成。這種分工換來較完整的長歌一致性,但亦意味住提示詞要寫得有層次,否則編排同人聲變化未必會完全跟足預期。

  • 最適合做完整歌曲草稿、廣告歌、遊戲音樂同內容原型
  • 由歌詞加音樂描述共同控制,細節比一般單一句 prompt 更可預期
  • 支援 32 kHz、16-bit stereo WAV 輸出,方便接入後期流程
  • 強項係長段落連貫與結構完整,唔係只生成短片段
  • 目前較適合重視創作速度與可控性嘅團隊,而唔係追求即用即完美成品嘅場景

項目主頁 · GitHub · 模型

Categories: 開源, 模型, 音樂, MiniMax