MiniMax 開源 Music 3:一次生成完整五分鐘歌曲
MiniMax Music 3 結合 8B 全域 LLM、0.6B 區域 LLM 與流匹配合成階段,可生成完整五分鐘歌曲——模型權重已上架 Hugging Face 供所有人下載。
多年來,AI 音樂生成始終撞在一道天花板上:多數工具能產出一段六十到九十秒的動聽片段,但完整長度的歌曲會逐漸崩壞——人聲走音、編曲失焦,到了第二段副歌,模型早已忘記開頭的旋律。MiniMax 於 2026 年 8 月 13 日以開源權重發布的新模型 Music 3,就是衝著這道天花板而來。只要給它一個創作概念和可選的歌詞,它能在單次生成中完成作曲、編曲、演唱與後製,產出長達五分鐘的完整歌曲——而且任何人都可以從 Hugging Face 下載權重,在自己的機器上運行。
這次發布同時在兩個層面上意義重大。技術上,它是今年最有意思的生成式音訊架構之一:以連續隱狀態合成路徑,取代早期系統的純離散 token 解碼。戰略上,它延續了一個如今眾所周知的模式:又一個來自中國實驗室的前沿創意模型以開放權重問世,而美國競爭對手仍把他們的音樂與影片生成器鎖在封閉的付費 API 之後。如果說 2026 年是開放權重模型追上封閉模型的一年,Music 3 正是媒體生成領域最清晰的證據之一。
Music 3 到底做些什麼
Music 3 是一個文字轉音樂模型,控制精細度罕見。它接受兩種輸入:
- 歌詞,支援明確的段落標籤,如
[Verse](主歌)、[Pre-Chorus](導歌)、[Chorus](副歌)、[Bridge](橋段)、[Instrumental](間奏)、[Solo](獨奏)與[Outro](尾奏)——歌曲結構由你決定,而非模型。 - 音樂描述,若需精確控制,可採用三段式結構化描述(Structured Caption):全域 metadata(曲風、BPM、調性、音階、情緒起伏、製作風格)、人聲細節(性別、音色、演唱風格、和聲、背景和聲、效果器),以及編曲(樂器配置、各段落的樂器演進、節奏律動、低音、打擊、質地與空間效果)。
輸出為 32 kHz、16-bit 立體聲 WAV——是一首完成的歌,不是需要拼接的循環片段。關鍵在於,模型能讓音樂認同(musical identity)貫穿全曲:主題、節奏、人聲特質與編曲推進從前奏延續到尾聲,而這正是短片段生成器歷來潰敗之處。
MiniMax 還配套了一個模板式的提示增強系統——包括可透過 npx skills add MiniMax-AI/MiniMax-Music3 安裝的官方 music-caption-rewriter 技能——能把一段白話描述(「一首溫暖、人聲親密的原聲流行歌」)擴寫成完整的三段式結構化描述,並使用正統音樂術語。意圖很明顯:讓業餘創作者不必學會製作人詞彙,也能行使製作人等級的控制力。
架構解析
技術設計是這次發布最精彩的部分,也解釋了長篇連貫性為何成立。Music 3 由三個部件組成:tokenizer、混合式語言模型堆疊,以及連續合成階段。
Tokenizer 採用八層殘差向量量化(RVQ),並刻意分工:第一層語義碼本含 16,384 個條目,捕捉核心音樂結構;其餘七層聲學碼本(各 1,024 條目)編碼越來越細的聲學殘差。訓練分階段進行——先最佳化語義碼本以建立穩定骨幹,再讓八層碼本共同訓練。這種分離讓長序列預測保持穩定,避免單一 token 流同時背負結構與音質資訊而超載。
Hybrid-LM 把建模問題一分為二。8B 全域 LLM(從 Qwen3-8B 初始化;MiniMax 的研究文章寫 Qwen3.5-8B,確切的基底檢查點尚待釐清)逐幀預測語義碼本,同時維持全曲脈絡——這是模型對「歌走到了哪裡、要去哪裡」的感知。隨機初始化的 0.6B 區域 LLM 則在每一幀內沿深度軸預測聲學碼本,還原細粒度的聲音細節。訓練同樣分兩階段:先做全域對齊,再對兩個模型做全參數聯合訓練。
合成堆疊是 Music 3 偏離傳統之處。它不從離散 token 直接解碼音訊——那種標準做法會在量化時丟失資訊——而是融合兩個 LLM 的連續隱狀態,送入 24 億參數的流匹配模組,再由 1.23 億參數的 Flow-VAE 解碼器(改編自 MiniMax 的語音技術堆疊,並針對音樂的動態範圍重新訓練)產生最終波形。完整路徑為:融合 LLM 特徵 → 流匹配 → VAE 潛變數 → Flow-VAE 解碼器 → 32 kHz 立體聲。連續表徵能承載比離散 token 更多的聲學資訊,效益恰好落在先前模型失敗的地方:人聲咬字、樂器質地,以及以分鐘而非秒計的時間連續性。
值得一提的是,離散 tokenizer 僅在訓練時使用——推論時的波形合成完全運作在融合隱狀態之上。
自己動手跑
官方文件提供三條路徑,從業餘玩家到正式部署皆可涵蓋:
- SGLang-Omni 是參考服務堆疊(
sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3),暴露共用的語音 API。GitHub 儲存庫指定雙 GPU 配置:GPU 0 負責 Qwen3 與 RVQ 自回歸生成,GPU 1 負責流匹配與 VAE 解碼。生成時的max_new_tokens以每秒 25 個音訊幀計算,模型輸出結束 token 時提前收尾。 - Diffusers 提供模組化管線,全精度下可塞進 24 GB VRAM,自動 CPU 卸載後約 22 GB,啟用葉級群組卸載最低可壓到 8 GB——意味著一張消費級顯示卡就能跑一個前沿音樂模型。
- ComfyUI 在發布當天就推出了原生文字轉音樂模板,附帶 Comfy-Org 重新打包的 FP16/INT8 權重,這也是模型在发布後數小時內就觸及開源創作社群的原因。
授權條款值得留意。MiniMax-Music3 社群授權允許商業使用,但要求在產品介面中顯著標示「MiniMax-Music3」,且若組織從相關產品獲得的年度總收入超過** 2,000 萬美元**,就必須另行取得商業授權。它是開放的,但不是 OSI 意義上的開源——精神上更接近 Meta 的 Llama 社群授權,而非 Apache 2.0。
為什麼重要
競爭格局讓這次發布更有看頭。西方的 AI 音樂工具——Suno、Udio 及其同類——仍是封閉的訂閱制產品,他們與唱片公司的授權訴訟還在法院裡排隊。值得注意的是,Suno 將從 9 月 3 日起把 Pro 方案的下載上限設為每月 20 首,這讓一個真正有競爭力的開放權重替代品在此刻出現,時機好得出奇。澳洲唱片業協會 ARIA 本週也採取行動,將全 AI 生成音樂排除於排行榜之外——提醒我們在技術變得更加強大、更加易得的同一時刻,制度性的反制力量也在升溫。
Music 3 也契合 MiniMax 自身的發展軌跡。整個 2026 年,這家公司以驚人的節奏發布開放媒體模型——7 月的 H3 影片模型、8 月的 Music 3——打造出一套權重本身就是行銷的全端創意產品線。對於有隱私限制或高用量需求的工作室、遊戲開發者與獨立創作者來說,這個等級的自託管音樂生成改變了配樂、原聲帶與廣告歌曲的經濟學。8 GB 的卸載下限,讓一台電競主機就夠用。
懸而未決的問題是資料來源與訓練資料。與所有生成式音樂模型一樣,模型究竟從什麼資料中學習——以及版權方是否會像追討封閉服務那樣追討開放權重——仍有待解決。但作為一件工程作品,Music 3 標記了一個時刻:開放權重的音樂生成不再是展示品,而成為了生產力工具。五分鐘、一次生成、你的歌詞、你的結構——而唱歌的那個模型,就跑在你自己的硬體上。
Sources
- [1] https://www.minimax.io/blog/minimax-music-3-0-next-generation-open-weights-production-ready-versatile-music-model
- [2] https://huggingface.co/MiniMaxAI/MiniMax-Music3
- [3] https://github.com/minimax-ai/minimax-music3
- [4] https://blog.comfy.org/p/minimax-music-3-state-of-the-art
- [5] https://www.marktechpost.com/2026/08/17/minimax-releases-minimax-music3/