← All posts / Models

開源音樂模型站上前緣:m-a-p 的 YuE2 在 SongBench 擊敗 Suno v5,24GB 顯卡就能跑

開源社群 m-a-p 發布 YuE2-3B 開放權重音樂模型:WildSongBench 綜合分超越所有閉源系統,支援可編輯 ABC 樂譜、Agent 式改歌與翻唱,RTX 4090 上 71 秒生成一首歌。

開源音樂模型站上前緣:m-a-p 的 YuE2 在 SongBench 擊敗 Suno v5,24GB 顯卡就能跑

今年以來,AI 音樂生成的故事幾乎是閉源平台的故事:Suno、Udio、Mureka 與 MiniMax 的 Music 系列佔據前緣,開放權重的挑戰者則始終差一段明顯的距離。這個差距現在補上了。推出初代 YuE 模型的開源社群實驗室 m-a-p(Multimodal Art Projection)發布了 YuE2-3B——一個不只逼近專有領先者、而是在 WildSongBench 綜合基準上拿下全場最高 SongBench 平均分的開放音樂模型,對象包括 Suno v5 在內的所有已評測系統,無論開源或閉源。

數據到底怎麼看

這裡必須先講求精確,因為聳動的標題容易讓人過度解讀。在 192 個 WildSongBench 提示詞上,採 best-of-8(八選一)策略的 YuE2 拿到 6.9632 的 SongBench 平均分,小勝 Suno v5 的 6.8721 與崑崙萬維 Mureka 9 的 6.9377。預設的雙候選配置得分 6.7316——低於 Suno v5,但明顯領先其他所有開源模型,包括 MiniMax Music 3(6.2830)、LeVo 2(6.3247)與 ACE-Step 1.5(6.0118)。

SongBench 平均分聚合了七個品質維度,YuE2 的音樂性分數(best-of-8 為 6.27)是兩張表中最高的。但逐項拆開看,開源模型仍有讓步之處:Suno v5 在 MuLan 風格文字對齊(0.5428 對 0.5051)、AllMusicCaps 描述遵循(0.4353 對 0.3980)與音素錯誤率(8.10% 對 9.79%)上保持領先——也就是說,Suno 仍更忠實地照你的提示詞走、咬字也更清晰。YuE2 贏在音樂性與整體歌曲品質;專有領先者贏在指令遵循的精確度。此外,用 best-of-8 對決單候選輸出的商業系統本來就不是完全對等的比較,團隊對不同評測協議的差異也相當坦白。

第二張基準表其實更令人印象深刻,因為差距不小。在 SHS100K 零樣本翻唱生成——把既有歌曲用新風格重演、同時保留歌曲身分——的項目上,使用完整樂譜的 YuE2 拿到 0.647 的 CLEWS mAP 與 71.3% 的 Hit@1,對比 SongEcho 的 0.419 與 48.4%、ACE-Step 1.5 的近乎於零。兩張表中沒有其他系統能把翻唱做得這麼好。

架構豪賭:用可編輯樂譜取代擲骰子

YuE2 最與眾不同的設計決策在基準表上看不到,但一用就明白:生成過程是透過一份可編輯的 ABC 記譜符號樂譜來規劃的。單一 AR–NAR Mixture-of-Transformers 主幹先寫出樂譜與語意 token,再以流匹配(flow matching)產生聲學潛表示,最後由 VAE 解碼成 48 kHz 立體聲。三種規劃模式在控制與自主之間取捨:cot="full" 同時規劃旋律與和弦、cot="melody" 只規劃旋律(翻唱建議用這個)、cot="off" 則像傳統歌詞轉歌曲模型一樣直接生成。

這把音樂生成從吃角子老虎變成了編輯器。你可以匯出樂譜計畫,用手工修改 ABC 裡的某一组和弦進行或旋律樂句,再帶著修改後的版本重新生成——可以是旋律完全保留的嚴格重新和聲,也可以是連歌詞與風格一起改的更大膽改編。因為樂譜就是純文字,它也是 agent 的天然介面,m-a-p 更進一步做了Agent 式編輯工作流:把樂譜、提示詞與歌詞連同你的回饋交給 agent(「橋段重新和聲、加一段薩克斯風獨奏、第二段主歌換成英文」),agent 修改樂譜、風格與歌詞後,再由 YuE2 渲染下一個版本。專案頁示範了一首《The Last Train》歷經 9 個編輯步驟、產出 14 個版本的完整過程,從華語流行遷移到帶現代和聲的英文爵士——每一步的對話、樂譜與音檔全部可以檢視。

翻唱管線同樣務實:用 m-a-p 同步發布的 SheetSage2 轉寫原始錄音取得旋律 ABC,蒐集或轉錄歌詞,選定目標風格後生成。官方示範從爵士放克版的《友誼萬歲》(Auld Lang Syne)到重金屬版的〈Jingle Bells〉都有。

工程面的實際體驗

對一個開源音樂模型來說,YuE2 的本地體驗範圍拿捏得罕見地好。YuE2-3B 需要一張支援 BF16 的 24GB NVIDIA GPU 與 24GB 主記憶體,無需量化;一首 3.6 分鐘的歌在 RTX 4090 上 71 秒完成渲染,峰值 VRAM 約 11.2 GiB——也就是說真正的門檻其實是記憶體餘裕,最大上下文測試的峰值也不過 14.08 GiB。在部署端,m-a-p 提供了 H800 上 vLLM 0.19 的伺服方案,並發 32 時 LM 吞吐達 3,231 tokens/s,相當於單節點每小時約 373 首歌。安裝就是從 Hugging Face 裝一個 wheel、呼叫 YuE2Pipeline.from_pretrained() 開始生成;規劃、語意生成、合成與解碼也各自暴露為獨立 API,方便串接管線。

這次發布是一整個家族而非單一檢查點:YuE2-3B、兩個 VAE 解碼器(重聽感的 YuE2-Vae、重複現基準數字的 YuE2-Vae-legacy)、MERT-v2 音樂理解模型、SheetSage2 轉譜器,以及 WildSongBench 資料集本身。

但有兩個但

有兩點必須潑點冷水。第一,權重採 CC BY-NC 4.0 授權——非商業使用。就像上個月 MiniMax 開放 Music 3 權重時觀察者就指出的,「開放權重」和「可以拿去做產品」是兩回事,想在 YuE2 上打造 Suno 競品的人需要一份目前還不存在的商業授權。第二,YuE2 的技術報告尚未發布;模型卡目前請研究者先引用初代 YuE 論文(arXiv:2503.08638),樂譜規劃背後的訓練配方仍未公開。

即便如此,這條軌跡很難反駁。十八個月前,開源音樂生成的產出還只是新奇玩具;今天它在一張涵蓋所有主要商業系統的綜合基準上名列前茅、用一張遊戲顯卡就能跑、把中間表示匯出成人類可讀的樂譜,並把「編輯」當成一等公民、可由 agent 驅動的工作流,而不是重新抽獎。閉源平台在提示遵循與人聲清晰度上仍佔優勢——商業授權的問題也真實存在——但音樂生成的開源前緣,第一次算是真正到位了。