← All posts / Research

阿里巴巴高德團隊開源 DreamX-Creator:7B 參數模型一次生成 2K 影音,畫面與聲音不再是兩回事

DreamX-Creator 1.0 以單一 7B 模型同時去噪生成音訊與視訊串流,搭配多模態強化學習與每片段一步去噪的 2K 精煉管線。

阿里巴巴高德團隊開源 DreamX-Creator:7B 參數模型一次生成 2K 影音,畫面與聲音不再是兩回事

現今大多數 AI 影片生成器本質上是「事後配音的默片」:影片模型先產出畫面,另一個音訊模型再合成聲音,最後靠對齊步驟把兩者黏在一起。阿里巴巴高德(Amap)機器學習團隊(AMAP-ML,以 DreamX Team 名義發表)剛發布的技術報告走了另一條路——DreamX-Creator 1.0,一個僅 70 億參數的緊湊系統,在單一模型內原生生成同步的音訊與視訊,解析度直上 2K,並計畫以 Apache 2.0 授權開源權重。

這篇論文(arXiv 編號 2608.31106)於 9 月 1 日登上 Hugging Face Daily Papers,幾小時內衝上 84 個讚,剛建立的 GitHub 儲存庫也迅速突破 90 顆星。對一個標榜「讓原生影音生成普及化」的系統而言,這樣的迴響說明開源社群等這一天已經很久了。

為什麼聯合生成這麼難

核心問題在於「耦合」。視覺動態與聲學事件彼此影響——畫面上的玻璃摔碎,就決定了某個瞬間該出現某個聲音;鏡頭外的窸窣聲,也應該能從場景的暗示推演出來。當音訊在第二階段才合成,這種相互建模就被切斷了:音訊模型只能看著成品影片,卻永遠無法反過來影響它,細粒度的時間同步也淪為後處理的噩夢。

DreamX-Creator 的解方從架構層下手。以首幀加文字提示為條件,7B 生成器聯合去噪各自主責的音訊與視訊串流。兩條串流在網路前半段獨立處理——讓每個模態先建立自己的表徵——後半段再透過門控跨模態注意力(Gated Cross-Modal Attention)耦合,其 token 級與 head 級的輸出閘門會調變每一個活躍跨模態注意力頭的輸出。白話說:網路不是盲目地把兩個模態的資訊平均混合,而是學會視覺該餵多少資訊給音訊、反之亦然,且精確到個別注意力頭與 token 的層級。

是資料系統,不只是模型

與多數現代生成系統一樣,DreamX-Creator 的品質建立在論文視為一等公民的資料管線上。音訊-視訊資料系統(Audio-Video Data System)會建構並篩選時間連貫的片段、產出結構化的多模態標註,並把片段組織成「能力導向」的資料池——訓練資料不只求大,還要按它教會模型什麼來分類。

訓練採用漸進式聯合訓練(Progressive Joint Training):兩個影音預訓練階段加上高品質微調(High-Quality Finetuning)。接著登場的,是讓這份工作脫離標準擴散配方的關鍵一步——影音強化學習(Audio-Video Reinforcement Learning)。生成器以作者所謂的「模態感知多模態回饋」做後訓練,把視覺端、音訊端與跨模態的獎勵訊號分別路由到對應的串流:視覺品質獎勵流向視訊串流,音訊保真獎勵流向音訊串流,同步與語意一致性獎勵則兩邊都碰。這種分工式的 RLHF 設計,正好呼應了模態自主的架構。

2K 的秘訣:蒸餾到一步就夠

高解析度影片正是擴散模型延遲爆炸的地方。DreamX-Creator 的自回歸一步 2K 精煉(Autoregressive 1-Step 2K Refinement)用三段式管線解決:先把雙向多步教師模型改造成自回歸多步精煉器,再蒸餾成一個每個時間片段只需一次去噪評估的學生模型。精煉器把低解析度生成結果升級到 2K,同時保留內容、運動與音訊對齊的時序——貴的模型負責教,便宜的模型負責上線。

團隊宣稱效能「與最先進的開源系統具競爭力」——這個說法還需要第三方基準驗證,前提是權重公開。GitHub 路線圖顯示儲存庫初始化與技術報告發布已完成,經驗證的模型權重、推論程式碼、設定檔與評測工具仍標記為待發布。致謝部分引用了阿里 Wan 影音團隊與復旦 OpenMOSS 的 MOVA 專案,把 DreamX-Creator 穩穩放進快速壯大的中國開源生成模型譜系。

為什麼重要

一個緊湊的 7B 聯合影音生成器加上 Apache 2.0 授權,對開發者將是實質的典範轉移。今天在產品中做「有聲影片」,通常得編排兩三個 API——影片模型、音樂音效模型、拼接層——成本與故障點在每個接縫成倍增加。單一原生模型摺疊了整條技術棧,而 7B 的規模小到可以在遠低於前沿實驗室等級的硬體上微調與部署。標題裡的「普及化」就是這個意思,而且非常具體。

它也揭示了前沿的方向。Google 的 Veo 系列把原生音訊當作旗艦功能;Wan 2.6 與 MOVA 等開源方案則把同步聲音帶進開放生態。DreamX-Creator 把開源的門檻再往上抬,一次結合了三件很少同時出貨的東西:聯合生成、多模態回饋強化學習、以及每片段一步去噪的 2K 精煉。

至於慣常的保留態度:這是一份剛滿一天的技術報告,權重尚未公開、量化數據待第三方驗證,也還沒有示範如何處理多鏡頭長序列或對口型毫不留情的對話內容。但架構論述足夠詳盡、程式儲存庫已上線,而且高德團隊本就有量產級多模態系統的出貨紀錄。

對任何打造影片工具的人來說,這是一個值得緊盯的專案——等權重一落地,就是一個值得下載的專案。