生成比播放還快:Video DeltaNet 用 11 秒產出 14 秒 768p 影片
UC Berkeley、Impossible Inc. 與 UT Austin 的研究團隊,在 MiniMax H3 上外加混合線性注意力分支,把 14.4 秒 768p 影片的渲染時間從 14 分鐘壓到 8 張 B200 上的 11.23 秒——品質近乎無損,且全程開源。
影片生成有個頑固的經濟學問題:前線模型的渲染速度,比它產出的影片播放速度還慢。來自 UC Berkeley、Impossible Inc. 與 UT Austin 的團隊,剛發表了一個答案。2026 年 9 月 6 日,這個團隊發布了 VDN-MiniMax-H3(VDN-H3):在 MiniMax 開放權重的全模態影片模型上,改用混合注意力架構,能在 8 張 NVIDIA B200 GPU 上、以 11.23 秒生成一段 14.4 秒的 768p 影片——影片抵達的速度比你觀看的速度還快,而品質據作者描述與原版近乎無損。
瓶頸:注意力吃掉了運算時間
出發點的觀察很直白:在 MiniMax H3 這類前線全模態模型上,softmax 注意力佔了總運行時間的 85% 以上。softmax 注意力的成本隨序列長度平方成長,而影片的 token 序列極長——每個潛在框架(latent frame)都貢獻一整格空間 token,外加文字與音訊上下文。
大型語言模型早已用線性注意力取代 softmax 解過類似的問題,但那個交換會傷到影片最需要的東西:全域的主體一致性、場景布局、長程時間連貫性。純線性注意力會遺忘;影片承受不起遺忘。
用兩條分支取代一條
Video DeltaNet 的答案,是把影片對影片的注意力拆成兩條互補路徑:
- 滑窗 softmax 分支負責局部細節。連續潛在框架每五格分成一組(沿用 H3 原始架構),每組只對自身、前一組與後一組做完整注意力,保留細粒度的局部互動與短期時間穩定性。
- 線性分支負責長程上下文。對每一格畫面,一個前向狀態摘要局部視窗之前的所有內容、一個反向狀態摘要之後的所有內容——雙向、互不重疊、不重複計數。文字條件在初始化時一次性寫入兩個狀態、各乘以二分之一,使得兩邊讀出相加後,提示詞的貢獻恰好計一次。
這個設計還加了 4 向邊界錨點——每一格畫面都對第一格與最後一格做完整注意力,反之亦然——只增加 3.57% 的注意力密度,團隊表示這大幅改善了長程穩定性。最後由內容相依的 sigmoid 閘門校準兩條分支注入殘差串流的比重。
真正的核心創新在線性路徑上,作者稱之為 Video Delta Attention(VDA)。先前的框架級線性更新(如 SANA-WM)讓每個空間 token 對凍結狀態各自獨立更新;VDA 則是把整格畫面所有 token 一起求解一個聯合正則最小平方問題。其閉式解——S_t = (S̄ + B)(I + A)⁻¹,其中 A 是加權鍵值 Gram 矩陣、B 是值-鍵寫入矩陣——被證明對任意 token 對齊方式都不會放大繼承狀態(non-expansive),因此 VDA 完全不需要框架規模的重縮放,而且具備相關性感知:畫面中重複出現的證據會無上限地累積,而獨立方向不會被無關 token 懲罰。
即插即用:骨幹權重不動
對採用者來說最關鍵的是:VDN-H3 沒有重訓 MiniMax H3。檢查點只新增線性注意力分支加上兩個小型 LoRA 適配器——50 步版本(4.3 GB)與 8 步 turbo 版本(5.1 GB)——在推理時併入骨幹,完全不動原權重。相較於 72 GB 的 H3 基底,完整下載約 82 GB。
訓練分三階段:先逐層校準每個新的線性分支(採用 Taylor-Calibrate 初始化策略),再做端到端分支適應(softmax 路徑全程凍結),最後讓線性分支與 QKVO LoRA 適配器聯合共同適應。值得留意的是,softmax 閘門在最後階段之前都保持凍結——如果太早放開,優化器會走捷徑、過度壓抑 softmax 分支,而不是去學新的線性分支。
實測數據
在單張 B200 上生成同一段 14.4 秒 768p 工作負載:
- 稠密 MiniMax H3、50 步:13.95 分鐘
- VDN-H3 FP8、50 步:5.3 分鐘
- VDN-H3 FP8、8 步:51 秒
以單一 H3 區塊計,延遲從 332.5 ms(稠密 cuDNN)降到混合注意力的 192.1 ms,再加上優化核心與 FP8 線性層後來到 125.3 ms——每層 2.65 倍加速。接著團隊用 Ulysses 序列平行把運算切分到 8 張 B200(1.62 秒/NFE),而且還再改進一步:效能剖析顯示,把兩條分支放到不同的 GPU 上——5 張跑 softmax、3 張跑 VDA——能再降低 13.3% 延遲至 1.405 秒/NFE。最後,從社群開發者 LarryVRH 的 MiniMax-H3 turbo LoRA 出發、以 DMD2 繼續訓練的分布匹配蒸餾,把生成壓縮到 8 個去噪步。
最終結果:14.4 秒的影片只需 11.23 秒的運算——相較稠密單 GPU 50 步基準是 74.5 倍加速,相較 8 GPU 稠密 H3 也有 10.7 倍。在 8 張 H200 上同一段影片需 18.3 秒;單張 H200 則是 90.5 秒。如同模型卡上那句一句话總結:這個模型「生成影片比播放還快」。實務上,這意味著一台 8 GPU 節點就能連續串流 H3 品質的生成內容。
品質主張是有量測背書的:論文報告生成結果與稠密 H3 近乎相同,且品質與指令遵循都優於 MiniMax 自家的 FastH3 快速版。
真開源——但藏著授權地雷
這次發布不只是權重。團隊強調他們不是「只開源權重」:優化後的推理堆疊與訓練程式碼一起放在 GitHub 儲存庫中,核心建立在 FlashAttention、Triton、Flash Linear Attention 與 FlexAttention 之上,並獲 MIT Han Lab 的 Kernel Design Agents 支援核心設計。專案也將 Haoyi Zhu 的《Reflections on Video DeltaNet》列為並行工作。
問題出在授權。VDN-H3 繼承了 MiniMax H3 社群授權條款,其適用地區為全球、但排除歐盟、英國、南韓與美國。對最有可能部署開源文字生影片模型的族群——美國新創與歐洲工作室——未經 MiniMax 另行授權,商業使用並不被允許。Reddit 網友也很快算了硬體帳:8 張 B200 以好的雲端價格約每小時 40 美元,「比播放還快」等於用一個小型 GPU 叢集的價格買到即時生成。
為什麼重要
VDN-H3 是一项架構研究、不是產品發表——但它用異常乾淨的證據展示了兩件事。第一,混合注意力對影片擴散模型已經是務實可行的配方,不再專屬於 LLM:從零訓練的線性分支可以近乎無損地承接長程上下文,softmax 則退居局部細節專家。第二,開源生態系的推進速度可以快過發布基底模型的實驗室:8 步蒸餾建立在一個社群 turbo LoRA 之上,而整條管線——含訓練程式碼——全部可重現。
值得追蹤的後續:分支專屬化的 5/3 GPU 切分能否推廣到其他混合模型;以及 MiniMax——或其他授權更友善的實驗室——會不會把 VDA 式的線性分支原生折進未來的骨幹。當生成速度追過播放速度,互動式與串流影片應用就不再是延遲幻想。這個門檻,如今已經被公開跨越,而且附上了收據。