← All posts / Tools

影像與影片推論快上 3.5 到 10 倍:Nunchux 攜 Modelverse 走出隱身狀態

源自 MIT HAN Lab 與 CMU 研究團隊的 Nunchux 本週發表 Modelverse,多模態推論最快提速 10 倍——FLUX.2-klein 只要 0.08 秒、MiniMax-H3 影片 10.4 秒完成,而且品質不減反增。

影像與影片推論快上 3.5 到 10 倍:Nunchux 攜 Modelverse 走出隱身狀態

過去十年,AI 推論基礎設施幾乎都圍繞著同一種工作負載最佳化:自回歸語言解碼,一次一個 token。本週,一家從高效能生成式模型領域兩大最受引用學術實驗室誕生的新創,正式走出隱身狀態(out of stealth),直指這個根基對下一波 AI 工作負載而言是錯的——並用實際產品來證明。

這家公司叫 Nunchux AI,團隊來自 MIT HAN Lab 與卡內基美隆大學(CMU)Generative Intelligence Lab。他們本週正式推出 Modelverse:一個針對影像、影片與世界模型(world model)的推論服務平台,宣稱提供當今最快、最便宜、品質最高的多模態推論。核心數字相當醒目:FLUX.1-schnell 提速 3.5 倍、FLUX.2-klein-4B 提速 10 倍、MiniMax-H3 影片生成提速 4.9 倍、LTX-2.5-fast 提速 4.4 倍。

問題的物理本質

Nunchux 的核心洞看似簡單:語言模型與視覺模型的運算特性截然不同。自回歸文字解碼每一步只生成一個 token,瓶頸通常在記憶體頻寬——每產出一個 token,整份模型權重都要被搬進處理器一次。為 LLM 打造的服務堆疊(vLLM、SGLang、TensorRT-LLM)全都針對這種 memory-bound 情境調校。

影像與影片擴散模型則完全相反:每個生成步驟會平行處理一整個空間或時空 latent 張量——這是密集、算力導向的運算。瓶頸從記憶體轉移到原始算力,而為語言模型設計的排程技巧、批次策略與成本結構根本無法沿用。影片又是極端案例:該公司指出影片所需的運算量大約是單張影像的兩個數量級,「但沒有人願意多等兩個數量級的時間。」

Nunchux 沒有去調校現有堆疊,而是從零打造自己的系統:Nunchux Model Optimizer 與 Nunchux Engine 被設計成一體,讓某一層的效能增益為下一層騰出空間。整套堆疊可跑在 NVIDIA GPU、AMD GPU,甚至行動裝置上。

研究血統

Nunchux 比一般推論新創更具可信度的原因,在於它的研究血統。底層技術——SVDQuant、Sparse VideoGen、DeltaQuant 與 Radial Attention——出自 MIT HAN Lab(以 TinyML 與高效深度學習脈絡聞名)與 CMU Generative Intelligence Lab 長達十年的合作,累積引用超過 20 萬次。

光 SVDQuant 就已被下載 400 萬次,並成為 NVIDIA TensorRT、AMD Quark、vLLM、SGLang、Diffusers 與 ComfyUI 內建的標準量化演算法——也就是說,如果你過去一年跑過任何最佳化過的開源影像模型,Nunchux 的研究很可能早已存在於你的推論路徑中。

該公司強調,速度不可能來自單一技巧。他們的 SVDQuant 管線讓 FLUX.1-schnell 提速 3 倍之餘,ImageReward 品質指標還從 0.938 上升到 0.966——輸出更快,畫質還更好,而不是被降級的近似品。

這次發表了什麼:Modelverse

Modelverse 目錄分成兩個效能等級:訴求最低延遲的 Radical Speed,以及訴求最低成本的 Radical Value。除了 Nunchux 最佳化的開源模型外,平台也提供來自基礎模型實驗室的 Partner API,包括 Google Veo 3.1、HeyGen Avatar 5 與 Kling V3 等,合計超過 30 個最佳化與合作 API。

隨發表公布的實測數據如下:

模型任務提速倍率Nunchux基準
FLUX.1-schnell影像3.5x0.143 秒0.5 秒
FLUX.2-klein-4B影像10.0x0.08 秒0.8 秒
Qwen-Image影像2.6x2.24 秒5.9 秒
Ideogram v4影像2.4x6.94 秒17 秒
LTX-2.5-fast影片4.4x6.6 秒28.9 秒
MiniMax-H3影片4.9x10.4 秒51.3 秒

低於 100 毫秒的 FLUX.2 生成是一個有意義的門檻:它把影像生成從「送出後等待」推進到真正互動式創作循環的領域——每個輸出都能即時回饋到下一個 prompt。

品質方面採取的是閘門機制而非口頭承諾:每個模型進入目錄前都會與原始輸出比對,任何會明顯降低保真度的最佳化,都會讓模型被擋在門外。

為什麼經濟學很重要

Nunchux 對成本—品質—延遲三角的論述值得細看。多模態生成天生就是反覆迭代的:使用者生成、觀看、編輯、再試一次,而且常常要看到結果才知道自己要什麼。便宜的嘗試會擴大設計空間;昂貴的嘗試則迫使人過早定案。延遲則決定結果能否在「靈感還是你的」的時候送達。

如果這些提速在生產環境成立,實際後果就是視覺 AI 開發的單次迭代成本崩落——連帶改變哪些產品變得可行。即時影像編輯 agent、嵌入搜尋結果的影片預覽、世界模型模擬迴圈,全都便宜了大约一個數量級。

該公司由 Emergence Capital 與 E14 Fund 領投,Archerman Capital、Scale Asia Ventures、Tectonic Ventures、KungHo Fund 與 Plaid Matrix Fund 參投,天使投資人包括來自 Black Forest Labs、Reve、HeyGen、Pika Labs、Together AI 的創辦人,以及 Meta 超級智慧實驗室的創始成員。據稱需求已超過可上線的產能,因此透過候補名單分批 onboard,新帳號附贈 10 美元額度。

更大的圖像

推論最佳化已悄悄成為 AI 堆疊中戰略競爭最激烈的層之一。NVIDIA 持續把最佳化研究吸收進 TensorRT;Decart 本月稍早傳出在 Anthropic 的收購洽談中被估值 60 億美元;每個雲端巨頭都在競相把多模態生成壓到消費級產品可負擔的成本。Nunchux 代表的是學術界的反擊:寫出產業如今依賴的論文的那些實驗室,直接把自家堆疊商業化。

懸而未決的問題是護城河。編譯器技巧與量化方案很快就會被商品化——SVDQuant 自己被整合進 TensorRT 與 vLLM 就是明證。Nunchux 的賭注是:橫跨 NVIDIA 與 AMD 晶片、一路延伸到行動裝置,持續站穩品質—成本—延遲柏雷托前緣,是一個持久而非暫時的位置。如果 10 倍提速站得住、品質閘門繼續誠實運作,Modelverse 立刻成為多模態推論成本應該長什麼樣子的新基準點。