一個能用鍵盤與文字走進的世界:SeedLeap 開源 Zing-0.5,24 FPS 串流可玩世界模型、每分鐘成本 0.009 美元
中國新創 SeedLeap 開源 Zing-0.5:50 億參數自回歸世界模型,支援鍵盤導航與線上文字指令的即時混合控制,以 832×480、24 FPS 串流生成可玩世界,WBench Navigation 獲 81.0 分,權重、程式碼與推論服務全數公開。
生成式媒體當前最有趣的問題,已經不是「影片可以做到多好看」,而是「當影片開始聽你說話,會發生什麼事?」本週,一個 16 人的中國新創團隊 SeedLeap.ai(涌跃智能)發表的技術報告,對第二個問題給出了強而有力的一步。9 月 15 日上架 arXiv(編號 2609.17909)的 Zing-0.5,是一個 50 億(5B)參數的自回歸(autoregressive)世界模型,核心設計目標是團隊所稱的「可玩性」(playability):你用鍵盤移動、用文字介入,而世界持續滾動——一條連續不中斷的影像流,不需要重新開始。
更難得的是,在一個前沿成果越來越常被鎖進 API 的領域,SeedLeap 選擇全部開源:Hugging Face 上的模型權重、GitHub 上的推論程式碼與 Zing-SGLang 服務實作,以及一份詳細到足以重現訓練流程的技術報告。對追蹤開源互動影片競賽的人來說,這是本週的基準事件。
「可玩」在這裡到底是什麼意思?
至今為止,多數互動世界模型只選了一條控制軸。以導航為主的系統——源自 Genie 式鍵盤控制的一系列工作——讓你在生成場景中移動,但文字提示(prompt)在開始時就固定了;以語言為條件的系統讓你改變世界裡發生的事,但與移動是兩個分離的模式。Zing-0.5 的貢獻是把兩者合進同一個連續會話:WASD 鍵(加上 IJKL 控制視角)驅動移動與鏡頭,而線上文字指令可以在串流中途觸發,改變主體、場景或事件——生成則從既有的視覺脈絡繼續往下走。
論文中的展示案例說明了範圍:使用者駕著一艘船穿越雲海駛向遠方宮殿;航行途中,一句文字指令點燃了一棵開滿銀花的樹,金色火花在同一片林間空地灑落。另一個會話裡,第一人稱的雙手伸向一棟糖果屋,糖果屋在手底下熔化。還有一段,視角跟著角色穿過臥室裡的鏡子走進花園,探索在戶外繼續展開。針對主體的改變也行得通:一句指令召喚月光,角色騰空而起;另一句讓飛行坐騎噴出火焰——而鍵盤導航全程沒有中斷。
撐起這一切的三個技術核心
一、動作與文字的統一條件化,且帶有強度資訊。 Zing-0.5 建構在阿里巴巴的 Wan2.2-TI2V-5B 影片骨幹上,保留其視訊自動編碼器與擴散 Transformer(DiT),再加入一個輕量動作編碼器——僅 368 萬參數,約占 5B 骨幹的 0.074%——在 DiT 堆疊之前,把對影格對齊的控制特徵注入視覺 token。
一個微妙但影響深遠的選擇:團隊沒有把鍵盤輸入轉換成相機姿態增量(繼承自相機軌跡控制的常見做法),而是直接以按鍵本身作為條件,且每個方向鍵都附加連續的強度值。他們的論證是:基於姿態的方案很脆弱——一旦生成動作偏離條件軌跡,誤差會在長時間滾動中複合放大,最終破壞視覺一致性;而提示更新本身也會移動視角,讓問題更嚴重。直接以原始動作作為條件,讓訓練與推論的表示完全一致,連續強度則保留了離散標籤丟失的細粒度資訊。值得一提的是,他們還對訓練資料中氾濫的「只按 W 前進」片段做了降採樣,避免轉向與複合控制被淹沒。
文字端則採用區間對齊而非全域提示:每一段影格只attend到描述該段的字幕,這正是串流中途的指令變更能夠局部生效的原因。
二、以師生蒸餾實現事件尺度的監督。 訓練流程分四個階段,把預訓練的雙向影片模型逐步轉化為少步因果生成器。最精巧的設計是從同一個適應後檢查點分出兩條分支:區段級教師(segment-level teacher)以雙向注意力聯合去噪整個提示區間(它看得到整個事件,而且只在訓練時使用,沒有延遲預算限制);區塊級生成器(block-level generator)則必須以四個潛在影格為單位增量產出影片,才能對輸入低延遲回應。
最後一階段用分布匹配蒸餾(DMD)收斂訓練與推論的落差:學生在自己的滾動輸出上訓練,由凍結的真實評分器與可學習的偽評分器(兩者皆從教師分支初始化)打分。團隊改造了 Self Gradient Forcing 的兩段式流程——先無梯度滾動、再打包計算梯度——讓長而變長的樣本在記憶體上可行。他們也把 Data-Forcing Distillation(DFD)以一定機率混入整個 DMD 階段,而非作為收尾的後訓練步驟;據其報告,這減少了運動幅度的震盪,並緩解了嚴重的視覺劣化。最終結果:每個區塊四步去噪,且引導(guidance)已融入訓練,推論時不需要第二個無條件前向傳遞。
三、把經濟學當成第一級約束。 這是報告中最不尋常、也最具體的部分。在一台配備 8 張 RTX 5090 的伺服器上,Zing-0.5 同時服務 8 條獨立的 832×480 串流,客戶端可見 24 FPS(未節流的穩態為 24.63 FPS,留有即時餘裕)。每張 GPU 承載一個完整副本——DiT、有界因果 KV 快取、本地 TAEHV 解碼器——刻意避開跨 GPU 的潛在表示傳輸。四步去噪產生 4 個潛在影格、解碼為 16 個視訊影格;原生 VAE 只在編碼初始影像時需要,其餘交給輕得多的循環式 TAEHV 解碼器,H.264/fMP4 片段流經有界環形緩衝區,在背壓下優先保全即時邊緣。
團隊公布的最終數字:每串流分鐘約 0.009 美元的伺服器租賃成本。如果「可玩的生成世界」終究要成為一個產品類別而非展示品類,這個數字——而非基準分數——可能才是最關鍵的那一個。
分數表現
在 WBench 的 158 案例 Navigation 子集上(以 1248×704 生成),Zing-0.5 總分 81.0、一致性 88.5——平均分與 JoyAI-Echo-1.5 的 4 步版本並列,領先 HiDream-O1-World(80.9)、Alaya-EVOKE 3 步(80.8)與 LingBot-World v2 fast(79.4),僅次於 JoyAI-Echo-1.5 的雙向版本(81.6)。其中物理合理性(Physical)73.8 是 Zing 最強的子項,為入選排行榜中最佳。而這一切來自一個 5B 模型——離前沿規模很遠。
最精彩的部分:誠實的限制章節
讓這份報告超越一般「發布文宣」的,是第 6 節——團隊鉅細靡遺地說明了為什麼這還不是一個遊戲引擎。其論點值得完整轉述:
- 有意義的互動需要持久的後果。 展示中對指令的視覺回應是可見的,但論文坦承,沒有任何機制保證後果會持續。「被挪到一旁的物體,在使用者回頭時應該還在原處;從一次互動學到的規則,應該在下一次仍然成立。」
- 視覺歷史並未完整定義世界狀態。 Zing 從保留的視覺脈絡、文字與動作生成——它不追蹤任何顯式的實體狀態或轉移規則。物體可以離開畫面而不因此消失;事件可以結束而其後果仍應有效。有界 KV 快取限制了對早期證據的存取,而自回歸生成意味著一次不佳的延續會成為下一次預測的脈絡。
- 持久世界需要架構層級的支援。 他們的結論是:「持久性」本身必須成為設計目標——未來系統的評測應該問:使用者能否改變某個東西、離開、然後在之後從那次改變的後果繼續?
這是對「令人驚豔的互動影片」與「一個世界」之間落差的正確診斷;而它出自打造模型的本團隊、寫在發布論文裡,正是開放研究應該有的姿態。
為什麼重要
互動世界模型這一年持續升溫——JoyAI 的 Echo、阿里巴巴的 H3-World 與 HappyOyster、HiDream 的 O1-World、Alaya 的 EVOKE、LingBot-World——WBench Navigation 排行榜正在成為開源挑戰者彼此較量的競技場。Zing-0.5 以混合控制、即時經濟學與真正徹底的開源(權重+程式碼+服務堆疊)三合一,墊高了下一個入場者必須跨過的門檻。
這裡還有一個戰略層面的解讀。Wan2.2 骨幹是阿里巴巴的開源模型;SeedLeap 的成果展示了小團隊能從開源生態系榨出多少里程——一個 16 人新創,在一場其他參賽者都是大型實驗室的競賽中,繳出了具有競爭力的作品。開源權重的飛輪效應,至今主要是語言模型的故事,如今在互動影片領域也肉眼可見地轉動起來。
對開發者而言,每分鐘 0.009 美元的數字是一封邀請函:一分鐘的可玩生成世界,成本約新台幣 0.3 元。一年前在經濟上還荒謬的實驗,現在是租幾張 5090 就能在週末完成的專案。可以預期,這個模型最奇怪的應用,會來自那些永遠不可能獲准在閉源模型上建造的人。