← All posts / Industry

創辦人回歸第一線:張一鳴親自督軍,字節跳動即時世界模型劍指下月發布

彭博報導,字節跳動正基於 Seedance 打造即時空間影片世界模型,目標約 20 fps、延遲低於 50 毫秒,由雲端渲染餵養 Pico 頭顯,最快下個月推出。

創辦人回歸第一線:張一鳴親自督軍,字節跳動即時世界模型劍指下月發布

過去十年,字節跳動創辦人張一鳴鮮少親自介入產品一線。這一週,情況變了。根據彭博(Bloomberg)引述知情人士的報導,張一鳴目前親自督軍一個「即時空間影片生成」AI 模型的開發——一套能即時生成可互動虛擬世界的系統——最快下個月就可能推出。

知情人士同時提醒,時程尚未定案,計畫仍可能調整;字節跳動也未回應彭博的置評請求。但報導揭露的規格具體得不容忽視:按需生成影片、每秒約 20 幀、端到端延遲約 0.05 秒(50 毫秒),而且運算全部放在雲端,不在裝置上。

這個模型到底是什麼

這套系統建構在字節跳動既有的影片生成家族 Seedance 之上。Seedance 1.0 於 2025 年中問世,支援 1080p 文生影片與多鏡頭轉場;2026 年 6 月發表的 Seedance 2.5 能一次生成原生 30 秒單鏡頭影片、接受多達 50 個多模態參考輸入,並提供 3D 鏡頭調度控制。這條技術脈絡至關重要:所謂即時世界模型,本質上就是把影片生成推到極限——快到、且連貫到,使用者可以「住進」生成結果裡。

目標應用場景是直播、短劇與遊戲。模型要能生成回應使用者語音與動作的虛擬世界——這正是「世界模型」與「影片生成器」的分水嶺:影片模型渲染你「要求」的東西,世界模型渲染你「做了」的東西。

目標硬體是字節跳動自家的 XR 事業 Pico。而報導中策略上最有趣的細節不是某個數字,而是架構:雲端渲染。空間內容改在遠端生成後,運算負擔整個移出頭顯——裝置只剩下螢幕、感測器與網路連線,也就是說,裝置可以變得很便宜。

這一切早有鋪陳

彭博這則報導並非憑空出現。中國科技媒體 36氪(36Kr)今年稍早即報導,字節跳動為 2026 年設下四大 AI 優先方向,世界模型位居首位——排名在守住 Seedance 的影片領先地位、改進程式碼模型、以及商業化豆包(Doubao)之前。

數據預算訴說著同一個故事。據 36氪消息來源,世界模型享有字節跳動所有模型方向中最大的數據預算——人民幣八位數的金額,約是競爭對手在世界模型訓練數據上花費的三到四倍。公司內部設下明確目標:2026 年底前至少推出一個世界模型,對標 Google 的 Genie——後者已能讓使用者在即時渲染的街景影像中行走漫遊。

據報導,2026 年初的內部測試顯示字節跳動落後全球最先進水準約 10%。若能在下個月推出,等於提前達陣,而且是在 Google Genie 仍停留在研究展示階段時,就把產品交到使用者手上。

36氪的報導還揭露字節跳動內部有兩條並行的技術路線:一是瞄準具身智慧與機器人的視覺-語言-動作(VLA)路線,二是瞄準娛樂與遊戲的 3D 模擬路線。這次的空間影片模型屬於後者——也是唯一一條自帶現成用戶群的路線。

為什麼影片公司總是跑在世界模型賽道前端

以現今的定義來說,世界模型是一個把環境行為學得夠透徹、以至於能渲染出一個對使用者行為做出連貫反應的環境的系統。影片生成公司之所以頻頻站上這個領域的前排,原因很簡單:訓練材料就是影片。擁有最多影片、又最擅長把影片壓縮到能快速渲染的公司,起跑點就與眾不同。

字節跳動過去十年打造的正是這樣一條管線——只是原本目的不同。TikTok 與抖音的推薦系統,剝開迷因表象之後,其實是全世界最大的低延遲影片 ingestion、理解與分發系統之一。商業層面上,Seedance 已經支撐著剪映(CapCut)與豆包。從「生成 30 秒影片」到「每秒 20 幀、回應使用者的頭部與手部動作、無限持續地生成下一幀」,這一步跨距極大——但它沿著的,是字節跳動爬了十年的同一條軸線。

彭博把張一鳴的親自投入,定位在他與李飛飛、Yann LeCun 等研究者並列的脈絡——這些學者長期主張,以視覺與物理理解為基礎(而非僅有語言)的模型,才是讓系統能在世界中行動的路徑。不同的是,字節跳動如今用娛樂產品,把這個論點放上商業市場實測。

錢與對手

投入的資本不成問題。字節跳動上週剛取得 300 億美元貸款,並一直在評估高達 700 億美元的 AI 資本支出。在中國市場內,它以自己的節奏與阿里巴巴、DeepSeek、月之暗面(Moonshot AI)競爭——阿里巴巴才在自己的 100 億美元融資後數天,就發表了 Wan3.0 的 30 秒影片模型。

更尷尬的衝擊落在 Meta 與 Apple 身上。兩家公司都重金押注始終未能主流化的頭顯,XR 事業都建立在高階硬體之上。雲端渲染的世界模型不會在畫質上擊敗 Vision Pro——它只是讓畫質變成「別人的問題」,具體來說是資料中心的問題,讓頭顯往大宗商品經濟靠攏。若 XR 競賽從硬體規格轉向模型、雲端產能與內容分發,這三樣恰恰都是字節跳動現有的優勢。

當然,一切仍可能生變。消息來源自己都說時程未定,而「每秒 20 幀、50 毫秒延遲的即時生成世界」是沒有人在消費級規模上實現過的激進目標。但方向已經清楚:創辦人回來了,預算是全公司模型組合裡最大的一筆,期限是下個月。