Runway Solaris 直接生成軟體本身:首個「介面世界模型」深度解析
Runway 發表 Solaris,即時逐框生成可互動的 App 與網站介面、完全不需要程式碼,並以世界模型負責渲染、LLM 負責推理;在 250 人使用者研究中,指令遵循度以 61% 比 24% 擊敗 Claude 產生的程式碼介面。
有史以來出貨的每一套軟體,都藏著一個翻譯步驟:設計師的視覺構想必須先轉換成程式碼——某種中間表示——才有辦法動起來。8 月 31 日,Runway 發表了一個直接刪掉這個步驟的模型。Solaris 是該公司稱為「介面世界模型(Interface World Model)」的新模型家族之首,能夠即時逐框生成可互動的 App 與網站介面,背後完全沒有程式碼。
Runway 提出的問題看似簡單,實則激進:當作業系統在你使用的當下即時生成 App 和網站,會發生什麼事? 從早期終端機到 macOS,每一套作業系統都由它決定螢幕上渲染什麼、使用者操作時會發生什麼。應用程式疊在上面,然後凍結不動,直到開發者推出更新。Solaris 則是直接渲染這一層——每一框都在你互動的當下合成,介面因而能持續回應你的行為。
為什麼翻譯步驟是個問題
Runway 的論述是:如今的軟體開發流程,是「對可能互動空間的一次有損壓縮,而且在任何使用者到場之前就凍結了」。像素級完美的設計稿和影像模型早已能生成以假亂真的完整畫面——但圖片不會「動」。每一種行為仍然必須事先明確定義、事先實作;而一旦設計被簡化成程式碼,介面之所以能快速回應,正是靠犧牲原始設計的大部分豐富性換來的。
這個資訊損失是可以量測的。Runway 建了一個重建基準,結合結構相似度(SSIM)與 DINOv3 特徵的區域比對,結果顯示:即使是最先進的多模態語言模型,隨著視覺複雜度提高,重建品質也會一致地劣化——豐富的視覺細節根本無法用語言精確表達。Solaris 直接在視覺介面上操作,從第一框開始就完整保留介面的視覺與語意狀態。
技術原理
Solaris 建立在 Runway 的 Gen-4.5 影片生成模型之上,沿用其通用世界模型 GWM-1 開啟的路徑改編而成。三個設計環節讓它得以運作:
學習互動。 使用者的輸入——點擊、拖曳、打字——被當成下一框的條件訊號,就跟文字提示和圖片提示一模一樣。因為模型永遠只看得到已經發生的互動(絕不看未來的),它學到的是使用者行為與視覺結果之間的因果關係,而不需要任何互動被明確程式化。
即時運行。 標準影片擴散模型要對整段影片做數十步去噪——做內容創作沒問題,做介面則毫無希望。Runway 分三階段把 Solaris 轉成即時引擎:先教模型自回歸地生成畫面(每一框只依賴之前的畫面),再把多步去噪蒸餾到只剩幾步,最後用快速模型自己的輸出再訓練它,讓視覺品質在長時間互動下保持穩定。Runway 表示,同樣的工程也讓它的運行成本比標準影片擴散模型低了幾個數量級。
推理與渲染分離。 這是整個系統的架構核心。一個語言模型決定應用程式「下一步該做什麼」——解讀使用者請求、判斷互動該修改當前場景還是切換到新場景、定義讓世界感覺活著的行為,並產出引導渲染的提示詞。世界模型則生成這個行為「看起來如何」,以可互動的速度即時呈現。一個模型負責推理,另一個負責渲染。
互動模式本身令人驚豔:沒有預先定義的畫面、沒有範本可以退回。你提供一個起始狀態——品牌環境、產品場景——模型就開始串流畫面。文字提示定義點擊和拖曳在特定場景中「是什麼意思」。Runway 稱之為「重新定義滑鼠」:點一下貓,接下來你的點擊就會把牠的毛色和紋理塗到你碰到的任何東西上;點一幅畫,你可能就開始用那種風格作畫。
實測數據:Solaris 對決程式碼介面
最具體的成果,是與最先進語言模型——Claude Opus 5——產生的程式碼介面正面對決。兩個系統從同一張圖出發、收到同樣的互動請求,Runway 接著執行了一項 250 人參與、涵蓋 30 個互動範例的使用者研究,收集了近 7,500 筆成對判斷。
參與者在兩項指標上都偏好 Solaris:
- 指令遵循度: Solaris 在 61% 的比較中勝出,程式碼介面為 24%(13% 評為等同)
- 場景內的自然度: Solaris 獲 71% 偏好,程式碼網站為 21%(6% 等同)
自然度的差距最說明問題。程式碼介面往往能重現你要求的變更,但它把每個 UI 操作當成對介面的孤立更新。因為世界模型本來就理解物件、材質和環境的行為方式,Solaris 生成的互動會與整個場景保持連貫——沙發換了顏色,光線也跟著回應。
訓練 Agent 的全新方式
公告中埋著一個可能影響最深遠的含義:Agent 訓練。如今最好的 LLM 仍會在訂飯店、網購生鮮這類基本電腦操作任務上卡關,因為在程式碼介面上訓練的文字模型,學到的是訓練時那個特定版面,換個稍有不同的介面就無法適應。Solaris 把行動與回應之間的鴻溝壓縮掉,讓 Agent 能在持續變化、版面可能從未存在過的介面上訓練——這比靜態網頁爬取是豐富得多的訓練素材。
目前還做不到的事
Runway 對缺陷異常坦白。穩定、可讀的文字仍是影片生成最難的問題之一——而介面對文字的依賴比幾乎任何視覺領域都重;暫行的折衷路徑是混合系統,在可容忍暫停時用影像模型渲染文字密集的畫面。信任問題未解:對教學或商業體驗來說,一個有說服力的錯誤答案比沒有答案更糟,所以 Solaris 目前靠真實產品影像錨定場景,對已驗證脈絡的 grounding 仍是活躍研究方向。長時段連貫性——在延伸、開放的互動中維持視覺與語意一致——尚未解決。還有無障礙:生成的介面仍必須能與螢幕閱讀器和無障礙 API 協作,否則彈性就是以可用性為代價。
Solaris 目前以 720p 品質為目標,工程焦點有三:即時互動(互動感消失的延遲門檻約在半秒)、整個 session 的連貫性、以及撐得住的視覺品質。
當介面變成生成的
Runway 描繪的終點,是一個「App 不再是你互動的單位」的作業層。今天要完成一件事,你得打開為它預先打造的 App。如果作業系統能按需生成有用的介面,固定的 App 目錄就開始像上一代的遺留束縛——你需要的東西自己出現,為你客製。店面變成一個生成的環境,在圍繞每個人重塑的同時保留品牌識別;教學不再對所有人重播同一套順序,而是在你自己的脈絡中渲染下一步,你偏離腳本時還能自然恢復。
Runway 預期這條軌跡會重演影像生成的歷史:每一代模型都更快、更連貫、更可控。該公司正與關鍵合作夥伴合作公開推出 Solaris,早期存取可透過表單申請——而那些曾讓生成式介面顯得不切實際的挑戰,如今用他們的話說,看起來「越來越像是可解的工程問題」。
無論 Solaris 本身會不會成為產品,抑或只是概念驗證,這一步概念上的跨越都意義重大:它把「軟體」視為一個模型可以成為的東西,而不只是模型幫你寫出來的東西。「幫你寫 App 的 AI」與「本身就是 App 的 AI」之間的鴻溝,剛剛拿到了第一個認真的基準測試。
Sources
- [1] https://runway.com/news/research/introducing-solaris
- [2] https://indianexpress.com/article/technology/artificial-intelligence/runway-solaris-ai-interactive-apps-10858038/
- [3] https://cryptobriefing.com/runway-solaris-interactive-interface-model/
- [4] https://superpowerdaily.com/posts/runway-s-solaris-generates-live-app-interfaces-frame-by-frame-but-it-isn-t-public-yet
- [5] https://alphasignal.ai/news/runway-s-solaris-renders-interactive-apps-as-live-video-no-code-needed