ByteDance Lucida:把雜亂房間影片變成機器人可用的可編輯 3D 場景
ByteDance Seed 的 Lucida 管線把雜亂室內影片解析成逐物件場景圖、為每個物件生成資產,再由 VLM 策略 GizmoAct 直接操作 3D 編輯器的 gizmo 手柄決定擺放完成與否——在 R2S-Scene 上繳出 69% 的 mAP 增益。
每個機器人實驗室都有同一個不起眼卻致命的瓶頸:你可以讓操作策略在模擬器裡訓練到天荒地老,但模擬器終究需要一份忠實還原機器人實際工作房間的數位副本。8 月 31 日,ByteDance Seed 團隊發表的論文正面迎戰這個問題。這套名為 Lucida 的系統(arXiv 2608.30821,登上 Hugging Face Daily Papers 後數小時內已累積 40 個讚)吃進一段隨手拍攝的雜亂室內影片,吐回一份模擬就緒的場景複製品——每個物件都是獨立、可編輯的資產,而且擺在鏡頭實際看到的位置。
問題:要求「輸入端就完美」的傳統管線
可組合場景建模(composable scene modeling)的目標,是把真實房間還原成一組完整、可逐一操縱的物件資產,並按觀察到的樣子排列——這對具身智能(embodied AI)與機器人模擬至關重要,因為它們需要真實環境的模擬複製品。現有做法把任務拆成三步:把觀察解析成實例(instance)、為每個實例生成 3D 資產、再把每個資產放回場景。
Lucida 作者的核心觀察是:這個流程順序暗自假設了真實拍攝幾乎永遠給不出的東西。解析步驟假設實例幾何是準確的;生成步驟假設每個物件都有未被遮擋的視角;擺放步驟假設資產與觀察完全吻合。拿手機走進任何真實客廳,這些假設全都站不住腳:椅子半藏在桌子後面、檯燈只露出一側,而任何資產庫裡都不會有桌上那個凹陷的馬克杯。
Lucida 的答案靠的是架構設計而非魔法。它保留「解析—生成—擺放」的順序,但「重新分配了各步驟的需求,讓每一步只消耗真實拍攝能可靠提供的資訊,把精確度推遲到管線末端達成,而不是在起點就苛求」。
管線內部
三個階段撐起整個設計:
1. 解析成帶證據的場景圖。 Lucida 把輸入影片解析成場景圖(scene graph),圖上每個節點都攜帶該實例的 多視角證據(multi-view evidence)——跨影格累積的部分觀察,而非對每個物件的單次完美重建。
2. 逐實例資產生成。 對每個節點,系統從其多視角證據生成完整資產。因為生成消耗的是累積證據、而非乾淨無遮擋的掃描,半遮半掩的扶手椅依然能生成出完整的扶手椅。
3. 用 GUI 操作做擺放——GizmoAct。 這是論文最不尋常的想法。擺放交給 GizmoAct:一個視覺語言模型(VLM)策略,把資產擺放轉化成多輪 GUI 互動——它操作物件的 transform gizmo(就是人類 3D 美術在 Blender 或 Unity 裡拖曳的那組位移/旋轉手柄),在閉環中反覆調整,並自行判斷何時對齊完成。沒有可微分的擺放損失函數,沒有手工調參的 ICP 點雲配準;VLM 看著編輯器視窗、推一下手柄、再看一眼,然後宣布完成。
最後這步值得特別強調。把幾何估計問題轉化成閉環 GUI 操作,與讓通用電腦操作 agent 成立的是同一個概念躍遷:與其打造專用求解器,不如讓多模態模型直接使用人類已有的介面,讓感知驅動行動。Lucida 的貢獻在於證明這一招撐得住 6 自由度擺放——傳統上 3D 視覺裡對精度最飢渴的任務之一。
數字
論文在三個標準評測面上報告:
| 指標 | 基線 | Lucida |
|---|---|---|
| 場景級 3D 偵測 mAP(R2S-Scene) | Boxer | 提升 69% |
| ADD-SB@0.05 位姿估計(CA-1M) | 57.8% | 83.4% |
| 場景 F-Score(重建) | 0.794(SAM3D) | 0.924 |
位姿估計的躍升最搶眼:在 CA-1M 上把 ADD-SB@0.05 從 57.8% 拉到 83.4%,意味著擺放後的資產在絕大多數(而不只是多數)情況下與物件實際出現的位置對齊。場景 F-Score 0.924 對比 SAM3D 的 0.794,同樣指出重建兼具完整度與精確度。
必須講清楚的保留意見:摘要中沒有逐實例、逐類別的細項數據;這是預印本而非同儕審查結果,所有數字皆為作者自行報告。Hugging Face 上的讚數速度——登上 Daily Papers 數小時內 40 讚——反映的是社群關注,不是驗證。
為什麼重要:超越跑分
真正的實務獎賞在機器人訓練迴路。需要實驗室轉盤乾淨拍攝的數位雙生管線,無法規模化到倉庫、廚房或住家。一套能吃進隨手手持影片、輸出可編輯可組合資產的管線,直接從源頭攻擊 sim-to-real 落差:模擬器本身擬真度。ByteDance Seed 在此有明顯的機構利益——該團隊同時也發表「manipulation as in simulation」等操作研究——Lucida 正好補上那條技術棧的場景取得前端。
更深一層的訊號是方法論的。Lucida 加入 2026 年一系列用「VLM 在回饋迴圈裡的判斷」取代脆弱幾何機制的系統行列,並把這個模式從 2D 螢幕延伸到 3D 視窗。如果閉環 GUI 操作在 gizmo 操縱上站得住腳,同一套模板合理外推到綁定骨架(rigging)、物理參數調校等「目標容易看、難以公式化」的編輯器任務。對任何打造量產級 real-to-sim 拍攝管線的人,這篇論文編輯評註的結論值得釘在牆上:把精度推到管線末端,讓每個階段只消耗真實拍攝真正給你的東西。
論文作者為 Minghan Qin、Yuang Wang、Xiuyu Yang、Yushi Long、Yujian Zhang、Ruihuan Wang、Kai Ye、Yangang Zhang 與 Hang Li,專案頁面位於 lucida-r2s.github.io。