從模擬世界到親手操作:HiDream 推出 O1-Embodied,奪下 RoboColiseum 最難排行榜榜首
HiDream.ai 發布具身世界模型 HiDream-O1-Embodied,以 0.692 分登上 RoboColiseum 魯棒性排行榜第一名,並以 Noitom 動捕資料結合 100 倍生成式擴增打造資料飛輪。
就在不到一個月前,北京的新創 HiDream.ai 才以互動式影片世界模型 HiDream-O1-World 拿下 WBench Navi 子排行榜冠軍(平均分 80.9)。今天,這家公司跨出了更艱難的一步:正式發布HiDream-O1-Embodied——一個具身世界模型(embodied world model),目標是讓 AI 走出數位模擬,直接與物理世界互動。
這次發布不只是一張產品路線圖上的又一個檢查點。它具體展示了中国最具企圖心的 AI 實驗室之一,如何把「世界模型」這個論述——也就是下一代基礎模型必須內化物理、因果與動作,而不只是處理文字與像素——落成實際運作的系統;也展示了具身智慧最棘手的瓶頸,正在被一種截然不同的資料方法所突破。
為什麼魯棒性才是關鍵排行榜
伴隨著這次發布,HiDream-O1-Embodied 同步在 RoboColiseum——一個具身智慧模型的標準化模擬評測平台——完成公開首秀,並以 0.692 的平均分直接登上魯棒性(Robustness)排行榜第一名。
RoboColiseum 並非玩具級基準。該平台從四個面向評測模型:指令遵循、空間理解、魯棒性與通用操作,透過四張能力排行榜與 78 項高傳真模擬任務,力求貼近真實機器人的表現。平台對全球大學、研究機構與模型開發者開放,進入內部測試階段以來已吸引數十個來自中國與海外的領先模型。
在四個評測面向中,魯棒性被普遍認為最困難,也最能預測實務價值。它不在理想化的實驗室「溫室」裡測模型,而是刻意變動背景、光照、材質、機器人初始狀態、相機位置與影像品質,同時加入多種改寫版本的指令。它測的正是擊垮大多數機器人部署的場景:當世界不配合時,系統還能優雅地維持多少能力。
在這張排行榜上以 0.692 居冠,代表 HiDream-O1-Embodied 能在遮擋、光照變化、相機失準、指令充滿雜訊這類干擾下——恰恰是讓單視角、關鍵字比對型機器人直接罷工的條件——仍然穩定完成任務。
三個執行層面的技術推進
魯棒性成績的背後,是 HiDream 在執行層面的三項核心能力。
超越關鍵字比對的語言理解。 傳統機器人把指令當關鍵字查表:「把杯子拿給我」行得通,換成「幫我拿個杯子」或「杯子遞一下」就可能默默失敗。HiDream-O1-Embodied 覆蓋了一個涵蓋多樣動詞、句構與表達方式的等價指令空間,關注的是指令背後的意圖而非字面措辭。無論怎麼換句話說,模型都能正確辨識使用者真正想要什麼。
多視角視覺協同。 在物理世界裡,機器人的視覺輸入鮮少理想:相機位置會偏移、標定會隨時間漂移、單一路鏡頭會被遮擋。與其依賴單一固定視角,O1-Embodied 整合多個視角的資訊,讓不同視覺通道互為補位。當某一路畫面失準或暫時不可用時,其餘視角仍能支撐場景理解與任務執行。設計目標講得很明白:把「單點故障導致全系統失效」轉變為「局部受限不妨礙整體運作」。
訓練進骨子裡的容錯力。 多數模型用「完美」資料訓練——清晰影像、完整畫面、標準化視角——而真實世界幾乎從不提供這些條件。HiDream-O1-Embodied 在訓練時主動注入大量非理想條件,反覆讓模型暴露於不完整、有雜訊、不穩定的資訊,直到「從有限視覺線索做出可靠決策」成為預設行為。這個模型刻意不是為理想條件下的峰值表現最佳化,而是為複雜動態環境中的穩定執行而設計。
100 倍的資料飛輪
整份公告中戰略上最耐人尋味的部分,不是排行榜分數,而是背後的資料範式。高品質具身資料仍是這個領域最稀缺、最具決定性的資源——機器人示範資料收集成本高、擴增慢、覆蓋面窄。HiDream 的答案是「真實世界基底 + 生成式擴增」的資料生產範式:模型主動參與創造自己進步所需要的資料。
最具代表性的例子是與動作捕捉廠商 Noitom(諾亦騰) 的合作。以 Noitom 的高精度人體動捕資料作為真實世界基底,HiDream 利用其原生全模態生成能力實現 100 倍規模的資料擴增:從單一真實動作樣本出發,模型透過改變背景環境、光照條件、物體形態與場景配置,生成物理一致的视频變體——在不破壞底層物理約束的前提下,產出大量且多樣的訓練樣本。
這個機制優雅地自指:模型同時扮演學生與老師,針對自己下一步需要加強的能力,生成有針對性的訓練樣本。這形成了一個資料與模型持續互相強化的成長飛輪——對依賴線性人力收資料的競爭者來說,這種複利迴圈極難追趕。
逐漸成形的世界模型矩陣
HiDream 的技術長姚霆(Ting Yao)用三項核心能力來框架這次發布:一個完整的世界模型基礎需要全模態表徵、因果推理與物理世界建模——三者都以在真實世界中表達、理解與生成為中心。「HiDream.ai 的原生全模態世界模型架構從一開始就設計成支援跨模態(包括動作)的統一表徵,」姚霆說,「HiDream-O1-Embodied 的發布是我們技術路線圖上的關鍵里程碑——我們正從模擬世界,走向讓 AI 在真實世界中操作。」
產品線的排序本身就說明了故事。HiDream-O1-Image——那個以 Pixel-level Unified Transformer 為基礎的開源原生統一圖像生成模型——處理生成;不到一個月前發布的 HiDream-O1-World 處理數位環境中空間、時間、運動與物體關係的理解與推理,以 80.9 分登上 WBench Navi 子榜第一;如今的 HiDream-O1-Embodied 則處理物理環境中的操作與執行。創辦人兼執行長梅濤博士(Dr. Tao Mei)此前便主張,下一代基礎模型的競爭不在於單一模態的能力提升,而在於從單模態走向多模態、最終走向原生統一的全模態智慧——而這家公司正一步一步把那個統一堆疊組裝起來。
意義何在
競爭層面的影響有兩個方向。對具身 AI 領域而言,RoboColiseum 魯棒性成績為「可部署」設立了新的公開參考點:它把評測對話從「策展環境中的成功率」轉向「對抗式真實變異下的穩定性」——而後者才是倉儲、家庭與醫療場景商業部署的真正門檻。
對更大範圍的基礎模型競賽而言,HiDream 的資料飛輪是更深層的訊號。如果一個實驗室能在保持物理一致的前提下,用生成式擴增把稀缺的真實收資放大 100 倍,那麼「我們收的機器人資料比你多」這條傳統護城河就會流失,新的護城河變成生成模型本身的品質與原生多模態性。這是一個偏袒生成式底子深厚的公司的賭注——也解釋了為什麼以開源圖像生成起家的 HiDream,如今大舉押注具身智慧。
模擬排行榜與物理現實之間的落差依然存在——0.692 是 RoboColiseum 的模擬分數,不是倉庫實測。但隨著 O1-Embodied 的推出,HiDream 已經證明:它橫跨圖像、影片、3D 乃至動作所打造的世界模型架構,不是投影片裡的願景,而是一個有著可量測、排名第一的魯棒性表現的出貨系統。從模擬世界到親手操作,這一步已經正式跨出。
Sources
- [1] https://asianews.network/hidream-ai-launches-hidream-o1-embodied-extending-its-native-omni-modal-world-model-strategy-into-physical-interaction/
- [2] https://www.malaysiaworldnews.com/hidream-ai-launches-hidream-o1-embodied-extending-its-native-omni-modal-world-model-strategy-into-physical-interaction/
- [3] https://www.newspressnow.com/news/national_news/business/hidream-ai-launches-hidream-o1-embodied-extending-its-native-omni-modal-world-model-strategy-into/article_d542d65c-ebde-5807-9ccd-e98c097d2e75.html
- [4] https://hidream.ai/