會生成影片的模型,如今開始開機器人:Black Forest Labs 開源 FLUX 3 Action
Black Forest Labs 釋出 7B 開放權重的世界動作模型 FLUX 3 Action,以 44% 的參數量在 RoboLab-120 榜單上超越 Nvidia Cosmos 3 Nano 奪下第一。
過去兩年,Black Forest Labs(BFL)靠著開放權重的影像生成模型,成為開源生成媒體生態的事實標準。這週,它走進了一個全然不同的戰場。9 月 22 至 23 日,該公司低調地將完整的 FLUX 3 Action 模型集發布到 Hugging Face:一個 70 億參數的「世界動作模型」(world action model),輸入攝影機畫面、機器人狀態與文字指令,輸出下一批馬達動作——而且這些動作是與「預測的未來影片帧」一起去噪、一同生成的。權重、微調配方、以及兩個標準機器人平台的即用策略(policy)全部公開,而這個模型也已經在 RoboLab-120 基準上,超越了 Nvidia 更大的 Cosmos 3 Nano,登上榜首。
這次到底釋出了什麼
這次發布是一個由三個倉庫組成的模型集,而非單一檢查點:
- flux-3-action-base — 適配骨幹:457 個張量,涵蓋視訊與文字流、共享動作主幹,以及兩個動作頭(ee50 與 gaming)。BFL 明講這不是一個完整的機器人策略,而是讓你適配到新機體(embodiment)的元件,外加凍結的共享編碼器——一個視訊 VAE,以及一個原封不動、依原始 Apache-2.0 條款保留的 Qwen3-VL-4B-Instruct 文字編碼器。
- flux-3-action-so101 — 針對開源社群機械手臂 SO-101 的即用策略,以
lerobot/community_dataset_v3中的 SO-101 影集訓練。觀測/動作合約寫得一清二楚:兩台攝影機(scene 與 wrist)、六個狀態維度、關節差量動作加上絕對夾爪,一次預測 42 個動作、以 30 Hz 執行 32 個後重新規劃。 - flux-3-action-droid — 以 DROID 資料集微調、對應 Franka 架構的策略:三台 RGB 攝影機、七個手臂關節加夾爪開合度,以 15 Hz 輸出 32 個絕對關節命令。
全部整合進 Hugging Face 的開源機器人框架 LeRobot——一行 Flux3Policy.from_pretrained() 就能載入策略,隨附的 lora.json 配方(rank-32 LoRA、BF16 混合精度、10,000 步)讓任何人都能微調到新的機器人、模擬器、甚至遊戲上。在部署彈性上,DROID 包一次附上六種最佳化變體:BF16、FP8、引導蒸餾(guidance-distilled)與步數蒸餾(單步)版本的任意組合。
真正關鍵的數字
在 RoboLab-120——Isaac Sim 中 120 項桌面操作任務、每項 10 次嘗試、使用 DROID 式 Franka 設定——FLUX 3 Action 拿下 42.92% 的任務成功率。模型卡裡的比較表寫得毫不客氣:
| 模型 | 類型 | 成功率 | 參數量 |
|---|---|---|---|
| FLUX 3 Action | WAM | 42.92% | 7B |
| Cosmos3-Nano-Policy | WAM | 36.8% | 16B |
| π0.5 | VLA | 28.0% | 3.3B |
也就是說:用大約 44% 的參數量,領先 Nvidia 先前最好的開放模型 6.1 個百分點,而且 BFL 回報運行速度最快可達 3.95 倍。離開模擬器,該公司回報在真實 Franka 手臂上單物成功率 93.3%,在 DROID 真實世界評測影集上 30 次成功 28 次。
成本面同樣值得注意:BFL 引述的 H200 範例,單次 roll-out 成本 0.087 美元,平行化之後每個成功樣本約 0.0018 美元——這個數量級的定位,把機器人策略的迭代成本拉到接近一般推理工作負載的經濟學,而非傳統機器人研究的預算規模。
為什麼「世界動作模型」才是重點
上面的表格特意區分了 WAM(世界動作模型)與 VLA(視覺-語言-動作)。像 π0.5 這樣的 VLA,是把感知直接映射到動作;而 WAM 是同時預測未來畫面與未來動作——讓 FLUX 在影像與影片上成名的同一套去噪機制,現在要一邊「想像」機器人移動後場景會變成什麼樣子,一邊把關節軌跡作為同一趟生成過程的輸出。
這正是 BFL 自 7 月 FLUX 3 發布以來鋪陳的路線:當時該公司與合作夥伴 mimic 展示了這個模型家族的動作預測頭,在 Audi 生產線上進行操作測試。那次發布中,Action 元件採閘門式早期存取。本週的意義就在於開閘:基底權重、兩個完整策略、LoRA 微調配方、基準方法學與硬體指引,如今任何人都能下載,採 FLUX Kommunity License v1.0 授權(Qwen 文字編碼器維持 Apache-2.0)。
安全框架——少見地具體
模型卡的 out-of-scope 章節,讀起來像是出自一群預期這些權重「真的會去控制硬體」的人之手:FLUX 3 Action 輸出的是關節目標值,而模型本身對關節速度、力度、工作空間毫無約束——應用端必須自行設限、確保硬體急停觸手可及,並在靠近人員操作前,先在模擬器中驗證或開啟機械臂安全限制。禁止用途包括:在無人類監督且無停止手段的情況下控制可能傷人的機械,以及全自動的高風險決策。BFL 同時引用了自家的濫用防制論文《Capable, Open, and Safe: Combating AI Misuse》,並公布安全通報信箱。
競爭格局解讀
三個理由,讓這次發布不只是機器人圈的小事。
第一,它在 Nvidia 最擅長的賽道上打敗了 Nvidia。 Nvidia 整個 2026 年都在把 Cosmos 包裝成開放的 Physical AI 技術棧,與自家的模擬器和 GPU 生態系緊密綁定。一家做影像生成的實驗室,用 7B 模型在分數上壓過 16B 的 Cosmos 策略——還跑得更快——正是那種會重塑「機器人基礎模型從哪來」這個假設的排行榜結果。
第二,它驗證了「生成即動作」的命題。 如果影像模型學到的世界動力學可以直接收割成馬達控制,那麼生成媒體背後數以兆計的視覺預訓練 token,就成了具身智慧(embodied AI)可轉移的資本。BFL 現在是這個想法在開放權重陣營最醒目的證明,而且同一個模型家族同時產出影像、原生音訊影片與機器人動作,讓訓練投資在賺錢的產品線與研究線之間共用。
第三,它的「開放」是可營運等級的。 這不是那種「丟出權重就算」的發布。完整的觀測合約、正規化檔案、取樣參數(Euler 步數、shift、guidance 值、種子)、六種蒸餾變體、社群資料集血緣,加上一份 LoRA 配方——意味著一個有機械手臂的實驗室,可以現實地在幾天內從下載走到微調完成的策略。基底檢查點裡那個 gaming 動作頭,也暗示了 BFL 認為下一批機體會從哪裡長出來。
幾個值得保留的但書
RoboLab-120 是模擬基準,模擬到真實的落差始終是這個領域最愛講的保留條款;BFL 的真實世界數字是自報的、而且只在兩個平台上。Kommunity License 嚴格來說並非 OSI 意義上的開源,商用者應細讀條款。而 42.92% 的成功率雖是第一,仍代表在這個最難的榜單上,模型多數時候是失敗的——這是研究前緣,不是可以部署的倉庫作業員。
即便如此,方向已經很清楚。讓 FLUX 成為影像生成生態骨幹的那套開放權重打法——放出基底、附上配方、讓社群去長出應用的長尾——如今被指向了物理智慧。Nvidia 的 Cosmos、Physical Intelligence 的 π 系列,加上現在的 BFL,正從不同起點收斂到同一個想法,而開放榜單上,剛剛換了新的第一名。
Sources
- [1] https://huggingface.co/black-forest-labs/flux-3-action-base
- [2] https://huggingface.co/black-forest-labs/flux-3-action-droid
- [3] https://huggingface.co/black-forest-labs/flux-3-action-so101
- [4] https://venturebeat.com/infrastructure/black-forest-labs-debuts-flux-3-action-an-open-weights-ai-robotics-model-that-tops-the-leaderboard-at-half-the-size-of-its-competition
- [5] https://www.theneuron.ai/digest/everything-that-happened-in-ai-today-wednesday-september-23-2026/
- [6] https://bfl.ai/models/flux-3