← All posts / Models

訓練過程公開直播:小米即時串流 MiMo-V2.6 的 RL 運行,連當機記錄都看得到

小米在 MiMo-V2.6 還在訓練中時,就公開儀表板即時串流 Pro 與 Flash 兩條強化學習運行的原始指標——熵值、通過率、基礎設施錯誤率,甚至一條 VRAM 當機公告——這種開放程度沒有任何一線實驗室嘗試過。

訓練過程公開直播:小米即時串流 MiMo-V2.6 的 RL 運行,連當機記錄都看得到

一線 AI 實驗室的慣例是:模型上線後,才發布修飾過的技術報告。小米反其道而行——在 MiMo-V2.6 系列還在訓練途中,就開放了一個公開儀表板,即時串流兩條強化學習(RL)運行的原始指標:mimo-v2.6-pro 與 mimo-v2.6-flash,資料直接來自訓練器的日誌,隨運行進度即時更新。

這個頁面自 9 月 16 日約 04:00 UTC 起活在 mimo.xiaomi.com/rl/,即時重繪策略熵、策略梯度損失、梯度範數、軌跡平均獎勵與通過率直方圖。這是 agentic RL:提示被分為 code、general、cyber、visual、chat 五類,模型在沙箱環境中練習,頁面上還有執行中環境數的即時計數。基準檢查點隨運行推進陸續到達,團隊把離線評測結果張貼到公告欄。

串流內容到底是什麼

儀表板釘選的頭條指標是 dynsam/avg@n——對每一步抽樣的提示,其 n 次嘗試中成功的比例,再對所有提示取平均。圍繞它的是平常絕不會離開實驗室的內部數據:每 token 策略熵(actor/entropy_loss)、裁剪後的策略梯度目標、裁剪前的全域梯度範數、推論引擎與訓練器在同一批 token 上的 KL 散度、每條軌跡的平均 agent 輪數,以及因基礎設施故障而損失的序列占比。

基準饋流已經在講故事了。在 DeepSWE v1.1(mini-swe-agent,avg@3)上,Flash 運行從第 1 步的 48.67 爬升到第 12 步的 60.77,Pro 運行則從第 1 步的 58.41 走到第 10 步的 63.72。這是一個權重尚未公開的模型的檢查點評測——社群等於是在即時旁觀一個模型在 agentic coding 上變強。

公告欄是透明度變得不尋常的地方。一則時間戳為 9 月 16 日 20:08 UTC 的條目直白寫著:「mimo-v2.6-pro 運行因某節點的 VRAM 問題正在重啟。」沒有公關話術、沒有靜默重試——一場前線級訓練運行中的硬體故障,在發生後幾分鐘內就被公開披露。另一則公告確認團隊會在離線評測完成後持續更新 DeepSWE 結果。

為什麼重要

產業常規是一個封閉迴路:祕密訓練、私下評測,然後在發布時搭配一份精心策劃的技術報告。即使是最開放的實驗室——那些釋出權重與詳盡論文的——也是事後才發布,訓練敘事可以在後見之明下被塑造。小米把這個順序倒轉:「報告」正在以訓練器日誌的形式被即時書寫,而且沒有人知道結局。

這個舉動落在特定脈絡裡。上一代的 MiMo-V2.5 Pro 是 1T 參數的 MoE,在 agentic coding 與長文本工作上能與貴上許多的 API 競爭,因此在開放權重社群累積了真實的口碑。V2.6 的期望之所以高,正是因為 V2.5 超出預期。透過串流運行過程,小米把這份好感轉化為即時參與——同時做出一個難以造假的承諾:數字要嘛在公開場合向上走,要嘛不會。

還有研究層面的意義。RL 訓練曲線是前線模型開發中最缺乏文檻的環節之一。熵塌縮、reward hacking 漂移、大型 agentic RL 運行期間的基礎設施錯誤率,多半只存在於傳聞討論。把這些量——包括難看的那部分,如損失於基礎設施故障的序列占比、rollout 平均 staleness——以即時公開串流呈現,給了研究社群一窺真實大型運行的稀有縱切面。

社群反應

儀表板在幾小時內登上 r/LocalLLaMA,引來的討論不出所料:對透明度的興奮,摻雜著對訓練曲線能與不能證明什麼的內行質疑。留言者指出後訓練不只是 RL——資料篩選與混合決策發生在離線階段,依然不可見——而且上升的通過率曲線不保證最終檢查點能在關鍵基準上過關。反覆出現的主題是:好看歸好看,但「不開權重就等於沒發生」。

這是正確的框架。串流是承諾機制,不是產品。關於頁面只寫著:「我們正在串流我們的 RL 大運行。MiMo-V2.6 系列即將推出。」沒有發布日期、沒有基準宣稱、沒有定價。只有一句頁尾——「Open is what we value.」——和兩條活著的曲線。

但要看清楚

值得直白說明這不是什麼。儀表板呈現的是小米選擇呈現的:訓練端指標與自報的基準檢查點,尚無外部評測。即時曲線排除不了被挑選過的資料混合,而策劃過的提示來源上的 agentic-RL 通過率,也不必然能遷移到混亂的真實任務。DeepSWE 數字按團隊自己的節奏到達,「離線評測結果出來就貼」。

而且已經有一條運行在串流途中重啟——這要嘛是誠實披露,要嘛是提醒你:串流呈現的是一個混亂物理過程的平滑版本。大概兩者皆是。

展望

對追蹤開放權重前線的人來說,觀察重點很簡單:MiMo-V2.6 最終是否以真正開放的權重落地,而最終發布的基準能否乾淨地回溯到現在公開串流的這些曲線。如果能,小米將證明一件新事——極致的過程透明可以與前線水準的結果共存。如果不能,這個儀表板就會變成「透明表演」的案例研究。

無論如何,在這條運行結束前的每一天,你都可以在一個任何人都能造訪的網址上,旁觀一場前線級的 RL 運行思考——熵在升降、通過率在爬升、沙箱在崩潰。光這一點就已經打破了這個類型的規則。