← All posts / Models

You Only RL Once:小米開源 MiMo-V2.6 Pro 與 Flash,代理任務成績直逼 Claude Opus

小米以 MIT 授權釋出 MiMo-V2.6 系列:1.02 兆參數的全模態旗艦在 DeepSWE 拿下 71.9、Agents' Last Exam 31.6,加上 309B 的 Flash、蒸餾版 9B,連 RL 訓練環境一併公開。

You Only RL Once:小米開源 MiMo-V2.6 Pro 與 Flash,代理任務成績直逼 Claude Opus

9 月 21 日約 15:39 UTC,Hugging Face 上的 XiaomiMiMo 組織悄悄將三個儲存庫設為公開:MiMo-V2.6-Pro-RL、MiMo-V2.6-Flash-RL 與 MiMo-V2.6-Distill-Qwen-9B。沒有發表會、沒有直播、沒有倒數。過去一週小米透過公開儀表板直播強化學習訓練過程——熵曲線、基準檢查點、甚至一次坦承的 VRAM 當機——的那個模型,權重就此以 MIT 授權開放任何人下載。

這為近年開源權重史上最不尋常的一次發布週期畫下句點。多數前沿實驗室是在出貨後才發布一份精心整理的技術報告;小米則是在發布前一週,讓所有人公開看著模型變強。現在成品全部攤在陽光下:兩個稀疏混合專家(MoE)模型、一個蒸餾學生模型,以及足以自行部署的架構細節。

這次釋出了什麼

旗艦 MiMo-V2.6-Pro-RL 是總參數 1.02 兆、啟動參數 420 億 的稀疏 MoE——規模與前代 V2.5 相當,但這次是原生全模態:文字、影像、視訊、音訊走進同一個模型,上下文長度 100 萬 token。視覺由 6.81 億參數的 MiMo ViT 編碼器處理(28 層:24 層滑窗 + 4 層全域注意力),音訊由 3.08 億參數的 AudioTokenizer 搭配 1.27 億參數的音訊 patch 編碼器(每 patch 四幀)負責。一個 5 層的多 token 預測(MTP)起草器每次前向傳遞預測 7 個後續 token,用於投機解碼。

兄弟作 MiMo-V2.6-Flash-RL 保留全模態設計但大幅壓縮:總參數 3,090 億、啟動 150 億,256 個路由專家每次觸發 8 個,同樣支援 100 萬 token 上下文。兩個模型共用混合骨幹——Pro 版為 70 層,其中 60 層滑窗注意力、10 層全域注意力——稀疏 FFN 中沒有共享專家。

第三個釋出項目最容易被忽略:MiMo-V2.6-Distill-Qwen-9B,從旗艦蒸餾而來的 90 億參數學生模型,外加 RL 訓練環境本身。對一個看慣了「實驗室給權重、不給鷹架」的社群來說,把訓練環境一起公開,可能才是這次投放更大膽的那一半。

成績單

模型卡裡的評測表對企圖心毫不掩飾。代理編碼方面,MiMo-V2.6 Pro 在 DeepSWE v1.1 拿下 71.9——距 Claude Opus 5(74.0)僅 2.1 分,領先 GPT-5.6 Sol(73.0)與 Claude Fable 5(70.0)。但真正的故事是與前代的對比:MiMo-V2.5 Pro 在同一基準只有 19.0。一個世代,進步 52.9 分。

通用代理呈現同樣格局。Toolathlon-Verified 上 Pro 拿 76.9,對比 Opus 5 的 80.6;AutomationBench v1.0.6 拿 53.1,領先表上所有閉源對手(Opus 5 為 50.3);Agents’ Last Exam 與 Opus 5 同為 31.6;Terminal Bench 2.1 拿 89.9,小勝 Opus 5 的 89.1。某些項目差距仍然明顯——ExploitBench 閉源模型拿 78.5 而 Pro 為 47.9,Terminal Bench 4.0 仍是閉源強項(49.0 對 34.9)——但趨勢無可誤認:在代理任務上,開源前沿已逼近到誤差範圍內。

第三方量測也支持這個說法。Artificial Analysis 給 Pro 模型 46 分智慧指數,為開源權重模型史上最高。在小米內部測試環境,DeepSWE 為 72.57(Pro)與 65.68(Flash)。

You Only RL Once

真正有趣的工程在於能力怎麼煉出來的。團隊的說法是「將強化學習規模化以邁向自我改進」,模型卡描述的配方確實少見:

  • 單一混合 RL 執行涵蓋編碼、通用代理、視覺與資安四大領域——「You Only RL Once」——而非按領域分開做後訓練。多個測試環境的任務混進同一批次,讓能力互相強化、策略可遷移到訓練時沒見過的環境。
  • 全非同步 GRPO 搭配超大批次:每步 1,568 個提示 × 16 個 rollout,每次更新數十億 token。
  • 群組代理評分構成自我改進迴路。二元通過/失敗無法為「都通過」的解法排序,所以小米連評分器一起規模化:Groupwise Reward Synthesis 離線從對比 rollout 建立任務專屬評分規則,Groupwise Advantage Redistribution 線上為通過的軌跡排序,把優勢移向更高品質的解法。以模型自身樣本為裁判,這個迴路促使模型走向更短路徑、更少 token。
  • 對齊的 RL 從冷啟動開始——模型從自我修正出發,把自己未對齊的回合改寫成有根據的下一步——訓練全程以環境強化、對抗篩選與驗證器交叉檢查防守 reward hacking。
  • MOPD2:混合 RL 之後的多前綴多教師同策略蒸餾,結合學生自主 rollout 與前綴條件化的教師/SFT rollout,讓難以驗證的任務也能訓練決策點,不必重新生成整段歷史。

資安成績暗示混合訓練確實外溢到純編碼 RL 觸及不到的地方:CyberGym 94.0/95.1(Pro/Flash)、MiMo Cyber Bench 80.2/77.2,對比 V2.5 Pro 的 40.0 與 0.0。

自己跑

SGLang 與 vLLM 的部署配方都已公開。Pro 的 SGLang 參考配置不算親民——tensor parallel 16、expert parallel 16、DeepEP all-to-all、雙節點、多層 EAGLE 投機解碼——但 Flash 版 150 億啟動參數讓認真的單節點設備也能負擔,預建的 vllm/vllm-openai:mimov25-cu129 映像檔可直接沿用。建議取樣參數:temperature 1.0、top-p 0.95。模型也透過小米 Open Platform API、AI Studio、MiMo Code 終端代理、MiMo Desktop 與 OpenRouter 提供服務;Xiaomi 平台上的 UltraSpeed 版本宣稱推理吞吐最高 20 倍。

為什麼重要

這次發布不只是一次權重傾倒,原因有二。第一,MIT 授權、零使用限制,讓一個逼近前沿的代理模型直接進入可商用區——時間點正好卡在 Harvey、Abridge、Decagon、Ramp 等企業 AI 新創因閉源模型 token 經濟學壓垮毛利、公開轉向開源權重的當口。一個在 Agents’ Last Exam 與 Claude Opus 5 打平的 46 分全模態代理,現在是「可以拿來蓋產品」的選項,而非研究標本。

第二,這次發布完成了一場透明化實驗。一週的 RL 直播已是創舉;連 RL 環境都隨權重一起釋出,代表社群有機會重現整個迴路,而不只是拿到模型。前代的成績單也幫了忙:MiMo-V2.5 Pro 在本地 LLM 圈建立了真實採用,Reddit 對 V2.6 的反應則是預期中的組合——對基準成績興奮,同時提醒「實際表現可能因情境而異」。

開源權重競賽一直是中國實驗室之間的跳蛙遊戲——Kimi、Qwen、DeepSeek、StepFun,現在又輪到小米。9 月 21 日起,領先徽章暫時別在 MiMo-V2.6 Pro 身上。能戴多久沒人說得準;以這個節奏,答案是幾週,不是幾個月。