← All posts / Models

開放權重回焦易主:小米 MiMo-V2.6-Pro 以不到 300 萬美元追平 Grok 4.7

小米以 MIT 授權開源的 MiMo-V2.6-Pro 在 Artificial Analysis 智慧指數拿下 46 分,成為全球最強的開放權重模型——而這一切只花了一輪 262 萬美元的強化學習訓練。

開放權重回焦易主:小米 MiMo-V2.6-Pro 以不到 300 萬美元追平 Grok 4.7

多年來,最強的開放權重(open-weight)AI 模型一直出自專業實驗室之手——DeepSeek、Z.ai、月之暗面(Moonshot AI)。本週,這頂王冠落在了一家以手機和電動車聞名的公司頭上。2026 年 9 月 21 日,小米發布 MiMo-V2.6 系列,旗艦模型 MiMo-V2.6-Pro 隨即在 Artificial Analysis 智慧指數(Intelligence Index)拿下 46 分:這是當前所有開放權重模型中的最高分,追平了 xAI 剛發布的 Grok 4.7,並從 Z.ai 的 GLM-5.3 與月之暗面的 Kimi K3(均為 44 分)手中奪走榜首。相較自家上一代,跳升幅度更為驚人——MiMo-V2.5-Pro 在同一指數上只有 26 分。

不過,真正讓整個產業議論紛紛的,是那份帳單。小米表示,他們靠一輪約 262 萬美元的強化學習(RL)訓練就達到了這個成績——用不到 300 萬美元,就填補了與閉源前沿模型之間的大部分差距。

這次發布了什麼

MiMo-V2.6 系列共有三個層級:

  • MiMo-V2.6-Pro——稀疏混合專家(MoE)模型,總參數量 1.02 兆,每個 token 僅啟用約 420 億參數。
  • MiMo-V2.6-Flash——輕量版,總參數 3,090–3,100 億、啟用 150 億,透過同一套流程訓練,成本約 85 萬美元。
  • MiMo-V2.6-Pro-UltraSpeed——小米宣稱輸出速度提升至 20 倍、品質完全不變的變體,價格為標準 Pro 的十倍。

三者皆原生支援文字、影像、語音與影片輸入(輸出為文字),上下文視窗達 100 萬 token。模型權重以 MIT 授權發布於 Hugging Face——這是現存最寬鬆的授權條款之一——同時附上一個基於 Qwen3.5 的 90 億參數蒸餾模型、完整技術報告、超過 7,000 個強化學習環境,以及訓練程式碼。有 Bluesky 評論者稱之為「有史以來附帶資源最齊全的前沿模型技術報告」。

幕後團隊由前 DeepSeek 研究員、現任小米 MiMo 團隊負責人羅福利(Fuli Luo)領軍,據 VentureBeat 報導,共有「數十人」投入這項強化學習計畫。

战力如何

在 Artificial Analysis 的總排行榜上(開源與閉源模型同榜較勁),MiMo-V2.6-Pro 位列第六,排在其前的全是專有模型:

模型AA 智慧指數
Claude Fable 5.1(Anthropic)53
GPT-6 Astra(OpenAI)53
Claude Opus 5(Anthropic)51
Muse Spark 1.3(Meta)48
GPT-5.6 Sol(OpenAI)47
MiMo-V2.6-Pro(小米)46
Grok 4.7(xAI)46
Gemini 3.8 Flash(Google)41
DeepSeek V4.1 Pro(DeepSeek)36

距離榜首只差 7 分,距離下一個專有模型僅 1 分。對一套可以下載、自行部署的開放權重系統而言,這個差距薄得驚人。

小米自己公布的基準測試成績則更為立體,有明顯強項,也有一處軟肋:

  • 資安能力:Pro 在 CyberGym 拿下 94.0;Flash 更以 95.1 奪冠,領先 DeepSeek V4.1 Flash(88.1)與 GLM-5.3(84.5)。
  • 工具呼叫:Toolathlon-verified 上拿到 76.9,勝過 GPT-5.6 Sol(74.9),僅略遜於 Claude 系列。
  • 經濟相關任務:GDPVal 拿下 1,673 分,總排第三,只落後 Claude Fable 5.1(1,735)與 Claude Opus 5(1,708)。
  • 軟體工程:DeepSWE v1.1 上 71.9 分,對比 Claude Opus 5 與 GPT-6 Astra 的 74.0。
  • 視覺程式設計:小米內部測試 72.3 分,高於 Claude Opus 5(70.0),低於 GPT-6 Astra(82.2)。
  • 軟肋所在:長時終端機任務。Pro 在 Terminal Bench 4.0 僅 34.9 分,遠低於 GPT-6 Astra 的 59.6 與 Claude Opus 5 的 49.0;ExploitGym 同樣偏低(17.8),明顯落後專有領先群。(在較舊的 Terminal Bench 2.1 上則有 89.9 分的健康水準。)

經濟學:以「分」計價,而非「元」

MiMo-V2.6-Pro 最突出的其實是成本結構。Artificial Analysis 估算其每個智慧指數任務的花費約 0.11–0.13 歐元,使其落在「智慧 vs. 價格」的帕累托前沿(Pareto frontier)上。OfficeChai 估計,同樣的工作量,成本約為國際領先模型的二十分之一到六十分之一。輸出速度也不含糊:每秒約 125 個輸出 token,在 114 個受測模型中排第 12。

唯一被點名的低效之處是「囉嗦」——模型跑完整套指數測試燒掉了 1.4 億個輸出 token,與本週 Grok 4.7 遭到的 token 消耗批評如出一轍。

API 定價與上一代持平:Pro 為每百萬輸入 token 0.435 美元、每百萬輸出 token 0.87 美元(快取命中享 99% 折扣);Flash 為 0.14/0.28 美元。模型可透過小米 AI Studio、MiMo Code、剛結束搶先體驗的 MiMo Desktop 應用、小米自有 API 平台以及 OpenRouter 使用。

「You Only RL Once」

小米將這波能力躍升歸功於在可驗證複雜任務上大規模開展的強化學習。在不到六天內,Flash 與 Pro 各自完成了 30 個 RL 步驟、涵蓋約 75 萬條軌跡——Flash 花費約 74 萬歐元,Pro 約 228 萬歐元。在留出的 DeepSWE v1.1 基準上,Pro 從 58.4 分爬升到 72.6 分,Flash 從 48.8 升至 65.7。訓練每次更新使用 1,568 個樣本、採全非同步架構,上下文長度最高 100 萬 token。小米表示,整個生產級訓練過程是以直播方式對外公開進行的。

方法論上最有特色的選擇是:團隊沒有逐項能力分開訓練,而是讓編碼、通用代理、視覺與資安任務跑在同一輪統一訓練中——小米將其命名為「You Only RL Once」。權重之外同時釋出訓練環境與 RL 程式碼,意味著這項宣稱原則上是可重現的。

從 Vibe Coding 到「Vibe World」

小米的核心論述是:編碼能力如今已能泛化到軟體工程之外——他們稱之為「Vibe World」。示範案例從依圖片、影片或文字提示生成帶互動邏輯的 3D 場景、在 Blender 建模 3D 物件、透過多機頭控制 Franka Panda 機械手臂,到一句話生成前端介面與簡報、影片剪輯配樂,甚至為約十件樂器編寫管弦樂譜並自行轉為 MIDI。

兩個研究案例尤其亮眼。其一,與小米材料科學家合作,模型設計出一種可吸附 PFAS「永久化學物質」的新型金屬有機框架——過程中自主查閱文獻與專利,並以開源模擬工具計算結合強度。其二,協助將李天岩與 James Yorke 的經典論文《Period Three Implies Chaos》主定理在 Lean 4 中形式化,產出超過 6,000 行證明程式碼,並全數通過 Lean 核心驗證。

為什麼重要

這次發布之所以不只是排行榜上的一次閃光,有三個原因。第一,入場價格:如果一家硬體集團能用不到 300 萬美元的 RL 算力登上開放權重榜首,前沿附近能力的邊際成本就不斷在崩落——美國閉源實驗室面對的降價壓力,計價單位已經從「美元」變成「美分」。第二,授權:MIT 權重加上訓練程式碼與環境,是前沿 AI 所能達到的最開放狀態,它交給每位研究者和企業的是一個可重現的實體,而非一句行銷話術。第三,來源:小米本質上是一家裝置公司。它登上開放權重榜首,象徵「接近前沿的模型訓練」正在從少數實驗室的專利,變成一門主流的工程學科。

當然,但書必須寫清楚。RL 成本是廠商自述數字,並未經獨立稽核,而且可能反映競爭對手在公有雲上無法複製的內部算力補貼。模型在長時序終端任務與攻擊性資安任務上仍明顯落後——而那正是代理式 AI(agentic AI)前進的方向。排行榜也只是快照:若下一次 Artificial Analysis 更新時 Meta 的 Muse Spark 1.3 或 GPT-5.6 Sol 繼續上探而 Pro 停在 46 分,小米的宣稱就只是一瞬,而非趨勢。

但就此刻而言,全球最強的開放權重模型來自一家手機廠——而且你可以下載它、檢視它、親手重跑它的訓練流程。