2B 模型打贏 4B 級對手:OpenBMB 開源 MiniCPM5-2B,131K 上下文 plus 全套資料集一次奉送
OpenBMB 的 MiniCPM5-2B 在 34 項基準測試平均拿下 53.9 分,超越對比組中所有 4B 級模型,並以 Apache 2.0 授權釋出 131K 上下文、混合思考模式與完整 UltraData 訓練資料棧。
小模型之爭在這個秋天打出了最激進的一手。2026 年 9 月 7 日,源自清華大學 Big Model Base 研究團隊的開放實驗室 OpenBMB 發布了 MiniCPM5-2B——一個 25 億參數的稠密語言模型。它不僅在 2B 級距內自稱 SOTA,還直接超越了官方對比組中所有更大的模型,包括阿里巴巴的 Qwen3.5-4B。更重要的是,這個實驗室的招牌動作依舊:伴隨模型權重一起釋出整套訓練資料棧——預訓練語料、SFT 資料、RL 資料與中間檢查點,全部採用寬鬆的 Apache 2.0 授權。
數字會說話
MiniCPM5-2B 是 MiniCPM5 系列的第二個模型,接續今年稍早發布的 MiniCPM5-1B。從規格上看,它刻意走樸實路線:標準的 LlamaForCausalLM 架構、42 層、分組查詢注意力(16 個 query head 搭配 2 個 KV head)、總參數量 2,516,756,480(非嵌入參數 19.8 億),以及 131,072 token 的原生上下文長度——對這個尺寸的模型而言是相當少見的配置。
在 OpenBMB 公布的 34 項基準測試中,這個模型的平均分數是 53.9。這個數字大幅領先同級的 2B 對手:LiquidAI 的 LFM2.5-2.6B 平均 33.2,Qwen3.5-2B 得分 28.0,Google 的 Gemma-4-E2B-it 則是 24.6。但更引人注目的是跨級距比較:整個 4B 級參考組中表現最好的 Qwen3.5-4B,平均也只有 51.1。IBM 的 granite-4.2-3B 落在 42.7,Nemotron-3-Nano-4B 是 32.6,Gemma-4-E4B-it 為 31.2。一個 2.5B 模型在 34 項基準的綜合分數上壓過 4B 模型,正是會重塑採購直覺的那種結果。
獨立評測也大致佐證了這個說法。方法論與 OpenBMB 內部重現不同的 Artificial Analysis,給 MiniCPM5-2B 打出 Intelligence Index v4.2 的 15 分——低於 4B 總參數的開放權重模型中最高。即便換一個沒有訓練過這個模型的一方來量測,「此模型稱霸其量級」的方向性結論依然成立。
領先從哪裡來
次 4B 排行榜是一回事,個別基準的細節才是這次發布真正有趣的地方。
數學是最響亮的一欄。MiniCPM5-2B 在 AIME 2025 與 AIME 2026 都拿下 86.5,對比 Qwen3.5-4B 的 78.8/82.7 與 granite-4.2-3B 的 79.4/83.5。MATH-500 則有 94.6。僅僅兩年前,這種水準的競賽數學成績還是參數量大上好幾倍的模型才配擁有的前沿結果。
程式設計說著相似的故事。這個模型在 LiveCodeBench v6 拿到 69.1——比 Qwen3.5-4B 的 56.4 高出近 13 分——LCB-Pro 簡單組也有 68.0。在更硬的代理式編碼戰場上它依然稱霸自己的量級:SWE-bench Verified 得分 46.4,同級 2B 模型中次佳者只有 6.0,連 Qwen3.5-4B 本身都只有 33.6。不過在 SWE-bench Pro 上,較大的 Qwen 模型奪回領先(28.2 對 14.4),提醒世人複雜的多檔案倉庫工作仍然吃重原始參數量。
工具使用與長上下文是 OpenBMB 明顯為端側代理時代卡位的兩個領域。這個模型在客服工具使用基準 τ²-Bench Telecom 拿下 97.1,領先表中所有模型。在測試詞彙遮蔽下聯想召回能力的長上下文基準 NoLiMa 上,它得分 68.1,而多數對手直接崩到個位數——Qwen3.5-4B 勉強有 43.5,LFM2.5-2.6B 只有 0.7。原生 131K 上下文顯然不是裝飾品。
計分板上並非一片藍,這點必須說清楚。Qwen3.5-4B 在 MMLU-Pro(78.0 對 70.8)、MATH-500(99.0 對 94.6)、GPQA-Diamond(77.1 對 70.2)、IFBench、SWE-bench Pro 與 Terminal-Bench v2.1 上保持領先。誠實的總結是:MiniCPM5-2B 靠著程式推理、數學推理、工具使用、長上下文與代理任務的決定性優勢贏得總分,但在知識密集與多步驟終端機工作上讓出了部分廣度。
訓練配方:RL 教師模型的同策略蒸餾
剝開引擎蓋,MiniCPM5-2B 是 OpenBMB「UltraData 分層資料管理」方法論的旗艦示範,完整記錄於該實驗室的技術報告。訓練分三階段:基礎訓練、中期訓練與後訓練,而後訓練本身又拆成 SFT、RL,以及一個被實驗室稱為 OPD——同策略蒸餾(On-Policy Distillation)——的階段。
這個流程頗不尋常,值得細看。首先,4,000 億 token 的深度思考 SFT 資料建立推理與一般對話能力。接著 OpenBMB 訓練的不是一個、而是 16 個專門的 RL 教師模型——涵蓋數學、程式、代理任務與寫作,其中五個是代理專家——採用該實驗室 JustRL II 研究中基於 critic 的演算法,大幅提升訓練穩定性。最後,OPD 把這些教師蒸餾回單一個 2B 發布模型:在每個回應位置,以學生與教師 logits 之間的全詞表反向 KL 散度作為優勢估計,取代原本基於驗證的優勢,而蒸餾用的提示詞直接重用 RL 教師自己的訓練資料,不需要額外建構語料。
回報是量化的:RL + OPD 讓推理與一般能力平均提升 10.96 分,代理能力提升 6.96 分(相對於 SFT 基線)。換句話說,基準領先中有相當大的一塊並非來自預訓練,而是來自這條多教師蒸餾管線——其他小模型團隊現在得把這套配方視為參考實作,尤其 RL 資料本身(8 萬多筆樣本)也以 UltraData-RL-2609 之名開源了。
開放性可以說是這次發布的定義性特徵。除了最終的 BF16 模型,OpenBMB 還公布了純 SFT 檢查點、中期訓練檢查點、基礎檢查點、供 llama.cpp/Ollama/LM Studio 使用的 GGUF 版本、供 Apple Silicon 使用的 MLX 4-bit 版本、GPTQ 量化版,以及一個用於推測解碼、能加速推理且不改變輸出的 DSpark 草稿模型。資料面則包括 UltraX(網頁預訓練資料)、採 L0–L3 分層管理的 UltraData-Code、含 50 萬筆代理訓練樣本的 UltraData-SFT-Agent,以及 RL 語料。這幾乎是一份重現一個有競爭力小模型的完整開放配方。
為邊緣而生,到處都能跑
部署人體工學直接源於架構選擇。因為 MiniCPM5-2B 是標準的 LlamaForCausalLM,主流推理引擎可以直接載入——不需要自訂核心,也不需要 fork 模型程式碼。OpenBMB 為 vLLM(vllm>=0.21)、SGLang(工具呼叫的推薦後端,內建 minicpm5 解析器可將模型的 XML 風格工具呼叫轉為 OpenAI 相容的 tool_calls)、Transformers、llama.cpp、Ollama、LM Studio 與 MLX 都提供了完整文件。微調手冊則涵蓋 TRL+PEFT、LLaMA-Factory、ms-swift 與 unsloth。
這次發布也有鮮明的中國生態系色彩:透過 FlagOS 開源系統軟體棧,這個模型已經完成 九個不同 AI 晶片平台的適配——Nvidia、海光、Metax、Iluvatar、振宇、MetaX、摩爾執行緒、崑崙芯、華為昇騰與 ARM v9——並登上 FlagRelease 平台供跨晶片部署。對一個緊盯運算碎片化的產業來說,一個「開發一次、跨晶片部署」的強大小模型,本身就是一件安靜的戰略武器。
為什麼重要
次 4B 級距正是出貨量所在。這是跑在手機、筆電、機器人、車輛與邊緣盒子上的量級——那些付不起前沿模型延遲與功耗預算的裝置。過去一年這個級距由 Qwen 的稠密小模型主導,其優勢來自優異的每參數效率加上阿里巴巴的通路力量。一個用大約六成參數量就在綜合分數上超越 Qwen3.5-4B 的挑戰者——還同步公布了完整資料與 RL 管線——施加的競爭壓力,恰恰落在單位經濟被決定的地方。
時機也落在產業界關於「模型疲勞」的更大辯論之中,《CNBC》等媒體報導 IT 買家直言前沿模型不停發布的節奏已令人筋疲力竭。這類小模型發布正是反面論述:與其要求企業每幾週重新驗收一個新旗艦,不如把能力推進到人們既有裝置的footprint裡。一個有像樣 AIME 成績、SWE-bench Verified 四十多分、131K 上下文、工具使用基準 97 分的 2B 模型不是玩具——它是本地助理與編碼代理的可行日常主力。
但保留意見仍然存在。OpenBMB 的內部重現涵蓋多數分數(打星號者由 Artificial Analysis 提供),自報的對比組永遠讓人想問漏了誰。混合思考的小模型在思考模式啟動時通常也得用延遲換準確率,而模型自己的免責聲明也直白:輸出可能不準確或有偏見,敏感領域的回答未經專家審閱。Qwen 下一波小模型更新,想必會正面回應這場挑戰。
但作為 2026 年 9 月效率前沿所在位置的一個數據點,MiniCPM5-2B 很難被忽視:每參數的效能高於開放次 4B 領域的所有對手,而其發布姿態——完整資料、完整檢查點、完整配方——把一次模型上線變成了一場方法論的轉移。