Beam 正式登場:Reflection AI 發布 501B 參數開放權重模型,以更少算力追平 GLM-5.2
Reflection AI 正式發表 Beam——總參數 501B、每 token 僅啟動 23B 的稀疏 MoE 模型,SWE-bench Verified 達 80.9,推理表現與 Z.ai 的 GLM-5.2 相當但推論算力只需 3-4 分之一,是美國陣營對中國開源模型壟斷局面的首次強力回應。
過去兩年,開放權重(open-weight)AI 競賽幾乎是單邊局面:最強的可自由下載模型——DeepSeek、Qwen、GLM、Kimi——幾乎全數來自中國實驗室,而美國前線實驗室則把最強系統鎖在 API 收費牆後。2026 年 10 月 5 日,這個局面出現變化。由前 DeepMind 研究員創立、獲 Nvidia 領投的 Reflection AI 正式發表 Beam——該公司首款開放權重模型,一個總參數 501B 的稀疏 Mixture-of-Experts 系統。官方數據顯示,它在推理任務上與中國最強的開源模型相當,但推論所需算力只需幾分之一。
Beam 是什麼
Beam 是稀疏 Mixture-of-Experts(MoE)模型,總參數 501B、每 token 僅啟動 23B,專為程式開發、推理與代理式(agentic)工作負載打造。它是純文字模型——沒有原生視覺能力——但 Reflection 展示了它能處理以文字表示的其他模態資訊。架構選擇本身就是核心賣點:每個 token 只啟動 501B 中的 23B,讓 Beam 擁有接近前線模型的能力,但單 token 成本曲線更接近小模型而非巨獸。
這次的訓練配方公開程度罕見地高。Reflection 使用 23.8 兆 token 的策劃網路資料與專有授權資料集進行預訓練,聲稱達到或超越同級開源基礎模型。但真正的差異化在強化學習(RL):Reflection 進行了它認為是開源實驗室史上最大規模的 RL 運算——在 10,500 張 Nvidia GB300 GPU 上、為期四週,產生超過 1 億次 rollout,訓練期間最大上下文長度 256K token。訓練與評分總計使用約 13 億個沙箱環境,來自近 100 萬個高品質的程式、代理與 STEM 環境池。
關鍵數字
Reflection 公布了完整的基準測試對照表,比較對象涵蓋當前開源陣營主要選手:Inkling、Nemotron 3 Ultra、GLM 5.2、GLM 5.3、Kimi K3、Qwen 3.8-Max 與 DeepSeek V4.1 Flash。幾個結果值得注意:
- SWE-bench Verified:80.9——領先 Inkling(77.6)與 Nemotron 3 Ultra(70.7)
- SWE-bench Pro v2-Hard:77.2——大幅領先 Inkling 的 56.9,但落後 Kimi K3(88.2)與 GLM 5.3(84.3)
- Terminal Bench v2.1:80.1——與 GLM 5.2(81.0)幾乎持平,距離 Kimi K3(88.2)與 DeepSeek V4.1 Flash(90.6)不遠
- AIME 2026:97.8——與 Inkling(97.1)同級,略低於 GLM 5.2(99.2)
- GPQA Diamond:90.5——與 GLM 5.2(91.2)、Qwen 3.8-Max(92.6)同梯隊
- MCP Atlas:78.7——工具呼叫方面小勝 GLM 5.2(77.8)
誠實的解讀是:Beam 並非原始能力的冠軍。Kimi K3 與 GLM 5.3 在多數純實力指標上勝過它,Reflection 自己也不諱言——模型是「接近 Qwen 3.8-Max」而非超越。真正的賣點是效率:在進階推理基準上,Beam 與 GLM-5.2 得分相當,但推論算力只需 3-4 分之一;對上 Qwen 3.8-Max 這類 2T+ 參數級模型時差距更大——那些模型每 token 啟動的參數量遠高于 Beam。Reflection 的定位很明確:更高的每 token 智慧密度,為企業程式開發與代理式工作負載提供更便宜的可靠主力模型。
值得注意的湧現行為
RL 訓練過程中有兩個技術細節值得單獨一提。
第一,能力遷移。在其中一段專注於推理、軟體工程與終端機任務的訓練期——RL 混合資料中完全沒有瀏覽任務——Beam 的瀏覽能力卻同步提升。給予網路存取權後,模型自發學會搜尋並呼叫其他大型語言模型、使用 OCR API 讀取文件。Reflection 將此解讀為 Beam 學到的是可泛化的代理能力,而非針對基準測試的特化技巧;示範影片支持這個說法:Beam 用公開 MTA 資料搭建了即時更新的紐約地圖 dashboard、用 p5.js 寫出 3D 遊戲,甚至產出一份微調筆記本,把最小號 Gemma-4 模型在 Text2SQL 保留測試集上的準確率提升了 66.5%。
第二,高效推理是被訓練出來的行為。Reflection 使用可控的長度懲罰機制——獎勵成功解題、懲罰冗餘 token。RL 早期,表現上升的同時輸出長度反而下降:模型學會用更少的推理步驟解題。後期輸出長度回升,但那些多出來的 token 都買到了真實的能力增益。使用者可透過 reasoning effort 參數直接控制這個取捨,按任務難度與算力預算調整推理深度。
非同步 RL 的突破
技術上最有趣的宣稱與 policy staleness 有關。全非同步 RL 讓 agent 生成 rollout 的同時,訓練器持續學習並發布新版模型——但長時間 rollout 的 token 來自多個檢查點,較舊的 token 相對當前 policy 會逐漸過時。Reflection 表示已開發出新演算法,即使訓練用的是一天前生成的互動資料——落後當前 policy 達 107 個權重版本——學習依然穩定,同時系統性縮小訓練與推論引擎之間的數值不一致。整個基礎設施平均維持 11 萬個並行 rollout。對任何在打造代理式 RL 系統的團隊來說,技術報告裡這一段的價值可能勝過整張基準測試表。
什麼時候釋出、釋出什麼
給等不及的人一個重要但書:權重今天還不能下載。Beam 正在進行最終紅隊測試與評估,目前開放早期存取申請。Reflection 將於「本月稍晚」以 Apache 2.0 授權釋出權重、技術報告、模型卡與開發者工件,連同執行、評估與微調的完整技術棧,透過超大規模雲端與 neocloud 夥伴生態發布,並整合進各開源函式庫與框架。Apache 2.0 是最寬鬆的主流授權——無使用限制、無營收上限——這讓 Beam 直接對標 DeepSeek 與 Qwen 的開源策略,而非 Llama 式的「半開放」授權。
為什麼重要
背後的資金規模最能說明賭注大小。Reflection 於 2025 年 10 月獲 Nvidia 領投 20 億美元,估值 80 億;到 2026 年 3 月,新一輪募資把估值推到約 250 億美元——當時它還沒發表過任何公開模型。Beam 是這場豪賭的第一筆分期付款。Nvidia 的利益是結構性的:每一家下載開放權重、在自有 GPU 上建造「AI 工廠」的企業,都是黃仁勳想要的客戶;而一個可信的西方開源模型,替那些不願跑中國權重、卻也受夠了依賴三家封閉美國 API 的買家——銀行、國防、政府單位——移除了最後的顧慮。
競爭態勢比新聞稿寫的更細緻。Beam 贏在效率與西方血統;Kimi K3 與 GLM 5.3 仍贏在原始實力;企業的最終決策將取決於「每解決一個任務的成本」。如果 Beam 的 3-4 倍算力優勢在實際部署中成立,定價壓力將同時落在封閉前線 API 與中國開源模型兩邊。Reflection 也明說 Beam 是系列作的第一彈,下一個模型已經在訓練中。
開放權重的前線,從此刻起是橫跨兩個半球 的競賽。權重本月釋出;真正算數的基準,是使用者自己跑出來的那些。
本篇報導的資料來源列於下方。
Sources
- [1] https://reflection.ai/blog/introducing-beam
- [2] https://techcrunch.com/2026/10/05/reflection-debuts-beam-a-open-weight-ai-model-to-rival-chinese-models-at-lower-compute-cost/
- [3] https://www.bloomberg.com/news/articles/2026-10-05/nvidia-backed-reflection-unveils-open-ai-model-taking-on-china
- [4] https://fortune.com/2026/10/05/reflection-ai-unveils-beam-a-new-us-based-open-source-model-to-compete-with-china/
- [5] https://www.theinformation.com/briefings/reflection-ai-announces-first-open-source-model-beam