← All posts / Tools

2.7 倍速的 MoE 開源訓練堆疊:Ai2 推出 Olmo-core 3 進軍兆級參數時代

艾倫人工智慧研究院全新設計的開源訓練框架讓專家常駐 GPU、單卡吞吐達 858 TFLOP/s,並已完成 2.38 兆參數的壓力測試。

2.7 倍速的 MoE 開源訓練堆疊:Ai2 推出 Olmo-core 3 進軍兆級參數時代

2026 年 10 月 1 日,艾倫人工智慧研究院(Allen Institute for AI,Ai2)發布了 Olmo-core 3——一套對其大型語言模型開發框架的全面升級,核心是一套重新設計的混合專家(Mixture-of-Experts,MoE)訓練系統。數字相當驚人:在相同硬體上訓練吞吐量約為前代的 2.7 倍、基準測試突破一兆總參數,短容量測試更觸及 2.38 兆。而且全部完全開源——程式碼、技術報告與互動式教學一應俱全。

在前沿 AI 的經濟學裡,訓練基礎設施通常是實驗室最視為機密的資產,Ai2 卻刻意把下一代模型的底層機械整套公開。Olmo-core 3 被描述為下一代 Olmo 背後的核心系統之一;Ai2 表示,下一代 Olmo 將採用 MoE 架構,目標是成為迄今最強的 Olmo——以迄今最大規模的資料集、最長的上下文視窗訓練而成。

為什麼 MoE 訓練這麼難

混合專家模型提供了一個誘人的交換條件:模型可以容納遠多於以往的參數量,卻不需要每個輸入都動用到全部參數。每個 token 只會觸發少數幾個「專家」——模型內部的特化元件。這種稀疏性讓現代 MoE 能以遠低於同規模稠密模型的單 token 計算量,換來接近前沿的品質。

問題在於:完整的模型仍然要有地方放。每個專家都必須駐留在叢集的 GPU 記憶體中、並在訓練時持續更新,而每個 token 都必須被路由到正確的專家——無論它們實體上位於哪裡。隨著 MoE 規模增長,這些儲存與協調開銷可能吞噬稀疏性帶來的大部分計算優勢。Ai2 講得很直白:隨著 MoE 增大,這些成本「可能侵蝕只使用模型一部分所換來的多數計算優勢」。

這次發布中最有說服力的基準測試之一,正是量化了這個痛點。Ai2 把專家池從 8 個擴大到 128 個,同樣每個 token 只選 4 個專家,讓每 token 的活躍參數維持在約 32 億不變。總參數容量從 46 億躍升至 470 億——模型容量成長十倍——而訓練吞吐量下降不到 5%。容量幾乎是免費的;路由架構吸收了衝擊。

從反覆搬運權重,到專家常駐

這次重新設計的核心,是模型權重「住在」硬體上的方式改變了。Ai2 早期在 Olmo-core 中的 MoE 實作採用完全分片資料平行(FSDP),每個微批次的訓練資料都要先把權重收集(gather)再重新分片(reshard)。每個批次都意味著一輪昂貴的權重搬運:把散落各處的權重碎片聚攏、計算、再散回去。

Olmo-core 3 改用基於分散式資料平行(DDP)的系統:讓專家常駐在 GPU 上,改由資料流向專家。權重不動;token 移動。消除這種重複的權重收集,是 headline 加速的最大來源。在一項於 8 張 NVIDIA B300 GPU 上的初步測試中,一個 470 億參數的 MoE 用新堆疊達到每 GPU 每秒 52,000 tokens 的處理量,而舊的 FSDP 實作只有 19,400——相同模型、相同硬體,吞吐量約 2.7 倍。

Ai2 也坦率承認 NVIDIA 的 Megatron-Core 是訓練大型 MoE 的成熟選項。Olmo-core 3 的重點並非證明既有方案慢——而是 Olmo 背後的框架如今內建了一套企圖心相當、且完全開源的 MoE 訓練堆疊,研究者可以檢視、分支(fork)、並適配到自己的硬體上,而不是把它當成黑盒子。

拆分模型的三種方式

Olmo-core 3 結合三種技術來決定模型與訓練狀態如何切分到叢集上:

  • 專家平行(expert parallelism)把專家分散到多張 GPU,讓每張 GPU 只儲存完整專家池的一部分。
  • 管線平行(pipeline parallelism)把模型的層——轉換輸入的各個連續階段——切分給不同 GPU 群組,降低單張 GPU 需持有的模型比例。
  • 分散式最佳化器把最佳化器狀態(訓練中用來計算並套用更新的額外資料)分散到各 GPU,而不是每張 GPU 都存一份完整副本。

三者相加,MoE 就能在不要求任何單一 GPU、或任何單一份模型副本持有全部東西的前提下擴展。

這次發布也降低了把 token 路由到專家、以及執行專家計算的成本:

  • 逐列專家平行(rowwise expert parallelism)把路由後的資料直接寫入專家的輸入緩衝區,減少重排資料的額外開銷。技術報告描述了一個基於 NVSHMEM 的設計,把每個 token 直接寫進其所屬專家的緩衝區。
  • GPU 常駐路由把路由詮釋資料留在 GPU 上,CPU 不必等它經 PCIe 匯流排回傳就能排入工作。
  • 分組 GEMM(grouped GEMM)把許多小型的專家計算合併成更大的矩陣乘法,讓 GPU 執行得更有效率——報告指出,裝置端排程的分組矩陣乘法讓專家平行完全無需同步。

MXFP8:21% 加速與更省記憶體

Olmo-core 3 也支援 MXFP8——一種以較少位元表示數值的低精度數字格式,可同時降低計算量與 GPU 之間的資料搬移量。Ai2 在 4 張 NVIDIA B300 GPU 上、工作均勻分布於各專家的對照基準中量測其效果:在最有效的環節啟用 MXFP8 後,訓練吞吐量比 BF16 基線高約 21%,峰值活躍記憶體則從 103 GiB 降至 95 GiB。增益主要來自前饋計算與專家間的資料搬移,而非注意力模組本身。

報告對精度技巧的轉換成本也毫不掩飾——只有當省下的成本超過數字格式之間轉換的開銷時,節省才會真正實現,而 Olmo-core 3 把這些取捨的控制權交給使用者。

進軍兆級參數

在最頂端,Ai2 在 NVIDIA B300 GPU 上對多種配置進行了基準測試,其中包括一個總參數 1.2 兆、每 token 活躍參數 583.6 億、橫跨 512 張 GPU 的模型,其最高觀測吞吐量為每 GPU 858 TFLOP/s——衡量每張 GPU 每秒有效模型計算量的指標。技術報告列出的量測操作點,從 16 張 GPU 上的 129 億參數模型,一路到 512 張 GPU 上的 1.2 兆參數模型。

Ai2 還實驗了 DeepEP v2——一種跨 GPU 專家通訊的替代後端——觸及了總參數 2.38 兆的配置,不過 Ai2 強調這是短容量測試,展示的是可達規模而非持續訓練效能。同樣重要的是,Ai2 明確表示這些 headline 數據是以隨機路由量測的系統參考值,用意是評估機械效能,並不是受控的縮放曲線,也不是「到達特定品質所需時間」的宣稱。

那些沒有用的發現

對研究者而言,這次發布最珍貴的部分或許是失敗結果的清單——Ai2 測過但沒有採用的東西。這些內容很少出現在新聞稿裡,卻經常在其他地方耗掉工程師數個月的時間:

  • Token 畫選區(token gerrymandering):一個旨在促進路由平衡的分數,可能持續改善,而實際工作負載卻變得愈來愈不平衡——量測指標在說謊。
  • 因為專家處理的 token 較少而調低專家學習率,在測試的模型家族中並沒有帶來改善。
  • 即使矩陣維度完全相同,GPU 計算花費的時間仍會隨處理數值不同而改變——提醒我們真實硬體比 roofline 模型棘手得多。
  • 在不同 GPU 串流上重疊通訊與計算不見得有幫助,某些測試中反而拖慢了端對端執行。
  • 測試過把活化值卸載到 CPU,但主機連結頻寬根本撐不住,最終放棄。

報告還描述了拓撲無關的檢查點(topology-agnostic checkpoints):以全域 FP32 張量記錄、與平行布局無關,因此一次訓練可以在不同的叢集拓撲上恢復執行——一個小功能,但對任何曾因硬體調度而損失整週訓練進度的人來說,價值難以估量。

為什麼重要

前沿訓練堆疊——Megatron-Core、NeMo、GSPMD 等 JAX 系統——功能強大,但對外界大多是不透明的黑盒子,而完全開源的替代方案過去在規模上始終遠不及兆級參數。Olmo-core 3 改變了這個參考點:一個學界色彩濃厚的研究機構,公開了一套可運作、經過基準測試、兆級參數等級的 MoE 訓練堆疊,連同它的瑕疵(隨機路由的但書、失敗實驗)一併奉上。

對學術研究者與小型實驗室而言,這次發布直接對準了 Ai2 點名的障礙:訓練大型模型「需要大量算力,推高成本與能耗,使先進模型的開發超出許多學術研究者和小型實驗室的負擔範圍」。在相同 GPU 預算下 2.7 倍的吞吐增益,實質上等於把每一次實驗的成本砍到剩下約三分之一。對整個生態系來說,這意味著下一代 Olmo——以及社群在這套堆疊上建構的一切——將擁有閉源前沿模型永遠無法提供的可重現性。

這份技術報告《Supercharging Olmo-core for Efficient and Scalable MoE Training》日期為 2026 年 10 月,作者來自艾倫人工智慧研究院與華盛頓大學,Tianhua Tao 為主要作者與主要開發者。程式碼現已開源;Ai2 說,下一個 Olmo 就建立在它之上。