← All posts / Research

記憶體之牆的另一半:AutoArk 的 Edge0 讓 35B MoE 從 SSD 串流推理,速度達每秒 20 token

透過預先路由器提前一個 token 預測下一層的專家路由,35B 混合專家模型能在 24GB Mac mini 上以 2.9 GiB 記憶體達到每秒 20 token 的解碼速度——完全開源。

記憶體之牆的另一半:AutoArk 的 Edge0 讓 35B MoE 從 SSD 串流推理,速度達每秒 20 token

在消費級電腦上跑 350 億參數的語言模型,過去根本是天方夜譚。即使用最激進的 4 位元量化,光是權重就佔約 19.5 GB,而混合專家(MoE)的稀疏性——這種讓模型每個 token 計算量變便宜的技巧——只能縮減每個 token 的計算量,卻縮減不了你必須載入記憶體的位元組數。9 月 16 日,AutoArk(edge0.ai)團隊發布了一篇論文與一套開源軟體,正是衝著這個不對稱而來。他們的串流推理引擎 Edge0,能在單台 24GB Mac mini 上以每秒 20 token 的速度服務一個 35B 級 MoE 模型,尖峰活躍記憶體卻不到 3 GiB。

這篇論文——《The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction》(arXiv:2609.18063)——對於樸素卸載為何失敗講得非常直白。你確實可以把專家權重留在 SSD 上、按需分頁載入。但第 N+1 層的專家,必須等第 N 層的輸出存在之後才能被選出。決定要抓取哪些專家的路由器,位於需要這些專家的計算之後,因此 SSD 的讀取永遠無法提早開始、無法藏在前向傳播的計算時間背後。結果就是典型的卸載死亡螺旋:計算資源閒置等儲存,吞吐量直接崩潰。

預先路由器:預測路由,然後把預測當成路由

Edge0 的核心招數,是不再把路由預測當作「提示」,而是直接把它當成路由本身。一個小型的逐層預測頭——prerouter(預先路由器)——經過訓練後,能提前一個 token 預測下一層的專家路由。解碼時,這個預測就直接作為實際的路由決策被消費,因此從 SSD 預先載入的專家集合,恰好等於真正被路由到的集合。沒有專家被丟棄,推理時也沒有任何近似——第 N+1 層的 SSD 讀取與第 N 層的前向傳播相互重疊,而不是互相阻塞。

這正是 Edge0 與各種投機式載入方案的不同之處:沒有後備路徑、沒有投機執行。訓練出來的預測就是路由。AutoArk 報告指出,光靠預先路由器就能帶來最高 +59% 的解碼吞吐量,而且儲存延遲越大、模型越大、路由寬度 K 越大,增益就越明顯——而這恰恰是卸載最痛的場景。

第三個機制 Recover-LoRA 負責償還品質債。int4 基礎模型被凍結,LoRA 轉接器則由 fp16 教師模型在學生路徑上蒸餾訓練——也就是在實際上線服務的那條「量化+替換路由」管線上訓練。轉接器保持未合併狀態,因此一份唯讀的基礎檢查點可以同時服務多組轉接器,無需重新量化。

實測數據

在配備 24 GB 記憶體的 Mac mini M4 Pro 上,旗艦級的 edge0-35b(基於 Qwen3.6-35B-A3B,40 層、256 個專家、每 token 啟用 4 個)交出這樣的成績單:

指標數值
解碼速度14.9–17.7 tok/s(論文:20 tok/s)
前填吞吐(冷 / 熱)113 / 140 tok/s
尖峰活躍記憶體2.9 GiB
磁碟上的 4 位元檢查點約 23 GB

論文中最引人注目的,是與全駐留基線的對比:Edge0 的串流管線在 2.9 GiB 內達到 20.4 tok/s,而佔用 18.2 GiB 的全駐留 int4 組態在同樣硬體上只有 3.9 tok/s。這個看似矛盾的結果——從 SSD 串流竟然比全部塞進 RAM 還快——原因在於全駐留組態把機器逼入了交換(swap)狀態,而 Edge0 的工作集舒舒服服地裝在實體記憶體裡。

品質面也撐得住。以 OpenCompass 在完全相同的設定下評測,edge0 管線(int4+轉接器+預先路由)平均只落後 fp16 教師 3.9 分:AIME 2026 為 86.6 對 92.7,HumanEval 為 90.9 對 95.1,GPQA-Diamond 為 79.8 對 81.8,MMLU-Pro 為 81.0 對 84.6,IFBench 為 57.9 對 61.7。較小的 edge0-8b(基於 Ling 3.0 bailing 混合模型,128 個專家,預先路由 K=8)表現更好,平均僅差 2.8 分——而且它的 MMLU-Pro 拿到 70.1,甚至超越了 fp16 基礎模型的 65.8。

為什麼重要

記憶體之牆是邊緣 AI 的硬約束。資料中心級的推理可以用 HBM 和專家平行來閃避,消費級裝置不行。Edge0 的貢獻在於證明這道牆的「另一半」——阻擋預取的路由依賴——可以被一個訓練出來的預測器攻克,而不需要更快的儲存或更大的快取。

這個結果的影響遍及幾個方向:

  • 手機級部署變得可行。 活躍記憶體不到 3 GiB 就能跑 35B MoE,這樣的硬體根本裝不下 20 多 GB 的權重;8B 版更只需要約 1.0 GiB。
  • 平民化的批次服務。 因為基礎模型保持唯讀、轉接器是獨立的 safetensors 檔案,一台機器就能從磁碟上的單一檢查點服務多個 LoRA 客製化變體。
  • 方法可以泛化。 Edge0 被定位成一個框架而非單一模型的 hack:SSD 專家卸載、預先路由器與 Recover-LoRA 被包裝成可擴充的抽象層,後端隔離設計(目前是 Apple Silicon 的 MLX,CUDA 在路線圖上)。

當然也有誠實的但書。這是預覽版;代理(agentic)能力——工具使用、多步規劃、長程自主性——在這一版明顯偏弱,正式版承諾會大幅強化。MLX 後端目前只支援 Apple Silicon,長脈絡會讓 KV 快取超出帳面上的 3 GiB。15–20 tok/s 的互動速度對 35B 模型來說堪用但稱不上寬裕,而評測方法(3.3k token 前填、200 個計時解碼 token、每次兩輪)也留給了獨立重現驗證的空間。

不過,結果的形狀才是重點。在這個產業話題被兆美元估值和十萬晶片叢集壟斷的一週裡,Edge0 提醒我們:效率研究的 frontier 同樣在前進——而一個會從消費級 SSD 串流專家權重、路由由訓練好的預測頭提前一個 token 預判的 35B 參數模型,現在距離你只差一個 Apache-2.0 授權的下載。