← All posts / Tools

125B 模型塞進 12GB 遊戲顯卡:Strata 如何把 24,576 個專家拆到整台 PC 上

開源推論引擎 Strata 讓 125B 參數的 MoE 模型 Qwen3.8-Flash-Next 在一張 12GB 消費級顯卡加上 64GB 記憶體的普通 PC 上,以每秒 60-95 token 的速度運行。關鍵在於專家卸載與投機解碼。

125B 模型塞進 12GB 遊戲顯卡:Strata 如何把 24,576 個專家拆到整台 PC 上

多年來,本地運行大型語言模型的鐵則一直很殘酷:每個參數在 16-bit 下大約佔 2 位元組的 GPU 記憶體,因此一個 1,250 億參數的模型需要超過 250GB 的 VRAM。那是伺服器的世界——多 GPU 節點、HBM 高頻寬記憶體,以及相應驚人的電費。本週,一個名為 Strata 的開源專案衝上 Hacker News 首頁,用最樸素的方式打破了這條鐵則:它讓 Qwen3.8-Flash-Next——一個 125B 參數的混合專家(MoE)模型——在一台配有 12GB 顯卡和 64GB 系統記憶體的普通遊戲 PC 上運行。

專案官方基準測試的數字,足以讓本地推論玩家揉眼睛:在 NVIDIA RTX 5070(12GB)搭配 Ryzen 5 7600 與 64GB RAM 的機器上,Strata 依量化等級不同,每秒可生成 53 到 94 個 token——比大多數人的閱讀速度還快。而通常讓大型本地模型卡死的痛點「提示詞吞入速度」,在 32K token 的長文件上也能達到每秒 1,620 至 2,650 token。AMD 陣營同樣亮眼:RX 9070 XT(16GB)配上較舊的 Ryzen 9 3900X,仍有每秒 44-60 token 的生成速度。

核心技巧:別再把 VRAM 當成唯一的記憶體

125B 模型之所以需要伺服器,是因為稠密模型必須把所有參數常駐在加速器上。但 Qwen3.8-Flash-Next 並不稠密——它是擁有 24,576 個小型「專家」模組的 MoE 架構,而且每個 token 只需要其中 10 個專家參與運算。在任何時刻,模型的絕大部分都在「休息」。

Strata 的核心洞見,是把整台 PC 視為一個記憶體階層,而不是「一張 GPU 外加一點 RAM」。專案自己的說明用了廚房比喻:常用的東西放在流理台上,其餘的收進儲藏室。具體來說,三層記憶體協同工作:

  • GPU(12-24GB):存放歷史上最常被觸發的那幾千個專家——熱點集合。
  • 系統記憶體(32-96GB):容納全部 24,576 個專家,CPU 同時處理溢出的部分。
  • SSD:存放大型查找表,即使模型大到連 RAM 都裝不下,也能從磁碟串流。

因為每個 token 只需 10 個專家,所需的專家早已在 GPU 上的機率很高;而從 RAM 取回一個冷門專家的成本是以微秒計,而非天真實作下那種以秒計的分頁錯誤。專案還發表了論文與詳細文件,量化了這條管線的每一個環節。

先猜,再驗證

效能故事的另一半是投機解碼(speculative decoding)。一個小型輔助模型先猜出接下來幾個字,大模型再一次性平行驗證全部猜測,只保留正確的部分。由於驗證是平行的、起草是便宜的,使用者看到相同結果的速度可以加快 1.6 至 1.8 倍。

提示詞吞入也有類似處理:長輸入以每次最多 8,192 token 的區塊讀取,這正是 Strata 即使在中等硬體上也能維持每秒逾 1,000 token 提示詞處理速度的原因。一場長對話的第一則訊息大約每 30,000 token 需要一分鐘;後續訊息則在數秒內開始。

按記憶體挑選版本

Strata 提供多種量化版本,安裝器會依你的 RAM 建議合適的選項。32GB 的機器可以跑特殊的 “Coder” 版本——移除一半專家後可完整放入記憶體,並保留完整模型 SWE-bench Verified 分數的 91%,但在程式碼之外明顯變弱,包括中文與其他 CJK 文字。64GB 建議 IQ2_XS(平衡)或 IQ3_S(最好但最慢)。96GB 以上的工作站可跑 Unsloth 的 ~4-bit UD-IQ4_XS;實驗性的 UD-Q4_K_XL 甚至大部分從 SSD 串流,在 64GB 機器上每秒寫 7-8.5 token——慢,但證明了接近完整的模型也能塞進去,只要你忍受磁碟速度的推論。

硬體需求平凡得令人愉悅:NVIDIA GeForce RTX 20/30/40/50 系列或多款 AMD Radeon 顯卡、12GB 以上 VRAM、32GB 以上 RAM、約 80GB 磁碟空間,Windows 或 Linux 皆可。社群成員更把它推上了 Tesla P40、GTX 10 系列、Radeon VII,甚至透過 Linux 原始碼編譯跑通了 Intel Arc。

你桌上的 OpenAI 相容端點

讓 Strata 不只是基準測試玩具的,是它的介面。它在 http://127.0.0.1:8080/v1 提供 OpenAI 相容 API,外加 Anthropic 式(/v1/messages)與 Responses API(/v1/responses)端點。Claude Code、Codex CLI、Cursor、Copilot 這類代理工具都能直接指向它——也就是說,一個編碼代理可以驅動 125B 級別的模型,而且任何資料都不離開你的電腦。

這最後一句話在 2026 年份量極重。從 Apple 收緊 macOS 完整磁碟權限以遏制代理越權、Gemini Desktop「完整存取」開關爭議,到多州檢察長就沙箱逃逸事件傳喚實驗室,「不回傳雲端的代理式 AI」從未如此被渴望。一個能對話、寫程式、讀圖片、接上你現有代理工具鏈——完全本地、MIT 授權、跑在你已有的硬體上——的模型,正是對這種焦慮的有力回應。它甚至內建 MCP 伺服器,讓 AI 助理能自行安裝、啟動與停止引擎。

誠實的但書

誠實起見,必須列出但書。頭條量化等級相當激進:Q2_0 是最快的檔位,而任何 125B 模型的二位元量化都不可能在所有任務上追平全精確度版本。“Coder” 變體用通用能力換取 32GB 的記憶體足跡。AMD 顯卡在 Windows 上還不支援影像輸入。而一個會把 35-55GB 載入 RAM 的模型,啟動時會讓你的 PC 遲鈍甚至無回應一到三分鐘——README 對此罕見地坦白。

但方向已經無可誤認。Qwen3.8-Flash-Next 發布後數天內 vLLM 就跟上支援,r/LocalLLM 的社群回報描述 3090 級顯卡上吞吐量翻倍,Hacker News 討論串充滿可重現的結果。前沿級能力向消費者硬體下放的節奏,早已不是每年一次——而是每週一次。對任何想要「大模型大腦、零遙測」代理的人來說,Strata 剛剛把球門搬到了你書桌底下那台遊戲 PC 上。