← All posts / Models

Ox Alpha 揭曉:Z.ai 的 GLM-5.3-Flash 開放權重、前線級分數與中國晶片推理叢集

Z.ai 證實 stealth 神秘模型 Ox Alpha 就是 GLM-5.3-Flash:320B 參數、MIT 授權開放權重的原生多模態模型,具備百萬 token 上下文與逼近前線的編碼分數,且整個曝光週期的推理服務都跑在數萬顆中國國產 AI 晶片上。

Ox Alpha 揭曉:Z.ai 的 GLM-5.3-Flash 開放權重、前線級分數與中國晶片推理叢集

八月 AI 圈最熱門的懸案正式落幕。2026 年 8 月 26 日,Z.ai 官方證實:那個 8 月 20 日悄悄現身 OpenRouter 與 OpenCode、匿名列名為「stealth」、一週內接連擊敗各家旗艦編碼模型卻無人承認出品的 Ox Alpha,其實就是該公司新的效率導向多模態模型 GLM-5.3-Flash。這次揭露不只給了名字,還附上完整技術包裹:Hugging Face 上的 MIT 授權開放權重、詳盡的架構說明,以及今年最令人側目的基礎設施宣言——整個病毒式曝光週期的推理服務,全部跑在中國國產 AI 晶片上。

揭曉內容實際帶來了什麼

身分確認終結了社群的猜謎,但實質內容遠不止於此。GLM-5.3-Flash 是 總參數量 320B、啟動參數約 18B 的混合專家(MoE)模型——刻意採「寬而淺」的設計,相較 GLM-4.5 系列幾乎砍半了啟動參數量與深度(45 層對 92 層),總容量卻維持同一量級。它原生支援多模態——文字、影像、影片輸入——上下文視窗達 1,048,576 token,主打市場上的「Flash」級距:便宜、快速,而且好到可以直接當預設模型,不必當奢侈品。

定價是最抓眼球的部分。Z.ai 在 OpenRouter 上的價格為每百萬輸入 token 0.075 美元、每百萬輸出 token 0.25 美元——約為 GLM-5.3 旗艦 API 費率的十分之一,限時折扣期間更低至二十分之一。在 Artificial Analysis 智慧指數 v4.1.1 上,Z.ai 報告該模型以每任務約 0.045 美元(折扣價)拿到 57 分,而這種智慧水準直到不久前還要花上約十倍成本。正是這種「逼近前線的能力、大宗商品級的價格」定位,讓 stealth 部署能這麼快收集到回饋。

基準測試:以極小成本逼近 Claude Opus 4.8

在六項編碼與代理基準上,GLM-5.3-Flash 全面優於前代 GLM-5.2,且差距常常很大:

  • DeepSWE v1.1: 63.4 對 GLM-5.2 的 46.2
  • AutomationBench: 48.8 對 26.2
  • Z.ai Code Bench v1.0(於 Claude Code 2.1.207 上執行):在每個努力等級都明顯領先 GLM-5.2,最高努力下幾乎追平 Claude Opus 4.8——29.0 對 29.5

Z.ai 自己的措辭相當節制:模型「整體逼近 Claude Opus 4.8」,並未宣稱奪冠。但 stealth 週期間的社群評測更為戲劇化——早期流傳的 DeepSWE 約 80% 成績,對上 Claude Fable 5 約 65%、GPT-5.6 Sol 約 52%——即使打折看待早期數據的變異,共識仍是:這是一個真正有競爭力的編碼模型,而非行銷噱頭。

視覺能力長期來看可能更重要。Z.ai 圍繞視覺自我判斷(self-visual judgment)建立了資料合成管線:強迫模型與環境互動、檢視自己渲染出的成果、並反覆修正。在前端工作上,團隊進一步用環境回饋的強化學習,以及基於真實使用者流程的代理驗證來強化 GUI 判斷——把驗證從「程式碼能不能跑」延伸到「渲染出來的產品是否真的好看、好用」。模型還跨入 CUA(電腦操作代理)領域,能點擊瀏覽網頁、視覺驗證,並操作桌面應用程式。

架構:混合注意力、IndexPool 與超連線

這份技術說明以發布文章而言異常具體:

  • 線性+稀疏混合注意力。 線性注意力透過狀態建模捕捉局部相依性;稀疏注意力透過輕量索引器檢索全域上下文。兩者結合大幅降低長上下文的服務成本,同時保留檢索精確度。
  • IndexPool。 在百萬 token 上下文下,連輕量索引器都很昂貴。IndexPool 透過加權池化把四個索引器鍵向量壓縮成一個,削減索引器的延遲與記憶體開銷。
  • 流形約束超連線(mHC) 提升網路整體的規模化效率。
  • 30 兆 token 的多模態預訓練語料庫,為該公司最新版本。

相對 GLM-5.3 的效率紅利:注意力計算量降低 3.0 倍、KV 快取縮小 4.4 倍。與同世代開源模型 DeepSeek-V4-Flash 和 Kimi-K3 相比,Z.ai 稱 GLM-5.3-Flash 在該組比較中注意力計算量最低,同時坦承 KV 快取仍略大於那兩家——這句誠實的「還有進步空間」,反而讓數字更有可信度。

基礎設施故事:不用 NVIDIA 的前線推理

策略上最重要的宣言,或許藏在服務章節裡。整個 stealth 週期間,Z.ai 把 Ox Alpha/GLM-5.3-Flash 服務在「大規模中國 AI 晶片叢集」上——數萬顆國產加速器——搭配高頻寬互連,以及與硬體協同設計的服務堆疊。為了繞過這些晶片相對有限的單機算力與記憶體,團隊在 SGLang 之上打造了專屬推理引擎,組合包括:

  • 針對線性注意力與 LM head 的節點內張量並行
  • ReplaySSM
  • W8A8 量化,搭配 INT8/FP8/BF16 混合快取量化
  • Layer Split
  • 生產級的 Encode–Prefill–Decode(EPD)分離式架構,把多模態編碼、prefill 與解碼拆成獨立排程的工作池

成果:在同一硬體上,端到端服務效能較初始基線提升 3 倍,每 token 成本與硬體效率達到「與主流 NVIDIA GPU 相當」的水準。還有個漂亮的細節:大部分核心最佳化是由 GLM-5.3 驅動的基礎設施代理加速完成的,它協助工程師診斷效能瓶頸——模型幫忙最佳化服務自己的系統,形成一個回饋迴路。

為什麼重要

三個重點值得記住。第一,stealth 空投這種形式已經成熟為正規的上市策略:先花一週收集未經修飾的真實回饋,再把聲量轉換成掛名且附權重的產品。第二,成本—效能前線的推移速度持續快過定價——每任務 0.045 美元、智慧指數 57 分的模型,一年半前還是旗艦級的定位。第三,也是對產業影響最深的一點:如果中國國產加速器已能在叢集規模下,以媲美 NVIDIA 的每 token 經濟性服務一個逼近前線的開放模型,那麼出口管制圍繞 AI 算力築起的護城河,就比外界假設的更淺。Z.ai 表示,同一套配方已在往更大的模型規模化。

GLM-5.3-Flash 現已向所有 GLM Coding Plan 訂閱者開放(可用配額為 GLM-5.3 的 3 倍),可透過 OpenRouter 的 API 使用,權重則以 MIT 授權在 Hugging Face 開放,本地部署支援 SGLang、vLLM 與 TokenSpeed。