Ox Alpha 揭曉真身:Z.ai 的匿名模型就是 GLM-5.3-Flash——320B 開源多模態強權
登上 OpenRouter 用量冠軍的匿名模型「Ox Alpha」,證實是 Z.ai(智譜)的 GLM-5.3-Flash——320B-A18B 原生多模態 MoE、百萬 token 上下文、MIT 授權開放權重,價格僅前線模型的十分之一。
過去一週,網路上最熱門的 AI 模型沒有名字。「Ox Alpha」於 2026 年 8 月 20 日出現在 OpenRouter 和 OpenCode 上,沒有標註開發者、免費使用,可處理文字、圖片與影片,上下文視窗約一百萬 token。它隨即衝上 OpenRouter 用量排行榜冠軍——那是該平台史上最大的發布——巔峰時期用量是 DeepSeek 的兩倍以上。開發者把它塞進編碼代理、跑各種基準測試、做各種即興測試,Reddit、X 和 Hacker News 上則長出了一整片「猜猜是哪家實驗室」的討論。
8 月 27 日星期三,答案揭曉:Ox Alpha 就是 Z.ai 的 GLM-5.3-Flash——來自北京、又稱智譜(Zhipu)的實驗室旗下 GLM 系列的最新成員。Bloomberg 率先報導此一消息,Z.ai 隨後在 Hugging Face 上以 MIT 授權釋出了模型權重。一場匿名實驗,就此變成一份文件完整、可下載、有正式定價的模型——也是這個夏天最具分量的開源權重發布之一。
匿名行動如何收網
線索其實從一開始就在。早期使用者發現這個模型偶爾會自稱 GLM,與智譜過去的 GLM 系列如出一轍。時間點也吻合:Z.ai 在 8 月 14 日發布了純文字旗艦 GLM-5.3,並公開表示多模態能力會在後續版本登場。Reddit 的 r/LocalLLaMA 討論串幾天內就點出了相似性,Nebius 共同創辦人也曾提出 GLM-5.3-Flash 的推測。Z.ai 向 Bloomberg 證實,「Ox Alpha」這個代號源自一部最近在中國上映的熱門電影《牛來》(Niu Lai,Ox Comes)。
匿名發布本身是刻意策略,重演了阿里巴巴與小米今年都用過的劇本:先不認領、讓模型純粹以實力競爭、在品牌聲譽上桌之前先收集未經修飾的使用者回饋。Z.ai 對 Ox Alpha 的描述是「為編碼、持續性代理工作與生產環境負載設計的推理模型」,適合「長時程軟體工程、複雜推理,以及結合文字與視覺情境的工作流」。
這招有效。正在收購 OpenRouter 的 Stripe 執行長 Patrick Collison 稱這次匿名發布「非常令人印象深刻」。
GLM-5.3-Flash 到底是什麼
剝掉神祕行銷的外衣,規格本身相當紮實:
- 架構:Mixture-of-Experts,總參數 320B、每 token 啟用 18B,原生多模態(文字、圖片、影片、視覺文件與交錯多模態輸入)
- 上下文:1,048,576 token——完整的百萬級視窗
- 注意力機制:首個將稀疏注意力與線性注意力結合於單一混合架構的開源前線模型——45 層交錯配置 KDA 線性注意力層與 NoPE 稀疏 MLA 層,每個 token 路由至 288 個專家中的 8 個,原生 FP8 權重外加一層 MTP 草稿層
- 訓練:以 30 兆 token 的多模態語料全新訓練的基底——值得注意的是,它沒有沿用 GLM-5.2 的基底,這點與 GLM-5.3 本身不同
- 授權:MIT,權重第一天就上 Hugging Face
- 效率:Z.ai 表示相較 GLM-5.3,注意力運算量減少約 3 倍、KV 快取縮小 4.4 倍,並靠名為 IndexPool 的元件壓縮索引鍵向量群組,讓百萬 token 的延遲與記憶體維持在可控範圍
多模態是它在 GLM-5 家族中的結構性差異。GLM-5.3 以文字為主;GLM-5.3-Flash 則把視覺直接烤進訓練,而非事後拼接。Z.ai 訓練它檢視渲染後的介面、遊戲畫面與 3D 輸出,再根據視覺回饋評估並修正自己的工作——正是代理式編碼真正需要的「看了結果再修」迴圈。同樣的能力延伸到文件、試算表與簡報,模型能端出完成的 PPTX、PDF、DOCX 與 XLSX 產出。
數據表現
Z.ai 表示 GLM-5.3-Flash 以約十分之一的價格,在編碼與代理測試上全面超越 GLM-5.2——而且進步幅度大,不是擠牙膏:
| 基準測試 | GLM-5.3-Flash | 參考值 |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | Claude Opus 4.8: 85.0 · GPT-5.6 Terra: 87.4 |
| DeepSWE v1.1 | 63.4 | GLM-5.2: 46.2 |
| AutomationBench | 48.8 | GLM-5.2: 26.2 |
| HLE | 55.3 | — |
| OfficeQA Pro | 62.4 | 領先 Opus 4.8 |
| Z.ai Code Bench v1.0(最大努力) | 29.0 | Opus 4.8: 29.5 |
在獨立的 Artificial Analysis Intelligence Index v4.1.1 上得分 57——折扣方案下每項任務成本 $0.045,Z.ai 稱之推高了「每美元智慧」的柏雷托前緣。獨立測試也量測到 Z.ai API 上每秒 48.7 個輸出 token、1.52 秒首 token 延遲。
誠實的但書:這些數字多為廠商自報、各家測試環境不一,Code Bench 這類內部基準無法獨立重現,而且模型並未宣稱在最困難的公開測試上擊敗 GPT-5.6 Sol 或 Anthropic 的 Fable 5。視覺是它的弱側——在 BabyVision 與 MVbench 上落後 Gemini 3.7 Flash。這是一記 CP 值與架構展示,不是排行榜橫掃。
改變算式的定價
標準 API 定價為每百萬輸入 token $0.15、快取輸入 $0.03、輸出 $0.50——部分第三方(OpenRouter)甚至列得更低,$0.075/$0.25。對照前線模型的費率,訴求顯而易見:你可以整天跑長時程代理迴圈,不必盯著 token 計費器。LLM-Stats 與 Claude Sonnet 5 的比較將 GLM-5.3-Flash 的混合成本(3:1 基準)壓在約便宜 16.8 倍。
模型已上線所有 GLM Coding Plan 方案——Lite(每月 $18)、Pro($80)、Max($168)——可用量是 GLM-5.3 的 3 倍,多模態能力也透過 Browser Use 與 Computer Use 整合進 ZCode。
被低估的故事:中國晶片
有一個細節值得更多關注:Z.ai 表示整個 Ox Alpha 預覽期都運行在中國國產 AI 晶片上。該公司使用自製的 SGLang 服務引擎,將編碼、預填充與解碼分離部署,並報告在數萬顆加速器上取得 3 倍的端對端服務效率提升。
這件事的意義超出單一模型。如果一個頂級開源權重模型可以在國產晶片上大規模服務——使用者無感、品質無差——那麼出口管制限制的是晶片供應,卻限制不了有能力的模型的供應。這也解釋了部分定價的侵略性:當你不必和每家前線實驗室搶同一批 H 級 GPU,成本曲線看起來就是不一樣。
自架的現實檢查
權重是開放的,部署卻不輕鬆。預設 FP8 檢查點在載入 KV 快取前就約 306 GiB,目前 vLLM 路徑僅支援 NVIDIA Hopper 與更新的硬體。現實的自架門檻是:至少一個 8 GPU 節點(或 TP4 的 GB200 tray)的中大型組織,或租用算力的 AI 原生新創。以下的使用者就走 API——經濟學而非硬體才是重點。本地服務支援 SGLang、vLLM、TokenSpeed 與 KTransformers,Ollama 的模型庫也已收錄。
為什麼重要
Ox Alpha 的一週匿名,最終證明了一件事:一個不掛品牌的中國實驗室模型,可以不帶名聲、不帶行銷、不帶價格標籤地出現——然後光靠實力贏下用量冠軍。真身揭曉為 GLM-5.3-Flash 之後,它與 Kimi K3、DeepSeek 系列和阿里巴巴的 Qwen 系列一起,構成了一整個夏天的模式:基準測試有競爭力的開源權重模型,以西方前線實驗室無法企及的價格、更快的節奏推出,而且越來越多是在自家基礎設施上訓練與服務。
對開發者來說,結論很簡單:如果你在做編碼代理、終端代理、電腦操作工作流,或任何處理帶視覺結構的長文件的工作,現在多了一個 MIT 授權、百萬上下文、多模態、成本約十分之一的選項。對產業來說,這場匿名發布暗中提出的問題——如果你不知道它是誰做的,你還會用嗎?——已經有了答案。答案是夠多人用了,用到位智譜股價在揭曉當天跳漲。
下一個考驗在下週一:Z.ai 將發布一月上市以來的第一份詳細財報。但更難的問題是拋給 OpenAI 和 Anthropic 的:當開源陣營持續以十分之一的價格縮小差距,溢價到底買到了什麼?
Sources
- [1] https://techcrunch.com/2026/08/26/surprise-z-ai-is-the-ai-lab-behind-the-mysterious-ox-alpha-model/
- [2] https://www.bloomberg.com/news/articles/2026-08-26/china-s-z-ai-made-ox-alpha-stealth-model-that-rivals-deepseek
- [3] https://www.marktechpost.com/2026/08/26/z-ai-releases-glm-5-3-flash-a-320b-a18b-natively-multimodal-moe-with-a-1m-token-context/
- [4] https://www.eigent.ai/blog/glm-5-3-flash-multimodal-model
- [5] https://technode.com/2026/08/27/zhipu-identifies-ox-alpha-as-glm-5-3-flash-and-releases-model-weights/
- [6] https://www.businessinsider.com/ox-alpha-model-made-by-china-z-ai-2026-8