謎底揭曉:Ox Alpha 就是 GLM-5.3-Flash——320B 開放權重、每百萬 token 只要 0.15 美元
Z.ai 揭曉匿名 stealth 模型的真實身分:GLM-5.3-Flash 是 320B-A18B 原生多模態 MoE,具備 1M context 與 MIT 授權權重,API 定價每百萬 token 輸入 0.15/輸出 0.50 美元——而且整個預覽期間都跑在中國自產 AI 晶片上。
一週前,一個名為 Ox Alpha 的模型以匿名「stealth」供應商的身分現身 OpenRouter,衝上編程排行榜頂端,讓整個開發者社群陷入了偵探遊戲。8 月 26 日,Z.ai 結束了這場遊戲:Ox Alpha 就是 GLM-5.3-Flash——GLM-5 系列第一個原生多模態模型,而且權重已經以 MIT 授權上架 Hugging Face。
這場揭曉把一週的猜測變成了你今天就能下載、自架或透過 API 呼叫的產品。它同時也回答了預覽期間最大的懸念:這個在早期 DeepSWE 測試中稱霸的模型,從來就不是哪家西方實驗室的 A/B 測試——它是 Z.ai 在數萬顆中國自產 AI 晶片上、以不具名方式公開進行的生產級壓力測試。
GLM-5.3-Flash 到底是什麼
規格讀起來像一個刻意追求效率的前沿模型:
- 總參數 320B,每 token 啟用 18B。 混合專家(MoE)架構,每個 token 路由到 288 個專家中的 8 個。
- 1,048,576 token 的 context window。 完整的 1M token,正是 Ox Alpha 上架時最引人注目的規格。
- 原生多模態。 支援文字、圖片與影片輸入——GLM-5 系列首見,也是預覽期間那些截圖驅動編程示範的功臣。
- MIT 授權、權重上架 Hugging Face。 不是「疑似開源」,也不是「僅限研究」。與開發者工具同等的 MIT 授權,商業使用一律歡迎。
- 原生 FP8 權重外加一層 MTP draft layer,用於服務端的投機解碼。
真正讓 Hacker News 討論串(871 分且持續上升)坐直身子的是定價:每百萬輸入 token 0.15 美元、快取輸入 0.03 美元、輸出 0.50 美元。這大約是 GLM-5.3($1.40/$4.40)價格表的十分之一,更是封閉實驗室前沿編程模型收費的一小部分。在折扣方案上,Z.ai 回報每個任務成本 $0.045(Artificial Analysis Intelligence Index v4.1.1 得分 57)。
效率來自架構
GLM-5.3-Flash 從一個以 30T token 多模態語料全新訓練的基底模型出發,三個設計選擇扛下了大部分重任:
混合注意力(Hybrid attention)。 GLM 系列首度在 45 層語言模型中交錯使用 KDA 線性注意力層與 NoPE 稀疏 MLA 層。線性注意力處理局部依賴;稀疏注意力檢索全域相關脈絡。這個分工讓 320B 的模型在百萬 token context 下依然敏捷。
IndexPool。 到了 1M token,檢索本身就成了瓶頸——對一百萬個 key 做注意力正是延遲的墳場。IndexPool 透過加權池化壓縮成群的索引 key 向量,壓住延遲與記憶體。Z.ai 回報相較 GLM-5.3 有約 3 倍的注意力計算量降低與 4.4 倍的 KV cache 縮減。
mHC。 流形約束超連線(Manifold-Constrained Hyper-Connections)提升擴展效率。與總參數量相近的 GLM-4.5 相比,GLM-5.3-Flash 大約把啟用參數與層數都砍半。
成果是一個在 Z.ai 內部編程基準上與 Claude Opus 4.8 差距僅半分、每 token 卻只啟用 18B 參數的模型。
基準測試
以下是 Z.ai 官方回報的數字,照例提醒:各測試的評測環境不同,模型卡的註腳會標明每個基準的溫度、context 上限與評審模型,跨模型比較請視為情境相依:
| 基準 | GLM-5.3-Flash | 參考 |
|---|---|---|
| Terminal-Bench 2.1 | 84.3 | Opus 4.8: 85.0 · GPT-5.6 Terra: 87.4 |
| DeepSWE v1.1 | 63.4 | GLM-5.2: 46.2 |
| AutomationBench | 48.8 | GLM-5.2: 26.2 |
| HLE | 55.3 | — |
| OfficeQA Pro | 62.4 | 領先 Opus 4.8 |
| Z.ai Code Bench v1.0 (max) | 29.0 | Opus 4.8: 29.5 |
對 GLM-5.2 的躍進才是頭條:DeepSWE v1.1 增加 17.2 分,AutomationBench 增加 22.6 分。Artificial Analysis 的獨立測量大致佐證了這個定位——Intelligence Index 57 分、輸出速度 48.7 token/秒、在 Z.ai API 上首 token 延遲 1.52 秒。性價比出色,但評測者也指出它偏慢且輸出冗長,視覺能力仍是弱項:在 BabyVision 與 MVbench 上落後 Gemini 3.7 Flash。
順帶一提,當初引爆 Ox Alpha 狂潮的 DeepSWE ~80% 早期數字,正如懷疑者所料,是部分題目的早期測跑。完整 v1.1 套件的驗證數字是 63.4——在這個價位仍是開放權重的最佳水準,但也再次提醒大家:stealth 預覽的數字值得雙向的懷疑。
服務端的故事才是被低估的部分
策略上最重大的細節藏在部署說明裡:整個 Ox Alpha 預覽都跑在中國自產的 AI 晶片上,使用自訂的 SGLang 引擎,將編碼、prefill 與解碼分離部署,Z.ai 回報在數萬顆加速器上獲得 3 倍的端到端服務效率提升。
再讀一次這句話。一個前沿等級的模型以公開規模服務——對一個渴望基準測試的開發者社群免費發送數百萬 token——用的不是 NVIDIA 的硬體。無論單晶片效能差距如何, aggregate 的服務產能存在、可用,而且剛撐過了一整週的對抗式社群壓力測試。這是一個關於出口管制與全球算力格局的數據點,任何新聞稿都買不到。
誰能真正自架
MIT 授權很慷慨;硬體需求可不。預設的 FP8 checkpoint 在計入 KV cache 之前就有約 306 GiB 的權重,而且目前的 vLLM 路徑只支援 NVIDIA Hopper 及更新的架構。現實的自架門檻是一個 8 GPU 節點(或 TP4 的 GB200 tray)——中型與大型組織,加上租用算力的 AI 原生新創。這條線以下的所有人,用的都是 API,而那裡的重點是經濟學而非硬體。
本地部署支援 SGLang、vLLM、TokenSpeed 與 KTransformers,unsloth 也已經推出了動態量化版本。r/LocalLLaMA 的 megathread 在數小時內就被做數學題的 DGX Spark 擁有者灌滿——320B-A18B FP8 剛好塞進「小叢集、真戰力」的生態位,而這正是社群一直拜託實驗室填補的缺口。
在託管端,GLM-5.3-Flash 已對所有 GLM Coding Plan 方案開放——Lite($18/月)、Pro($80)、Max($168)——配額是 GLM-5.3 的 3 倍,多模態能力也透過 Browser Use 與 Computer Use 進駐 ZCode。它同步上了 OpenRouter,為預覽期間的故事畫下句點。
為什麼重要
三個 takeaway 比揭曉本身活得更久。
Stealth 發布正式被確認為一種刻意的上市策略。 Z.ai 跑了一週的匿名預覽,讓社群免費生成熱度、公開做基準測試,再將揭曉轉換成最大化的曝光——正是我們在 Ox Alpha 現身時描繪的劇本。可以預期每個手上 有可信 checkpoint 的實驗室都會照抄。
前沿等級的開放權重持續變便宜。 一年前,「1M context、多模態、編程基準與 Opus 差半分、輸入每百萬 token 0.15 美元」還不是一個認真的產品類別。GLM-5.3-Flash、DeepSeek 的 V4-Flash 與 Qwen3.8 的開放權重釋出已經把它變成了一個。封閉實驗室的價格保護傘,正從下方以越來越難忽視的速度被侵蝕。
服務端的細節是一個地緣政治訊號。 中國實驗室不只是在訓練有競爭力的模型——他們正在用國產矽晶片、公開地、在負載之下服務這些模型。所有人假設的算力護城河,可能比宣稱的淺得多。
對開發者來說,實際的行動很簡單:免費的懸疑之窗關閉了,但模型沒有變差——它拿到了 MIT 授權、降價,還有了支援方案。那隻匿名唱了一週的金絲雀,剛剛辦好了所有文件。
Sources
- [1] https://z.ai/blog/glm-5.3-flash
- [2] https://huggingface.co/zai-org/GLM-5.3-Flash
- [3] https://www.marktechpost.com/2026/08/26/z-ai-releases-glm-5-3-flash-a-320b-a18b-natively-multimodal-moe-with-a-1m-token-context/
- [4] https://news.ycombinator.com/item?id=49449507
- [5] https://www.reddit.com/r/LocalLLaMA/comments/1vyzzxu/megathread_glm53flash_former_oxalpha/
- [6] https://openrouter.ai/z-ai/glm-5.3-flash
- [7] https://docs.z.ai/guides/overview/pricing