← All posts / Models

Z.ai 的 GLM-5.3-Flash:十分之一成本的前沿多模態模型

Z.ai 開源 GLM-5.3-Flash:320B 參數混合注意力多模態模型,程式能力接近 Claude Opus 4.8、價格僅約十分之一,支援百萬 token 上下文、MIT 授權,並大規模部署於中國自研 AI 晶片上。

Z.ai 的 GLM-5.3-Flash:十分之一成本的前沿多模態模型

就在發布 GLM-5.3 僅僅兩週之後,Z.ai 緊接著推出 GLM-5.3-Flash——這次發布悄悄改寫了開源權重模型的成本底線。它是 GLM-5 系列中第一個原生多模態模型,支援一百萬 token 的上下文視窗,採 MIT 授權釋出,而且 Z.ai 表示其整體程式能力接近 Claude Opus 4.8,運行成本卻只有大約十分之一。The Information 本週將它評為低成本模型供應商價格戰中迄今最犀利的出手。

背後的故事更有意思:正式發布之前,Z.ai 以 ox-alpha 的匿名身分在 OpenCode 與 OpenRouter 上測試這個模型。在沒有人知道它是誰的情況下,它就成了當週最受歡迎的模型——而且 Z.ai 特別指出,這些流量全部是由中國自研 AI 晶片承載的。

GLM-5.3-Flash 到底是什麼

在架構上,GLM-5.3-Flash 是一個總參數量 320B、每 token 激活 18B 參數的混合專家(MoE)模型,專為超低成本推論而生。與 GLM-4.5 系列(總量 355B、激活 32B、92 層)相比,它在總規模相近的前提下,把激活參數量(18B 對 32B)與層數(45 對 92 層)幾乎砍半。

最大的架構變革是混合注意力設計——據 Z.ai 稱,這是第一個結合稀疏注意力與線性注意力的開源前沿模型。線性注意力透過狀態建模捕捉局部相依關係,稀疏注意力則透過輕量級索引器檢索全域上下文。一項稱為 IndexPool 的技術,以加權池化把四個索引器鍵向量壓縮成一個,進一步降低索引器在完整 1M token 上下文長度下的延遲與記憶體開銷。

效益可以直接量化:相較於 GLM-5.3,注意力運算量降低 3.01 倍,KV cache 大小降低 4.44 倍。與 DeepSeek-V4-Flash、Kimi-K3 等同輩模型相比,Z.ai 表示 GLM-5.3-Flash 在受測模型中注意力運算量最低,但也坦承其 KV cache 仍略大於兩者——還有進步空間。模型還採用了流形約束超連接(mHC)來提升規模化效率,並在 30T token 的多模態語料上預訓練。

API 方面,輸入支援影像、影片、文字與檔案,輸出為文字,最大輸出長度 128K。模型代碼為 glm-5.3-flash,思考模式無法關閉(永遠開啟),建議參數為 temperature 1、top_p 0.95、reasoning_effort 設為 max,並在 agent 場景啟用工具串流。

真正關鍵的數字

Z.ai 把 GLM-5.3-Flash 定位為推進 Artificial Analysis Intelligence Index v4.1.1 的帕累托前沿:以每任務 0.045 美元(折扣價)的代價拿到 57 分——該公司表示,這個等級的智慧過去要花大約十倍的價錢。

在六項程式與 agent 基準測試中,GLM-5.3-Flash 全面勝過 GLM-5.2,而且差距常常很大:

  • DeepSWE v1.1:63.4,對 GLM-5.2 的 46.2
  • AutomationBench:48.8,對 26.2
  • 在 Z.ai 自家的 Code Bench v1.0(於 Claude Code 2.1.207 內運行)上,它在每個 effort 等級都優於 GLM-5.2,最大 effort 時幾乎追平 Claude Opus 4.8——29.0 對 29.5

定價也印證了「Flash」的定位。OpenRouter 上價格為每百萬輸入 token 0.075 美元、每百萬輸出 token 0.25 美元,相對 GLM-5.3 的大約 1.40/4.40 美元——折扣是真實存在於 API 層面的,不是行銷話術。第三方追蹤者也注意到,它在一份新聞編輯 craft 基準上以 0.94 的分數奪冠。

視覺進入程式迴圈

最重大的變化其實不是某個基準分數,而是視覺能力原生進入了 GLM-5 系列。GLM-5.3-Flash 會觀察介面、渲染結果與互動回饋,持續測試並改進自己的產出,並跨程式碼、瀏覽器與 GUI 協調任務——從前端與遊戲開發,到 Blender 3D 場景,再到透過瀏覽器操作(BUA)與電腦操作(CUA)agent 執行的真實世界任務。

為此 Z.ai 建立了專門的視覺程式資料合成管線,強調自我視覺判斷與測試時改進:訓練軌跡迫使模型與環境互動、檢查自己的輸出、並反覆修正。在前端工作上,他們探索了以環境回饋做強化學習,並透過基於真實使用者流程的 agent 驗證來強化 GUI 判斷——把驗證標準從「功能正確」擴展到「渲染出來、可互動的成品」。

這種視覺智慧也不只用於寫程式。Z.ai 把模型定位為專業工作夥伴:Office 交付物(PPTX、PDF、DOCX、XLSX)、可追溯來源的金融研究、以及長影片理解——包括超越純語音辨識的說話者歸屬能力。

在國產晶片上大規模服務

整份公告中戰略意涵最重的一段,講的是基礎設施。過去一週,Z.ai 在大規模的中國自研 AI 晶片叢集上服務 GLM-5.3-Flash,使用建構於 SGLang 之上的專用推論引擎、Encode–Prefill–Decode(EPD)分離式架構,以及激進的記憶體最佳化(W8A8 量化、混合 INT8/FP8/BF16 快取量化、ReplaySSM、Layer Split)。

成果是:在同一批硬體上,端到端服務效能提升了 3 倍,達到與主流 NVIDIA GPU 相當的單 token 成本與硬體效率——而且是在 Z.ai 所稱的「數萬顆國產加速器」上。還有一個漂亮的遞迴細節:這套服務堆疊本身,就是在一個 GLM-5.3 驅動的基礎設施 agent 協助下完成優化的——那個 agent 撰寫核心程式、診斷效能瓶頸、調校承載自己後繼者的系統。

為什麼重要

GLM-5.3-Flash 誕生在一個「前沿附近智慧」邊際成本不斷崩落的市場。這次發布的啟示是:價格戰早已不只是 API 降價——而是架構、預訓練資料與推論基礎設施被當成一個系統來共同設計。Z.ai 明確表示,這套配方正在被擴大到更大的模型上。

對開發者而言,結論很簡單:一個 MIT 授權、多模態、百萬上下文、能跑進 Claude Code、每百萬 token 只收幾分錢、還能在 128 GB 的 Mac 上本地運行的程式模型,現在成了所有專有 API 都必須自我辯護的預設基準線。這是一道很高的門檻——而設定它的,是一個上線頭幾天還偽裝成一頭公牛的模型。