← All posts / Models

GLM-5.3 開放權重上線:Z.ai 那個會找漏洞的旗艦模型終於公開

歷經兩週安全審查,Z.ai 的 GLM-5.3 開放權重預計今(28)日登上 Hugging Face,而 MIT 授權的 GLM-5.3-Flash 權重已經上線——所有自報的基準分數,從今天起人人都可以親自驗證。

GLM-5.3 開放權重上線:Z.ai 那個會找漏洞的旗艦模型終於公開

兩個星期的等待,今天到期。Z.ai 的 GLM-5.3——那個因為「找漏洞能力強到公司必須延後自己上市時程」的程式模型——開放權重預計於 8 月 28 日今天登上 Hugging Face,讓獨立研究人員終於能親手檢驗 Z.ai 對外宣稱的那些驚人數字。Hugging Face 上的 zai-org/GLM-5.3 頁面早已列出 8 月 28 日為發布日,Z.ai 昨天也在 X 上確認「GLM-5.3 權重明天釋出」。截至撰稿時,旗艦版權重尚未公開出現,Z.ai 也提醒日期仍可能變動——但搭配登場的 GLM-5.3-Flash 已以 MIT 授權上線,這個模型家族的「可驗證時代」實際上已經揭開序幕。

為什麼這場等待值得

GLM-5.3 最早在 2026 年 8 月 14 日發布,但只透過 Z.ai 的 GLM Coding Plan 與 ZCode 提供——沒有 API 權重、沒有開放下載。原因很不尋常:Z.ai 將延後形容為該公司史上最全面的一次風險審查,起因是後訓練(post-training)過程產生了超乎預期的資安攻擊能力。根據公司自己的說法,後訓練產出了 Z.ai「從未計畫」的完整漏洞利用鏈(exploit chains),而且這個模型被認定在 AI 程式編輯器 Cursor 中發現了一個嚴重漏洞。

這股能力的規模,記錄在 Z.ai 持續更新的資安揭露帳本(Security Disclosure Ledger)裡:自 GLM-5.2 以來,GLM 系列模型已累計在 269 個開源專案中找出 2,436 個漏洞,其中超過 2,300 個仍在保密協調揭露程序中。這本帳本本身就是個引人注目的存在——一家實驗室公開追蹤自己程式模型的「攻擊性資安」副作用。

同一副骨架,不同的野獸

GLM-5.3 技術上最有趣的一點,是它「沒有改變」的部分。它沿用與 GLM-5.2 相同的約 7,500 億參數混合專家(MoE)基底模型(Hugging Face 標示 753B,每次前向傳播約啟動 400 億參數),這意味著所有回報的能力提升,全部來自放大規模的後訓練,而非更大或重新訓練的基底。Z.ai 稱其為該實驗室迄今最強的開放權重程式模型,在自家 Z.ai Code Bench 上較 GLM-5.2 進步 50%,得分 1,769。

最醒目的躍進出現在代理式與資安基準上:

  • Terminal-Bench 3.0(真實世界程式與代理任務完成度):從 GLM-5.2 的 4.6% 跳到 28.3%——幅度大到評測者形容這是「換了一顆腦袋、卻穿著同一副骨架的模型」。
  • CyberGym(在程式碼中找出真實漏洞):84.5%,Z.ai 回報這個成績超越了 Anthropic 的 Claude Mythos 5 與 OpenAI 的 GPT-5.6 Sol。
  • ExploitBench(不只找漏洞、還要寫出可用的攻擊程式):54.4%,仍落後閉源前沿模型。

上述每一個數字,目前都是 Z.ai 自己回報的結果。這正是今天發布重要的原因:開放權重終於讓外部研究者可以直接驗證,而不是照單全收公司的說法。

Flash 已經到了——而且它一直藏在我們眼前

旗艦版權重被扣住的同時,Z.ai 端出了對日常開發者或許更具影響力的東西。8 月 26 日發布的 GLM-5.3-Flash,權重已即時登上 Hugging Face(儲存庫 8 月 27 日公開,一天內就累積超過一千個讚),它是個 3,200 億參數的 MoE,每個 token 僅啟動 180 億參數——每次前向傳播只用約 5.6% 的網路,45 層中的 288 個專家裡每次動用 8 個。

它是 GLM-5 系列第一個原生多模態模型:支援影像與影片輸入、1,048,576 token 的上下文視窗,底層是以 30 兆 token 多模態語料新訓練的基底模型。架構上首度在 GLM 系列引入混合注意力(hybrid attention,結合線性與稀疏注意力),並原生以 FP8 運行。

Flash 還有個有趣的身世:它上市第一週以匿名身分「Ox Alpha」出沒在 OpenCode 與 OpenRouter 上,開發者注意到一個沒有名字的模型以遠超乎其價位的表現碾壓全場——據報每秒超過 100 token、每百萬輸入 token 約 0.11 美元——而且完全由中國國產 AI 晶片提供服務。身分揭曉就在本週,而匿名期間的社群測試顯示,部分設定下端到端服務效能有 3 倍的改善。

價格方面,即使以 2026 年的標準,Flash 都算激進:定價約每百萬輸入 token 0.15 美元、每百萬輸出 token 0.50 美元(OpenRouter 上甚至更便宜),相較旗艦 GLM-5.3 的 1.40/4.40 美元。Z.ai 宣稱 Flash 以約十分之一的價格在基準與實際工作負載上全面超越 GLM-5.2,在內部程式基準上距離 Claude Opus 4.8 僅半分之遙。

自架的現實檢查

MIT 授權的權重是一回事,跑不跑得動是另一回事。Flash 預設的 FP8 檢查點在計入 KV cache 之前就有約 306 GiB,而目前 vLLM 路徑只支援 NVIDIA Hopper 及更新的硬體。這讓自架成為至少擁有一個 8 GPU 節點(或在 GB200 tray 上以 TP4)的組織的專利。這條線以下的所有人,就只能以 API 使用 Flash——而在那個世界裡,重點是經濟學,不是硬體。

旗艦版更重:這個約 7,500 億參數的模型,預期需要認真的多節點預算,等級與前代 GLM-5.2 相當。

為什麼重要

今天的發布交織著三條主線。

可驗證性。 整個產業本週都在爭論基準誠信——大型實驗室在熟悉的名字背後悄悄換模型、基準追蹤網站對「誰更聰明」各說各話。在這個背景下,一個帶著爭議性自報資安分數的模型開放權重,是外界难得可以直接審計這些主張的機會。

後訓練即新前沿。 GLM-5.3 證明,有意義的能力躍升不再需要新的基底模型。如果 Terminal-Bench 上 6 倍的進步完全來自一年前骨架上的後訓練,那麼基底模型的軍備競賽只是故事的一半——後訓練迭代更快的實驗室,每一塊訓練經費都能榨出更多能力。

開放權重作為戰略。 Z.ai(前身智譜 AI)已陸續為 GLM-5、5.1、5.2 與 5.3-Flash 釋出 MIT 授權權重,維持著讓中國實驗室緊咬閉源前沿的節奏——正如一位分析師所形容的,「中國實驗室如何與前沿保持同步」。每一次釋出,都在縮小開放與 API 高牆之間的差距。

接下來看什麼

如果旗艦權重如預期在今天出現,關注三件事:授權條款(Flash 是 MIT,但 Z.ai 尚未確認旗艦版的條款)、獨立的 CyberGym 與 ExploitBench 複現結果,以及社群多快端出量化版本——Flash 的 GGUF 變體在釋出一天內就出現了,旗艦版也會獲得同等待遇。而如果日期再度延後,那本身就是安全審查有所發現的訊號。

無論如何,舉證責任已經轉移。從今天起,GLM-5.3 的主張是可以查證的——只要有 GPU,任何人都能查。