← All posts / Models

GLM-5.3:強到會自己找漏洞的開源模型,Z.ai 被迫扣住自家權重不發

Z.ai 的 GLM-5.3 以 743B 參數追平前線閉源編碼模型,但測試中「意外長出」的攻擊能力,讓開源權重被迫延後兩週發布。

GLM-5.3:強到會自己找漏洞的開源模型,Z.ai 被迫扣住自家權重不發

2026 年 8 月 14 日,北京智譜(Z.ai)發布了 GLM-5.3。開場跟一般前線模型發布會沒兩樣:編碼更強、Agent 更強、 benchmark 更漂亮。但接下來的轉折很不尋常——真正讓 GLM 系列在生態圈有份量的開源權重(open weights),這次沒有跟著模型一起發布。Z.ai 把權重扣了大約兩週(目前預定 8 月 28 日左右釋出),理由是要進行額外的安全評估與強化。原因:測試期間,GLM-5.3 出現了 Z.ai 自稱「從未刻意訓練」的網路攻擊能力。

同一個底座,全新的行為

這次發布在技術上最有趣的一點,是「什麼沒變」。GLM-5.3 用的底座模型與前代 GLM-5.2 完全相同:743B 參數。所有進步——編碼提升、Agent 能力躍進、以及那些令人不安的資安技能——全部來自後訓練(post-training)。Interconnects 的分析指出,這讓一個約 750B 參數的模型,站上了 Agent 式編碼 benchmark 的前線,參數量只有 Kimi K3 的三分之一。

數字也支持這一點。在 Terminal-Bench 3.0 上,GLM-5.3 從 4.6 跳到 28.3——6.2 倍的進步,在開源權重模型中排名第一。在 Z.ai 自家的 Code Bench 上,比 GLM-5.2 提升 50%。根據 Z.ai 官方文件,在最高努力程度的 SWE 類型 Agent 任務上,GLM-5.3 以約 75K 輸出 token 達到 34.5%,而 GLM-5.2 要花 96K token 才拿到 23.4%——等於用更少的資源拿到更高的分數。

對上閉源前線模型,則是「並駕齊驅」而非「碾壓」。Z.ai 自己的 benchmark 表格顯示:GPT-5.6 Sol 拿 34.6,Anthropic 的 Claude Fable 5 拿 33.7,GLM-5.3 拿 34.5——統計上並列第一。這本身就是頭條:一個來自中國實驗室、開源血統的模型,在最難的編碼 benchmark 上已經能與最好的閉源系統過招,而且參數量遠小於國內對手。

資安意外

真正迫使權重延後的不是編碼,而是紅隊測試中的發現。評測期間,GLM-5.3 開始自行串接出可運作的攻擊鏈(exploit chains)——Z.ai 形容這是後訓練湧現的行為,不是刻意訓練的能力目標。在 CyberGym(測試模型能否重新發現真實世界已知漏洞的 benchmark)上,GLM-5.3 拿下 84.5%,前代是 77.2%;且據多家媒體報導,在漏洞「發現」這一項超越了 Anthropic Mythos 5 的 83.8%。

不對稱之處在攻擊端。各方報導指出,測試期間模型找出了數千個真實軟體漏洞,其中超過一千個被評為關鍵(critical)等級。而且它不需要實驗室環境才能發揮:據報 GLM-5.3 在一次例行的逆向工程測試中,就找到了 AI 編輯器 Cursor 的一個潛在嚴重漏洞——時間點就在模型正式發布之前。不過在 ExploitBench(衡量的是從發現到武器化的端到端能力)上,GLM-5.3 仍落後頂尖閉源模型約 24 分。簡言之:它是一流的漏洞發現者,但只是個尚可的漏洞利用者——至少目前是。

這個區別正是 Z.ai 踩剎車的原因。正如 MLQ.ai 所觀察,延後發布意味著 GLM-5.3 目前根本還不是實務上的開源模型:沒有公開的 checkpoint 可供研究人員驗證、微調或稽核這些數據。最終授權條款也還沒定案。

為什麼這件事不只是一個模型的新聞

Axios 把國安層面的利害講得很白:中國開源權重模型在「發現並利用資安漏洞」的能力上,正快速追近美國前線模型——而閉源 API 模型不同,一旦權重公開,任何人都能下載這個能力、用微調把安全護欄剝掉、離線運行,沒有任何速率限制或使用政策管得到。

Z.ai 的決定有兩種解讀。比較犬儒的讀法:兩週的延遲是做戲——一個「負責任發布」的姿態,最後權重照樣發。比較善意的讀法更有意思:這是第一批「實驗室被自己的評估結果嚇到」的案例——湧現出危險能力後,選擇延後旗艦發布,而這是在「晚發布就輸」的市場裡。無論哪種讀法,模式本身才是新聞:後訓練已經便宜且強大到,能力躍進可能「不在計畫內」就出現。這意味著發布前的安全評估不再是形式,而是最後一道防線。

對開源生態來說,等待是雙面刃。扣住權重是謹慎,但每多拖一週,企業就多一週無法採用、微調、部署這個模型,DeepSeek 和 Kimi 等對手就多一週追趕。Z.ai 承諾在強化完成後、約 8 月 28 日發布權重;這個日期守不守得住、最終授權怎麼寫,將說明當「開放」變得危險時,開源權重前線打算開放到什麼程度。

後續觀察

  • 8 月 28 日:預定的開源權重發布日。如果再跳票,代表強化過程發現的問題比 Z.ai 預期的更嚴重。
  • 授權條款:是寬鬆授權(像 GLM 小模型走 MIT),還是針對資安應用加上使用限制。
  • 獨立驗證:權重一公開,第三方對 CyberGym 和 ExploitBench 的重現測試幾天內就會出爐。在那之前,Z.ai 的所有數據都是自報的。
  • Cursor 漏洞:是否會拿到 CVE 並進行協同揭露——這是「AI 在別家公司產品裡找到漏洞該怎麼辦」的指標案例。

GLM-5.3 是一個真正強悍的模型,卻意外對整個產業做了一場實驗:當開源競賽跑出一個連創造者都不太敢發布的能力時,會發生什麼事?8 月 28 日見分曉。