GLM-5.3:強到會自己找漏洞的開源模型,Z.ai 被迫扣住自家權重不發
Z.ai 的 GLM-5.3 以 743B 參數追平前線閉源編碼模型,但測試中「意外長出」的攻擊能力,讓開源權重被迫延後兩週發布。
2026 年 8 月 14 日,北京智譜(Z.ai)發布了 GLM-5.3。開場跟一般前線模型發布會沒兩樣:編碼更強、Agent 更強、 benchmark 更漂亮。但接下來的轉折很不尋常——真正讓 GLM 系列在生態圈有份量的開源權重(open weights),這次沒有跟著模型一起發布。Z.ai 把權重扣了大約兩週(目前預定 8 月 28 日左右釋出),理由是要進行額外的安全評估與強化。原因:測試期間,GLM-5.3 出現了 Z.ai 自稱「從未刻意訓練」的網路攻擊能力。
同一個底座,全新的行為
這次發布在技術上最有趣的一點,是「什麼沒變」。GLM-5.3 用的底座模型與前代 GLM-5.2 完全相同:743B 參數。所有進步——編碼提升、Agent 能力躍進、以及那些令人不安的資安技能——全部來自後訓練(post-training)。Interconnects 的分析指出,這讓一個約 750B 參數的模型,站上了 Agent 式編碼 benchmark 的前線,參數量只有 Kimi K3 的三分之一。
數字也支持這一點。在 Terminal-Bench 3.0 上,GLM-5.3 從 4.6 跳到 28.3——6.2 倍的進步,在開源權重模型中排名第一。在 Z.ai 自家的 Code Bench 上,比 GLM-5.2 提升 50%。根據 Z.ai 官方文件,在最高努力程度的 SWE 類型 Agent 任務上,GLM-5.3 以約 75K 輸出 token 達到 34.5%,而 GLM-5.2 要花 96K token 才拿到 23.4%——等於用更少的資源拿到更高的分數。
對上閉源前線模型,則是「並駕齊驅」而非「碾壓」。Z.ai 自己的 benchmark 表格顯示:GPT-5.6 Sol 拿 34.6,Anthropic 的 Claude Fable 5 拿 33.7,GLM-5.3 拿 34.5——統計上並列第一。這本身就是頭條:一個來自中國實驗室、開源血統的模型,在最難的編碼 benchmark 上已經能與最好的閉源系統過招,而且參數量遠小於國內對手。
資安意外
真正迫使權重延後的不是編碼,而是紅隊測試中的發現。評測期間,GLM-5.3 開始自行串接出可運作的攻擊鏈(exploit chains)——Z.ai 形容這是後訓練湧現的行為,不是刻意訓練的能力目標。在 CyberGym(測試模型能否重新發現真實世界已知漏洞的 benchmark)上,GLM-5.3 拿下 84.5%,前代是 77.2%;且據多家媒體報導,在漏洞「發現」這一項超越了 Anthropic Mythos 5 的 83.8%。
不對稱之處在攻擊端。各方報導指出,測試期間模型找出了數千個真實軟體漏洞,其中超過一千個被評為關鍵(critical)等級。而且它不需要實驗室環境才能發揮:據報 GLM-5.3 在一次例行的逆向工程測試中,就找到了 AI 編輯器 Cursor 的一個潛在嚴重漏洞——時間點就在模型正式發布之前。不過在 ExploitBench(衡量的是從發現到武器化的端到端能力)上,GLM-5.3 仍落後頂尖閉源模型約 24 分。簡言之:它是一流的漏洞發現者,但只是個尚可的漏洞利用者——至少目前是。
這個區別正是 Z.ai 踩剎車的原因。正如 MLQ.ai 所觀察,延後發布意味著 GLM-5.3 目前根本還不是實務上的開源模型:沒有公開的 checkpoint 可供研究人員驗證、微調或稽核這些數據。最終授權條款也還沒定案。
為什麼這件事不只是一個模型的新聞
Axios 把國安層面的利害講得很白:中國開源權重模型在「發現並利用資安漏洞」的能力上,正快速追近美國前線模型——而閉源 API 模型不同,一旦權重公開,任何人都能下載這個能力、用微調把安全護欄剝掉、離線運行,沒有任何速率限制或使用政策管得到。
Z.ai 的決定有兩種解讀。比較犬儒的讀法:兩週的延遲是做戲——一個「負責任發布」的姿態,最後權重照樣發。比較善意的讀法更有意思:這是第一批「實驗室被自己的評估結果嚇到」的案例——湧現出危險能力後,選擇延後旗艦發布,而這是在「晚發布就輸」的市場裡。無論哪種讀法,模式本身才是新聞:後訓練已經便宜且強大到,能力躍進可能「不在計畫內」就出現。這意味著發布前的安全評估不再是形式,而是最後一道防線。
對開源生態來說,等待是雙面刃。扣住權重是謹慎,但每多拖一週,企業就多一週無法採用、微調、部署這個模型,DeepSeek 和 Kimi 等對手就多一週追趕。Z.ai 承諾在強化完成後、約 8 月 28 日發布權重;這個日期守不守得住、最終授權怎麼寫,將說明當「開放」變得危險時,開源權重前線打算開放到什麼程度。
後續觀察
- 8 月 28 日:預定的開源權重發布日。如果再跳票,代表強化過程發現的問題比 Z.ai 預期的更嚴重。
- 授權條款:是寬鬆授權(像 GLM 小模型走 MIT),還是針對資安應用加上使用限制。
- 獨立驗證:權重一公開,第三方對 CyberGym 和 ExploitBench 的重現測試幾天內就會出爐。在那之前,Z.ai 的所有數據都是自報的。
- Cursor 漏洞:是否會拿到 CVE 並進行協同揭露——這是「AI 在別家公司產品裡找到漏洞該怎麼辦」的指標案例。
GLM-5.3 是一個真正強悍的模型,卻意外對整個產業做了一場實驗:當開源競賽跑出一個連創造者都不太敢發布的能力時,會發生什麼事?8 月 28 日見分曉。
Sources
- [1] https://z.ai/blog/glm-5.3
- [2] https://venturebeat.com/technology/glm-5-3-is-here-with-advanced-cyber-capabilities-and-reportedly-already-found-a-serious-vulnerability-in-cursor
- [3] https://www.interconnects.ai/p/glm-53-how-chinese-labs-keep-stride
- [4] https://www.techtimes.com/articles/324426/20260814/glm-53-post-training-produced-exploit-chains-zai-never-planned-finds-1097-critical-bugs.htm
- [5] https://www.axios.com/2026/08/14/china-open-source-ai-glm-53
- [6] https://mlq.ai/news/zai-delays-glm-53-weights-after-cybersecurity-tests-show-strong-exploit-capability/
- [7] https://www.artificialintelligence-news.com/news/zhipu-glm-5-3-benchmarks-explained/
- [8] https://docs.z.ai/guides/llm/glm-5.3