GLM-5.3:Z.ai 的後訓練實驗催生了非預期的網安能力
Z.ai 在與 GLM-5.2 完全相同的 743B 基礎模型上推出 GLM-5.3——純靠後訓練就讓漏洞利用基準翻倍,甚至產生了訓練計畫之外的攻擊能力,據報導已找到 Cursor 的嚴重漏洞。
2026 年 8 月 14 日,北京的 Z.ai 發布了 GLM-5.3。這個小版本更新背後的故事,是今年最不尋常的案例之一:基礎模型與 GLM-5.2 完全相同——同樣的 7,430 億參數、同一次預訓練。所有進步全數來自後訓練(post-training)。這個決策造就了一個在 Z.ai 測試中成為最強開放權重編碼模型的系統,而且更令人意外的是:一個攻擊性資安能力超出了訓練者原本規劃的模型。
Z.ai 究竟發布了什麼
從技術上說,GLM-5.3 是疊加在 GLM-5.2 基礎模型之上的後訓練升級。Z.ai 的論述很直接:與其把巨量算力投入新的預訓練,不如專注在強化學習環境,特別是長程(long-horizon)代理式編碼任務,以及——關鍵所在——漏洞挖掘環境。代理式基準測試的結果十分驚人:
- Terminal-Bench 3.0:GLM-5.3 從 4.6 躍升至 28.3。作為對照,Z.ai 自己的基準表顯示 GPT-5.6 Sol 為 34.6、Claude Fable 5 為 33.7,因此 GLM-5.3 縮小了與閉源前沿的差距,但在這項基準上尚未追平。
- Z.ai Code Bench(內部基準):較 GLM-5.2 提升 50%。在 High 推理等級下,GLM-5.3 拿下 31.4%,每個任務消耗約 5 萬個輸出 token——小勝 Claude Opus 4.8 的 29.5%。調到 Max 推理等級時達到 34.5%,每個任務約 7.5 萬個輸出 token。
- 最長程編碼基準:編碼增益集中在任務最長的區段,達到 84.5%——證明後訓練明確瞄準的是持續性、多步驟的代理工作,而非一次性補全。
- 獨立測試:MindStudio 的評測讓 GLM-5.3 在一項獨立編碼基準上拿到 91%,超越 Opus 5 與 Kimi K3,並在困難的 3D 與 UI 任務上追平 Fable 5。
效率面的故事值得停下來細看。GLM-5.3 在一項綜合評測中得到 1,769 分,同時以每任務約 5 萬輸出 token 的消耗報出 31.4% 的成績。在頂級推理模型動輒在難題上燒掉六位數 token 的市場裡,以更低的 token 消耗追平 Opus 級編碼表現,對成本會隨每一步累積的代理工作負載來說,是真正的差異化優勢。
超出訓練規劃的網安能力
這次發布最被熱議的面向,是 Z.ai 把漏洞挖掘環境引入後訓練後發生的事。他們預期模型會更擅長找軟體缺陷——確實如此,而且幅度驚人:
- CyberGym(從原始碼進行白箱漏洞識別與驗證):GLM-5.3 拿下 84.5%,居所有模型之冠——些微領先 Mythos 5 的 83.8% 與 GPT-5.6 Sol 的 83.6%。
- ExploitBench:從 24.4% 翻倍至 54.4%。
但根據 TechTimes 的報導,後訓練過程產出了 Z.ai 明言從未刻意規劃的完整漏洞利用鏈(exploit chains)——這是湧現(emergent)的攻擊能力,而非被訓練進去的技能。在評估期間,該模型據報找到了 1,097 個嚴重漏洞,而且據 VentureBeat 報導,它已被認定在 AI 程式編輯器 Cursor 中發現了一個「可能相當嚴重」的漏洞。
這正踩在一個微妙的監管時點上。讓 GLM-5.3 對防禦方彌足珍貴的同一批特性——自主找到並驗證真實軟體中的真實漏洞——一旦權重落入不當之手,就變得危險。TechTimes 指出,GLM-5.2 已開放的權重,早就讓任何威脅行為者能以低至 46 美元的成本,取得接近前沿的自主攻擊能力(每次完整網攻模擬)。而 GLM-5.3 恰好在這方面強了一大截。
分階段的開放權重時程
這解釋了發布當天引發最多社群討論的限制:GLM-5.3 並未立即開放。上市時它僅透過 GLM Coding Plan 與 ZCode 提供,一般 API 存取與開放權重將随后推出。Z.ai 已承諾在 8 月 14 日發布後約兩週、待評估完成後釋出開放權重。
這是一個刻意的兩步走:先變現並評估,其次再開放權重。對一個以開放權重發布建立聲譽的實驗室而言,這個暫停很說明問題——等於默認「具備湧現網安能力的前沿編碼模型」屬於與過往 GLM 世代不同的風險等級。批評者會指出其中的矛盾:值得審慎以對的能力,恰恰就是發布頁面上拿來宣傳的能力。
為什麼重要
關於 GLM-5.3 的三個重點:
1. 後訓練已成為一線的前沿槓桿。 不動基礎模型就在 Terminal-Bench 3.0 上取得六倍改善(4.6 → 28.3),是迄今最強的證據,說明近期的前沿增益來自 RL 環境,而非原始參數量或全新的預訓練資料。可以預期每一家實驗室都會仔細研究這個結果。
2. 網安能力正成為頭條基準。 CyberGym 與 ExploitBench 的分數在 GLM-5.3 的發布材料中,與編碼基準佔有同等篇幅。當模型開始找出四位數量的嚴重漏洞、以及廣泛使用工具中的線上漏洞,攻擊性資安就從小眾評測轉變為核心競爭軸線——而且有明顯的雙重用途(dual-use)疑慮。
3. 開放權重遭遇能力延遲。 權重發布前約兩週的評估窗口,對大型開放權重實驗室而言是新模式。這會不會成為標準做法——以及政府是否會推動更長的窗口——可能定調 2026 年剩餘時間的開源 AI 論戰。
GLM-5.3 今天還不會在終端代理排行榜上取代 GPT-5.6 Sol 或 Claude Fable 5 的頂端地位。但作為一個「能力增益究竟從何而來」的數據點——以及當這些增益出現在沒人完整規劃過的領域時會發生什麼——它是本季最有趣的發布之一。
Sources
- [1] https://z.ai/blog/glm-5.3
- [2] https://docs.z.ai/guides/llm/glm-5.3
- [3] https://venturebeat.com/technology/glm-5-3-is-here-with-advanced-cyber-capabilities-and-reportedly-already-found-a-serious-vulnerability-in-cursor
- [4] https://www.marktechpost.com/2026/08/14/z-ai-ships-glm-5-3-without-retraining-the-base-model-better-at-complex-coding-and-long-horizon-tasks/
- [5] https://www.unite.ai/z-ai-launches-glm-5-3-with-frontier-coding-and-a-cyber-capability-that-outgrew-its-training/
- [6] https://www.techtimes.com/articles/324426/20260814/glm-53-post-training-produced-exploit-chains-zai-never-planned-finds-1097-critical-bugs.htm