← All posts / Models

GLM-5.3:Z.ai 的後訓練實驗催生了非預期的網安能力

Z.ai 在與 GLM-5.2 完全相同的 743B 基礎模型上推出 GLM-5.3——純靠後訓練就讓漏洞利用基準翻倍,甚至產生了訓練計畫之外的攻擊能力,據報導已找到 Cursor 的嚴重漏洞。

GLM-5.3:Z.ai 的後訓練實驗催生了非預期的網安能力

2026 年 8 月 14 日,北京的 Z.ai 發布了 GLM-5.3。這個小版本更新背後的故事,是今年最不尋常的案例之一:基礎模型與 GLM-5.2 完全相同——同樣的 7,430 億參數、同一次預訓練。所有進步全數來自後訓練(post-training)。這個決策造就了一個在 Z.ai 測試中成為最強開放權重編碼模型的系統,而且更令人意外的是:一個攻擊性資安能力超出了訓練者原本規劃的模型。

Z.ai 究竟發布了什麼

從技術上說,GLM-5.3 是疊加在 GLM-5.2 基礎模型之上的後訓練升級。Z.ai 的論述很直接:與其把巨量算力投入新的預訓練,不如專注在強化學習環境,特別是長程(long-horizon)代理式編碼任務,以及——關鍵所在——漏洞挖掘環境。代理式基準測試的結果十分驚人:

  • Terminal-Bench 3.0:GLM-5.3 從 4.6 躍升至 28.3。作為對照,Z.ai 自己的基準表顯示 GPT-5.6 Sol 為 34.6、Claude Fable 5 為 33.7,因此 GLM-5.3 縮小了與閉源前沿的差距,但在這項基準上尚未追平。
  • Z.ai Code Bench(內部基準):較 GLM-5.2 提升 50%。在 High 推理等級下,GLM-5.3 拿下 31.4%,每個任務消耗約 5 萬個輸出 token——小勝 Claude Opus 4.8 的 29.5%。調到 Max 推理等級時達到 34.5%,每個任務約 7.5 萬個輸出 token。
  • 最長程編碼基準:編碼增益集中在任務最長的區段,達到 84.5%——證明後訓練明確瞄準的是持續性、多步驟的代理工作,而非一次性補全。
  • 獨立測試:MindStudio 的評測讓 GLM-5.3 在一項獨立編碼基準上拿到 91%,超越 Opus 5 與 Kimi K3,並在困難的 3D 與 UI 任務上追平 Fable 5。

效率面的故事值得停下來細看。GLM-5.3 在一項綜合評測中得到 1,769 分,同時以每任務約 5 萬輸出 token 的消耗報出 31.4% 的成績。在頂級推理模型動輒在難題上燒掉六位數 token 的市場裡,以更低的 token 消耗追平 Opus 級編碼表現,對成本會隨每一步累積的代理工作負載來說,是真正的差異化優勢。

超出訓練規劃的網安能力

這次發布最被熱議的面向,是 Z.ai 把漏洞挖掘環境引入後訓練後發生的事。他們預期模型會更擅長找軟體缺陷——確實如此,而且幅度驚人:

  • CyberGym(從原始碼進行白箱漏洞識別與驗證):GLM-5.3 拿下 84.5%,居所有模型之冠——些微領先 Mythos 5 的 83.8% 與 GPT-5.6 Sol 的 83.6%。
  • ExploitBench:從 24.4% 翻倍至 54.4%。

但根據 TechTimes 的報導,後訓練過程產出了 Z.ai 明言從未刻意規劃的完整漏洞利用鏈(exploit chains)——這是湧現(emergent)的攻擊能力,而非被訓練進去的技能。在評估期間,該模型據報找到了 1,097 個嚴重漏洞,而且據 VentureBeat 報導,它已被認定在 AI 程式編輯器 Cursor 中發現了一個「可能相當嚴重」的漏洞。

這正踩在一個微妙的監管時點上。讓 GLM-5.3 對防禦方彌足珍貴的同一批特性——自主找到並驗證真實軟體中的真實漏洞——一旦權重落入不當之手,就變得危險。TechTimes 指出,GLM-5.2 已開放的權重,早就讓任何威脅行為者能以低至 46 美元的成本,取得接近前沿的自主攻擊能力(每次完整網攻模擬)。而 GLM-5.3 恰好在這方面強了一大截。

分階段的開放權重時程

這解釋了發布當天引發最多社群討論的限制:GLM-5.3 並未立即開放。上市時它僅透過 GLM Coding Plan 與 ZCode 提供,一般 API 存取與開放權重將随后推出。Z.ai 已承諾在 8 月 14 日發布後約兩週、待評估完成後釋出開放權重。

這是一個刻意的兩步走:先變現並評估,其次再開放權重。對一個以開放權重發布建立聲譽的實驗室而言,這個暫停很說明問題——等於默認「具備湧現網安能力的前沿編碼模型」屬於與過往 GLM 世代不同的風險等級。批評者會指出其中的矛盾:值得審慎以對的能力,恰恰就是發布頁面上拿來宣傳的能力。

為什麼重要

關於 GLM-5.3 的三個重點:

1. 後訓練已成為一線的前沿槓桿。 不動基礎模型就在 Terminal-Bench 3.0 上取得六倍改善(4.6 → 28.3),是迄今最強的證據,說明近期的前沿增益來自 RL 環境,而非原始參數量或全新的預訓練資料。可以預期每一家實驗室都會仔細研究這個結果。

2. 網安能力正成為頭條基準。 CyberGym 與 ExploitBench 的分數在 GLM-5.3 的發布材料中,與編碼基準佔有同等篇幅。當模型開始找出四位數量的嚴重漏洞、以及廣泛使用工具中的線上漏洞,攻擊性資安就從小眾評測轉變為核心競爭軸線——而且有明顯的雙重用途(dual-use)疑慮。

3. 開放權重遭遇能力延遲。 權重發布前約兩週的評估窗口,對大型開放權重實驗室而言是新模式。這會不會成為標準做法——以及政府是否會推動更長的窗口——可能定調 2026 年剩餘時間的開源 AI 論戰。

GLM-5.3 今天還不會在終端代理排行榜上取代 GPT-5.6 Sol 或 Claude Fable 5 的頂端地位。但作為一個「能力增益究竟從何而來」的數據點——以及當這些增益出現在沒人完整規劃過的領域時會發生什麼——它是本季最有趣的發布之一。