← All posts / Models

Z.ai 發布 GLM-5.3:不換基底模型的突破,以及一項「長超出預期」的資安能力

Z.ai 於 8 月 14 日推出 GLM-5.3,沿用 GLM-5.2 的基底模型,所有進步都來自後訓練規模化——包含一項連 Z.ai 自己都沒預期到的漏洞挖掘能力。

Z.ai 發布 GLM-5.3:不換基底模型的突破,以及一項「長超出預期」的資安能力

2026 年 8 月 14 日,中國 AI 實驗室 Z.ai 發布了 GLM-5.3,而這次發布最值得注意的,反而是「沒有改變的東西」:GLM-5.3 使用的基底模型與 GLM-5.2 完全相同——就是 6 月發布的那個 743B 參數基礎。從 Z.ai 內部 Code Bench 上號稱 50% 的提升,到漏洞發現能力的全球領先,GLM-5.3 的每一項進步都來自同一個源頭:大幅規模化的後訓練(post-training)。Z.ai 自己的一句話總結得最到位:「Scaling post-training is all we did for GLM-5.3.」(我們為 GLM-5.3 做的一切,就是規模化後訓練。)

這個定位讓本次發布成為一場即時實驗,而且正好命中當前 AI 領域最有爭議的問題之一:在完全不重跑預訓練的前提下,靠強化學習、智能體環境與課程設計,能把一組凍結的基底權重推到多遠?

核心數據

GLM-5.3 被定位為目前最強的開放權重(open-weights)程式模型。在 Z.ai 自家的 Code Bench 上,公司宣稱比 GLM-5.2 提升 50%——在「High」推理強度設定下,GLM-5.3 拿到 31.4%,前代大約只有一半水準。Terminal-Bench 3.0 據報導也大幅躍升,且模型明確針對長時程(long-horizon)、多步驟工程任務調校,而非單發程式碼補全。

模型支援 100 萬 token 的上下文視窗,並提供可調式的推理強度等級,讓開發者在延遲、成本與思考深度之間自行權衡。GLM-5.3 已可透過 Z.ai 的 API 以及每月 18 美元起的 GLM Coding Plan 訂閱立即使用。

但真正讓這次發布破圈傳播的,是資安相關的數字。

資安能力:長超出訓練目標之外

Z.ai 對這段過程的描述罕見地坦白,值得仔細看。在後訓練階段,Z.ai 在 GLM-5.3 的強化學習環境中加入了漏洞發現(vulnerability discovery)相關任務——原本的預期只是讓模型更擅長找出單一程式臭蟲。結果,根據 Z.ai 的說法,模型發展出了「攻擊鏈推理」(exploit-chain reasoning):把多個弱點串接成一條可行攻擊路徑的能力,而這是 Z.ai 從未明確訓練過的目標。

可量測的成果如下:

  • CyberGym:84.5%——在 Z.ai 的比較基準中為全球最佳,該測試檢驗模型能否識別並負責任地處理真實漏洞
  • ExploitBench:54.4%——明顯落後領先的閉源前沿模型(78.0%)與 GPT-5.6 Sol(76.5%),顯示攻擊側能力仍有真實差距
  • Z.ai 表示,與中國多個資安團隊合作之下,其模型已在 269 個開源專案中識別出 2,436 個漏洞,其中包含 1,097 個中高嚴重度問題——目前已有 105 個漏洞獲得維護者正式確認

還有一個傳播最快的插曲:GLM-5.3 據報導在 Cursor——那個數百萬開發者使用的 AI 程式編輯器——中找到了一個嚴重漏洞。無論最終的揭露時程如何,這個象徵意義都極為鮮明:一個 AI 模型,在自己發布的時間窗口內,找到了最受歡迎的 AI 程式工具之一的安全漏洞。Z.ai 正透過 cvd.z.ai 對其發現執行協調漏洞揭露(CVD)流程。

「不換基底模型」為何重要

這裡的經濟學值得深究。預訓練一個前沿規模的模型,需要數億美元等級的算力成本;而後訓練——在智能體環境上做強化學習、工具使用課程、從更強教師模型蒸餾——成本只是其中一小部分。如果 Z.ai 能把一個「六月等級」的基底模型,純靠後訓練變成「八月前沿」等級的程式與資安模型,這意味著一種新的節奏:實驗室可以用軟體發布的速度(而非預訓練的速度)推出有意義的能力躍升。

分析圈對這次發布的解讀,也指向中國實驗室追趕前沿的整體策略:與其在預訓練規模上硬拼美國實驗室,他們重金投資後訓練基礎設施——更多環境、更長的 rollout、更密集的獎勵訊號——從而從每一個基底模型世代榨出更多能力。GLM-5.3 是這個策略迄今最清晰的公開示範。

必須注意的但書

這次發布並非沒有爭議,社群也立刻注意到了。

權重其實還沒開放。 儘管打著「開放權重」的旗號,GLM-5.3 在 8 月 14 日只透過 API 釋出。Z.ai 採取混合策略:公司表示計畫在約兩週後、完成安全稽核後公開權重。對一個具備真實漏洞發現能力的模型來說,這是合理的審慎措施,但標籤與現實之間的落差,也讓 Reddit 上的討論串毫不留情地吐槽(「一個『沒附權重』的開放權重模型」)。

50% 的宣稱基於自家測試基準。 Z.ai Code Bench 是公司自己的量尺,這讓提升幅度難以在外部做標準化比較。第三方評測(如 Eden AI 的跨模型比較)將 GLM-5.3 排在開放模型之首,但在多項攻擊性資安與智能體任務上仍落後閉源前沿模型。

冒出的資安能力是雙面刃。 會推理攻擊鏈的模型對防禦極具價值——搶在攻擊者之前找出那 1,097 個中高嚴重度漏洞——而 CyberGym 優先的定位也強調了負責任的處理。ExploitBench 的差距顯示攻擊能力落後於發現能力,這可以說是比較安全的不對稱;而分階段開放權重的做法,至少顯示 Z.ai 正視了雙重用途(dual-use)的問題。

後續觀察重點

接下來兩週才是真正的考驗。如果權重如期釋出,且獨立評測者重現出接近 CyberGym 與 Code Bench 的數字,GLM-5.3 將以大幅差距成為最強的開放程式模型——而且是最強的開放資安研究工具,沒有之一。如果稽核拖延或稀釋了這次釋出,「開放權重」的定位就會受創。

但無論如何,更深層的訊號已經放出:後訓練已成為競爭的主軸,而能力在那條軸上的成長已不再是漸進式的。GLM-5.3 用一個已經「六個月大」的基底模型,在真實軟體中找到了真實漏洞,並獲得真實維護者的確認。前沿移動了,但沒有出現一個新的前沿模型——這才是最值得記住的部分。