Z.ai 發布 GLM-5.3:不換基底模型的突破,以及一項「長超出預期」的資安能力
Z.ai 於 8 月 14 日推出 GLM-5.3,沿用 GLM-5.2 的基底模型,所有進步都來自後訓練規模化——包含一項連 Z.ai 自己都沒預期到的漏洞挖掘能力。
2026 年 8 月 14 日,中國 AI 實驗室 Z.ai 發布了 GLM-5.3,而這次發布最值得注意的,反而是「沒有改變的東西」:GLM-5.3 使用的基底模型與 GLM-5.2 完全相同——就是 6 月發布的那個 743B 參數基礎。從 Z.ai 內部 Code Bench 上號稱 50% 的提升,到漏洞發現能力的全球領先,GLM-5.3 的每一項進步都來自同一個源頭:大幅規模化的後訓練(post-training)。Z.ai 自己的一句話總結得最到位:「Scaling post-training is all we did for GLM-5.3.」(我們為 GLM-5.3 做的一切,就是規模化後訓練。)
這個定位讓本次發布成為一場即時實驗,而且正好命中當前 AI 領域最有爭議的問題之一:在完全不重跑預訓練的前提下,靠強化學習、智能體環境與課程設計,能把一組凍結的基底權重推到多遠?
核心數據
GLM-5.3 被定位為目前最強的開放權重(open-weights)程式模型。在 Z.ai 自家的 Code Bench 上,公司宣稱比 GLM-5.2 提升 50%——在「High」推理強度設定下,GLM-5.3 拿到 31.4%,前代大約只有一半水準。Terminal-Bench 3.0 據報導也大幅躍升,且模型明確針對長時程(long-horizon)、多步驟工程任務調校,而非單發程式碼補全。
模型支援 100 萬 token 的上下文視窗,並提供可調式的推理強度等級,讓開發者在延遲、成本與思考深度之間自行權衡。GLM-5.3 已可透過 Z.ai 的 API 以及每月 18 美元起的 GLM Coding Plan 訂閱立即使用。
但真正讓這次發布破圈傳播的,是資安相關的數字。
資安能力:長超出訓練目標之外
Z.ai 對這段過程的描述罕見地坦白,值得仔細看。在後訓練階段,Z.ai 在 GLM-5.3 的強化學習環境中加入了漏洞發現(vulnerability discovery)相關任務——原本的預期只是讓模型更擅長找出單一程式臭蟲。結果,根據 Z.ai 的說法,模型發展出了「攻擊鏈推理」(exploit-chain reasoning):把多個弱點串接成一條可行攻擊路徑的能力,而這是 Z.ai 從未明確訓練過的目標。
可量測的成果如下:
- CyberGym:84.5%——在 Z.ai 的比較基準中為全球最佳,該測試檢驗模型能否識別並負責任地處理真實漏洞
- ExploitBench:54.4%——明顯落後領先的閉源前沿模型(78.0%)與 GPT-5.6 Sol(76.5%),顯示攻擊側能力仍有真實差距
- Z.ai 表示,與中國多個資安團隊合作之下,其模型已在 269 個開源專案中識別出 2,436 個漏洞,其中包含 1,097 個中高嚴重度問題——目前已有 105 個漏洞獲得維護者正式確認
還有一個傳播最快的插曲:GLM-5.3 據報導在 Cursor——那個數百萬開發者使用的 AI 程式編輯器——中找到了一個嚴重漏洞。無論最終的揭露時程如何,這個象徵意義都極為鮮明:一個 AI 模型,在自己發布的時間窗口內,找到了最受歡迎的 AI 程式工具之一的安全漏洞。Z.ai 正透過 cvd.z.ai 對其發現執行協調漏洞揭露(CVD)流程。
「不換基底模型」為何重要
這裡的經濟學值得深究。預訓練一個前沿規模的模型,需要數億美元等級的算力成本;而後訓練——在智能體環境上做強化學習、工具使用課程、從更強教師模型蒸餾——成本只是其中一小部分。如果 Z.ai 能把一個「六月等級」的基底模型,純靠後訓練變成「八月前沿」等級的程式與資安模型,這意味著一種新的節奏:實驗室可以用軟體發布的速度(而非預訓練的速度)推出有意義的能力躍升。
分析圈對這次發布的解讀,也指向中國實驗室追趕前沿的整體策略:與其在預訓練規模上硬拼美國實驗室,他們重金投資後訓練基礎設施——更多環境、更長的 rollout、更密集的獎勵訊號——從而從每一個基底模型世代榨出更多能力。GLM-5.3 是這個策略迄今最清晰的公開示範。
必須注意的但書
這次發布並非沒有爭議,社群也立刻注意到了。
權重其實還沒開放。 儘管打著「開放權重」的旗號,GLM-5.3 在 8 月 14 日只透過 API 釋出。Z.ai 採取混合策略:公司表示計畫在約兩週後、完成安全稽核後公開權重。對一個具備真實漏洞發現能力的模型來說,這是合理的審慎措施,但標籤與現實之間的落差,也讓 Reddit 上的討論串毫不留情地吐槽(「一個『沒附權重』的開放權重模型」)。
50% 的宣稱基於自家測試基準。 Z.ai Code Bench 是公司自己的量尺,這讓提升幅度難以在外部做標準化比較。第三方評測(如 Eden AI 的跨模型比較)將 GLM-5.3 排在開放模型之首,但在多項攻擊性資安與智能體任務上仍落後閉源前沿模型。
冒出的資安能力是雙面刃。 會推理攻擊鏈的模型對防禦極具價值——搶在攻擊者之前找出那 1,097 個中高嚴重度漏洞——而 CyberGym 優先的定位也強調了負責任的處理。ExploitBench 的差距顯示攻擊能力落後於發現能力,這可以說是比較安全的不對稱;而分階段開放權重的做法,至少顯示 Z.ai 正視了雙重用途(dual-use)的問題。
後續觀察重點
接下來兩週才是真正的考驗。如果權重如期釋出,且獨立評測者重現出接近 CyberGym 與 Code Bench 的數字,GLM-5.3 將以大幅差距成為最強的開放程式模型——而且是最強的開放資安研究工具,沒有之一。如果稽核拖延或稀釋了這次釋出,「開放權重」的定位就會受創。
但無論如何,更深層的訊號已經放出:後訓練已成為競爭的主軸,而能力在那條軸上的成長已不再是漸進式的。GLM-5.3 用一個已經「六個月大」的基底模型,在真實軟體中找到了真實漏洞,並獲得真實維護者的確認。前沿移動了,但沒有出現一個新的前沿模型——這才是最值得記住的部分。
Sources
- [1] https://z.ai/blog/glm-5.3
- [2] https://www.marktechpost.com/2026/08/14/z-ai-ships-glm-5-3-without-retraining-the-base-model-better-at-complex-coding-and-long-horizon-tasks/amp/
- [3] https://venturebeat.com/technology/glm-5-3-is-here-with-advanced-cyber-capabilities-and-reportedly-already-found-a-serious-vulnerability-in-cursor
- [4] https://www.unite.ai/z-ai-launches-glm-5-3-with-frontier-coding-and-a-cyber-capability-that-outgrew-its-training/
- [5] https://thenewstack.io/glm-5-3-post-training-coding/
- [6] https://www.edenai.co/post/glm-5-3-benchmark-vs-gpt-5-6-sol-claude-fable-5-gemini-3-1-pro
- [7] https://www.interconnects.ai/p/glm-53-how-chinese-labs-keep-stride
- [8] https://kingy.ai/blog/glm-5-3-specs-benchmarks-api-how-to-use/