← All posts / Models

Z.ai 發布 GLM-5.3:基底模型不變,後訓練卻「長出」了意料之外的網路攻擊能力

Z.ai 推出 GLM-5.3,所有提升皆來自於在未更動的 743B GLM-5.2 基底上擴大後訓練規模——卻意外湧現了公司自稱「未曾計畫」的漏洞攻擊鏈能力。

Z.ai 發布 GLM-5.3:基底模型不變,後訓練卻「長出」了意料之外的網路攻擊能力

2026 年 8 月 14 日,北京的 Z.ai 發布了 GLM-5.3——這次發布最有趣的地方,在於什麼「沒有改變」。743 億參數的基底模型與 GLM-5.2 完全相同、原封不動;Z.ai 宣稱的所有提升,都來自單一槓桿:在更廣泛、更多樣的專業工作環境上,大規模擴張後訓練(post-training)。成果是被公司稱為史上最強的開放權重(open-weights)程式模型——外加一項 Z.ai 自己承認「成長速度快於預期」的網路安全能力。

模型權重目前尚未公開。Z.ai 表示,經過約兩週的安全評估與強化(hardening)後,任何人都可以下載——而這個延遲,公司明確地與那項非預期的攻擊能力綁在一起。這兩週的空窗期,可能成為整個發布中最受矚目的部分。

相同基底、新配方:環境規模化

GLM-5.2(六月發布)引入了 Z.ai 這次賴以為本的訓練技術棧:長上下文技術 IndexShare、專為長程任務設計的強化學習方法 SAO,以及大規模非同步 RL 的開源框架 slime。GLM-5.3 的配方說穿了就是「更多」——在相同技術棧上,投入更多運算資源、涵蓋更多環境。

關鍵在於,這些環境的設計目標是模擬「專業工作的完整單元」,而非孤立的程式練習題。Z.ai 舉了一個例子:模型被放進一位機器學習基礎設施工程師的工作環境——可以存取運算叢集、內部文件、程式碼庫與實驗結果——必須診斷效能瓶頸、實作優化,並交出可量化的端對端加速。公司表示,某些任務相當於一位資深工程師好幾天的工作量。

為了大量生產這類環境,Z.ai 建立了流水線:研究代理將真實工作中的任務模式轉換為可執行的長程環境,裁判代理驗證每個任務確實可解,而驗證器在無法參考標準答案的情況下合成。部分任務採用機器生成的獎勵訊號,並利用求解軌跡來封堵獎勵捷徑。這些流水線仍需要可觀的人工介入——在這個人人假裝全自動的產業裡,這算是坦白的承認。

數據:越長程的任務,提升越大

回報的結果完全符合這個配方所預測的模式。在 Terminal-Bench 3.0 上,GLM-5.3 從 GLM-5.2 的 4.6 躍升至 28.3;在 DeepSWE v1.1 上從 46.2 升至 66.9;在 Agents’ Last Exam 的 CLI 變體上從 23.8 升至 28.5。所有數據皆為廠商自行回報,並附有涵蓋測試框架、上下文長度與取樣設定的方法論註腳。

與競爭對手相比則好壞參半。在自家的 Z.ai Code Bench 上,公司宣稱較 GLM-5.2 提升 50%,且在相近努力程度下勝過 Claude Opus 4.8——每任務約 5 萬輸出 token 達 31.4%,相較 Opus 4.8 花 12 萬 token 達 29.5%——token 消耗量大幅降低。Claude Fable 5 在最大努力下仍以 39.5% 領先。在 Terminal-Bench 3.0、DeepSWE 等公開測試集上,GLM-5.3 在較困難的程式評測中仍落後 GPT-5.6 Sol 與 Fable 5。Z.ai 辯稱私有的 Code Bench 能降低公開測試集的資料污染風險——這論點有理,但也就無法被獨立查證。

價格則大幅低於對手:據報導,GLM-5.3 的 API 約為每百萬輸入 token 0.11 美元、每百萬輸出 token 0.28 美元,並沿用 GLM-5.2 的百萬 token 上下文視窗。目前已透過 Z.ai API 與 GLM Coding Plan 提供,所有現有編碼方案訂閱者皆已自動升級,可在 Claude Code、Kilo Code、Cline、OpenCode 等工具中使用。

Z.ai 自稱「沒料到」的網安成果

第二個頭條,是 Z.ai 自己標記為「非預期」的結果。團隊將漏洞挖掘的資料與環境納入後訓練,預期模型會在「找出並推理單一缺陷」上逐步進步。沒想到,隨著訓練規模擴大,能力持續複合增長——模型開始跨越漏洞利用的多個階段進行推理,形成針對「完整攻擊鏈」的連貫計畫,而不只是找出孤立的 bug。

基準測試數據支持這個說法。在 CyberGym(測試從白盒原始碼中識別並驗證漏洞)上,GLM-5.3 拿下 84.5%,高於 GLM-5.2 的 77.2%,領先 Z.ai 比較集中的所有模型。在 ExploitBench(需要對真實漏洞及其利用進行更深入推理)上,成績較前代翻倍有餘:54.4% 對 24.4%。在 ExploitGym(在時間正規化預算下計算完成的漏洞利用任務數)上,GLM-5.3 兩小時內完成 105 項、六小時內完成 130 項——GLM-5.2 僅為 29 與 39 項。

與前沿的差距仍在:Mythos 5 在相同預算下完成 181 與 247 項。但 Z.ai 對這個模式的總結很直白——基準測試在攻擊鏈上位置越靠後,相對 GLM-5.2 的增幅就越大,與封閉前沿模型的差距也越大。

2,436 個真實漏洞、1,097 個重大等級

這項能力不只存在於基準測試。Z.ai 表示,自 GLM-5.2 以來,與中國多個資安團隊合作,其模型已在 269 個開源專案中識別出 2,436 個漏洞——其中 1,097 個被評為重大(critical)或高(high)嚴重度——涵蓋系統核心、作業系統、瀏覽器引擎與網路協定。許多漏洞已潛藏多年未被發現;公司說最古老的一個,早在 1981 年就被引入。

這些發現匯入公開的「Z.ai 安全揭露帳本」(Security Disclosure Ledger),追蹤每個問題的協調揭露進度:發布當日已有 53 項公開揭露並取得 CVE 編號,其餘 2,383 項仍在 Embargo 中。近期條目包括 Linux 核心的 use-after-free 漏洞、影響 Apple Safari 的 WebKit 記憶體處理缺陷,以及 FreeBSD 的參數驗證 bug。在 OpenAI 剛剛展示其測試模型於紅隊演練中攻破 Hugging Face 的這一週,這是同一種能力的建設性對照面:能串接攻擊鏈的技能,同樣能挖掘出數十年老 bug 供人修補。

後續觀察重點

有兩件事將決定這次發布的成色。其一是獨立複現:第三方評測者能否驗證 GLM-5.3 的數據——尤其是自家 Code Bench 的結果,以及 Z.ai 在自家測試框架設定下跑出的網安分數——還是會揭穿這只是評測方式的選擇。其二是約八月底的權重釋出:一個具備真正攻擊鏈能力的 MIT 授權開放權重模型,將改變所有人的安全計算——對 GLM-5.2 開放權重的分析已顯示,僅需約 46 美元就能執行一次近乎前沿的自主網路攻擊模擬。

開發者還需注意一個破壞性變更:GLM-5.3 支援三档思考努力程度(low、high、max),且不再允許完全關閉思考——先前以關閉思考模式執行的應用程式需要調整。

就目前而言,GLM-5.3 是迄今最強的證據,證明在多樣化、擬真環境上的後訓練規模化——而不只是更大的預訓練——就能帶來逼近前沿的能力。而作為非預期的副作用,它也提醒我們:能力可能以連創造者都無法完全預期的方式,從訓練中湧現。