GLM-5.3:同一個基座模型,後訓練就讓它 coding 強到嚇人——還找出 2,436 個真實漏洞
Z.ai 的 GLM-5.3 與 GLM-5.2 用的是完全相同的基座模型——所有進步都來自後訓練。Terminal-Bench 3.0 從 4.6 跳到 28.3,以 84.5% 登頂 CyberGym 安全基準,並在生產程式碼中挖出 2,436 個漏洞、最老的已潛伏約 40 年。權重兩週後開放。
Z.ai 在 2026 年 8 月 14 日(週五)發布了 GLM-5.3,而它技術上最有趣的一點,是那個「沒有改變」的東西:基座模型。GLM-5.3 用的就是 GLM-5.2 的同一個基座,所有進步——而且進步幅度巨大——全部來自後訓練(post-training)。Terminal-Bench 3.0 從 4.6 跳到 28.3;DeepSWE v1.1 從 46.2 到 66.9;Agents’ Last Exam 從 23.8 到 28.5。同一顆大腦,行為卻脫胎換骨。這正是當前前沿 AI 進步的核心所在:不在更大的預訓練,而在預訓練之後你做了什麼。
這次發布了什麼
GLM-5.3 是 Z.ai 針對複雜軟體工程與 Agent 任務的新旗艦。核心規格:100 萬 token 上下文視窗、最大輸出 128K、純文字輸入,而且推理(reasoning)永遠開啟——不再支援關閉。開發者改用三檔推理強度(low、high、max),Z.ai 建議 coding 任務直接用 max。模型目前開放給 GLM Coding Plan 訂閱者使用(月費 18 美元起,分 Lite、Pro、Max 三級,採新的點數制額度;離峰時段與週末全天只消耗 50% 點數)。一般 API「即將推出」,開放權重則承諾在發布後約兩週、完成安全評估後釋出——這個延遲讓社群頗有微詞,畢竟在 2026 年的 AI 節奏裡,兩週真的很長。
後訓練的故事
Z.ai 技術報告最值得細讀的,是這些進步是怎麼「製造」出來的。當 Agent 能力提升,擴展後訓練的難點就從模型本身轉移到「環境」:有用的任務環境必須可執行、可驗證、貼近真實專業工作——而且需要成千上萬個,不是幾個手工打造的展示品。
於是 Z.ai 建了端到端的環境合成管線。研究型 Agent 從真實工作中收集任務模式,轉換成帶有多步依賴與隱藏狀態、可執行的長程環境;再由裁判 Agent 實際嘗試每個任務,驗證它真的可解。驗證器在合成時看不到參考解答,求解軌跡則用來發現並堵住獎勵漏洞(reward shortcut)。通過 oracle、no-op 與未解狀態三重檢查的驗證器,能產出可靠到可直接用於訓練的二元獎勵。GLM-5.2 引入的 RL 策略(含 SAO 與 compaction)也延續下來,讓增益在長程任務上同樣成立,而不只限於短任務。
任務本身絕非玩具。在其中一個 ML 基礎設施情境裡,模型拿到與真人工程師相同的工作環境——運算叢集、儲存系統、內部文件、程式碼庫、實驗結果——必須診斷訓練堆疊的瓶頸、實作優化、跑實驗,並在保持正確性的前提下交出可量化的端到端加速。有些任務相當於資深工程師好幾天的工作量。在這種等級的環境上訓練,把模型推向「獨立扛下大任務」,而不是等使用者拆解問題、逐步監督。
涌現的資安能力——與負責任發布的兩難
GLM-5.3 真正的新意在這裡。後訓練時,Z.ai 把漏洞挖掘資料與環境摻進訓練集。他們預期模型會更擅長找出並推理漏洞;意外的是,隨訓練規模擴大,這個能力的成長速度遠超預期——模型開始跨越入侵鏈的多個階段進行推理,組出完整攻擊鏈的連貫計畫。
基準成績是一組矛盾的組合。在 CyberGym(白箱原始碼分析、透過觸發故障來驗證漏洞)上,GLM-5.3 拿下 84.5%,較 GLM-5.2 的 77.2% 再上升,領先 Mythos 5(83.8%)與 GPT-5.6 Sol(83.6%),成績是該基準史上最佳,也讓它成為第一個登頂主要安全基準的開放(式)模型。但在 ExploitBench(對真實漏洞及其利用的更深層推理)上,GLM-5.3 只有 54.4%(雖已是 GLM-5.2 的 24.4% 兩倍以上),而 Mythos 5 拿 78.0%、GPT-5.6 Sol 拿 76.5%。在 ExploitGym(時間歸一化預算內完成的入侵任務數)上,GLM-5.3 兩小時完成 105 項、六小時 130 項,GLM-5.2 僅 29 與 39——但 Mythos 5 以 181 與 247遙遙領先。Z.ai 自己的註解罕見地坦白:能力成長最快的地方,正是模型落後閉源前沿最遠的地方。
然後基準測試「逃逸」到了真實世界。自 GLM-5.2 起,Z.ai 與中國多個資安團隊合作,把模型丟向生產級程式碼庫。經專家審查、篩選與去重後,模型在 269 個開源專案中找出 2,436 個漏洞,其中 1,097 個屬中高嚴重度。範圍涵蓋系統核心、作業系統、瀏覽器引擎、開源基礎設施、Web 應用與網路協定——許多已潛伏數年甚至數十年,最老的一個可追溯到約 40 年前。VentureBeat 並報導,模型在測試期間標記了 AI 程式編輯器 Cursor 的一個潛在嚴重漏洞。Z.ai 已將這項工作制度化為常態揭露計畫:Z.ai Security Disclosure Ledger 公開追蹤每項發現走完負責任揭露流程的進度,記錄受害專案、嚴重度、CVE(若有),以及該漏洞在程式碼裡潜伏了多久。
這也正是權重被押後安全審查的原因。一個這麼擅長找漏洞、組攻擊鏈的模型若毫無設防地直接開放,是最高等級的雙用途武器。Z.ai 的兩週延遲,可以說是最低限度的審慎。
實力定位
在 coding 上,GLM-5.3 宣稱於公開基準達到開源模型 SOTA,在私有基準 Z.ai Code Bench 較 GLM-5.2 提升 50%。效率數字與分數同樣重要:Max 強度下,GLM-5.3 以每任務約 75K 輸出 token 完成 34.5%,GLM-5.2 則是 96K token 才有 23.4%;High 強度下它以約 50K token 達 31.4%,勝過 Claude Opus 4.8 的 29.5%(用了 120K)。Claude Fable 5 仍以 39.5% 穩居榜首。獨立分析(Interconnects)指出,GLM-5.3 在多數基準超越 Moonshot 的 Kimi K3,部分甚至超過 Claude Fable 5 或 GPT-5.6-Sol——但要留意,所有資安分數都出自 Z.ai 自家測試。
為什麼重要
三個重點。第一,後訓練已是前沿競爭的主軸——GLM-5.3 證明,只要能合成夠多真實、可驗證的環境,不動基座模型也能做出整整一個世代的進步。第二,資安能力曲線正以超乎所有人預期的速度上彎,而且是雙面刃:挖出 2,436 個真實漏洞是公共財,同一套技能被武器化則是威脅。Z.ai 正在掙扎的負責任發放問題,這一輪每個實驗室都逃不掉。第三,開放權重前沿與閉源實驗室的差距持續收斂——權重兩週內就會釋出,GLM-5.3 可望在落地那一刻,直接成為自架 coding 模型的預設選擇。
Sources
- [1] https://z.ai/blog/glm-5.3
- [2] https://docs.z.ai/guides/llm/glm-5.3
- [3] https://venturebeat.com/technology/glm-5-3-is-here-with-advanced-cyber-capabilities-and-reportedly-already-found-a-serious-vulnerability-in-cursor
- [4] https://www.interconnects.ai/p/glm-53-how-chinese-labs-keep-stride
- [5] https://kingy.ai/blog/glm-5-3-specs-benchmarks-api-how-to-use/
- [6] https://atoms.dev/blog/glm-5-3-benchmarks-api-coding-open-weights