← All posts / Models

GLM-5.3:找出 2,436 個真實漏洞的開源編程模型——連自己的權重都被延後發布

Z.ai 的 GLM-5.3 僅靠後訓練就讓編程能力提升 50%,在 CyberGym 漏洞挖掘基準以 84.5 奪冠,並找出 2,436 個真實開源漏洞——Z.ai 因此延後了自家開源權重的發布以進行安全審查。

GLM-5.3:找出 2,436 個真實漏洞的開源編程模型——連自己的權重都被延後發布

多數 AI 模型的發布會宣布模型「能做什麼」。Z.ai 於 2026 年 8 月 14 日推出的 GLM-5.3 特別之處在於:它最引人注目的事實,是公司決定「暫時不做」的事——發布開源權重。原因是這個模型在一件創造者未完全預期的事情上進步得太快:尋找並利用真實的軟體安全漏洞。於是這家實驗室暫停了自己的開源發布,先進行額外的安全強化。

這使得 GLM-5.3 的發布同時像一份能力宣告,也像一份安全案例研究,更預示了 2026 年開源權重 AI 的走向。

同一個基座模型,編程能力提升 50%

GLM-5.3 的第一個意外是:架構上沒有任何變化。它沿用與 GLM-5.2 完全相同的基座——約 7,440 億參數的混合專家模型(MoE),每個 token 約啟動 400 億參數。沒有新的預訓練,所有進步都來自後訓練(post-training):事後施加的強化學習與微調。

儘管如此,Z.ai 報告其在自家 Code Bench 上提升 50%,並在 Terminal-Bench 3.0(28.3%,GLM-5.2 僅 4.6%)與 Agents’ Last Exam(CLI)等公開基準上達到開源模型的最佳水準。API 方面,模型支援 100 萬 token 上下文視窗、最大 12.8 萬 token 輸出、純文字輸入,且推理功能永遠開啟,提供 low/high/max 三種推理強度——不再支援關閉推理。

在凍結的基座上僅靠後訓練就獲得 50% 的編程增益,強烈說明目前前沿規模的模型還有多少未被挖掘的潛力:能力早已潛藏在 GLM-5.2 之中,後訓練只是把它引導出來。

意外湧現的能力:網路安全

接下來是 Z.ai 自己形容「超出預期」的部分。隨著後訓練規模擴大,模型的資安能力以超乎預期的速度成長。而且沿著漏洞利用鏈越往深處測量,相對 GLM-5.2 的領先就越大:

  • CyberGym(UC Berkeley 的漏洞挖掘基準,涵蓋 188 個 OSS-Fuzz 專案的 1,507 個真實漏洞):GLM-5.3 得分 84.5,領先 Claude Mythos 5(83.8)與 GPT-5.6 Sol(83.6)。開源權重模型站上該榜首位是頭一遭。
  • ExploitBench(CMU 與 Bugcrowd 合作;41 個已修補的 V8 CVE,衡量模型能否把漏洞一路帶到可運作的攻擊程式):GLM-5.3 得分 54.4,相較 GLM-5.2 的 24.4 成長 2.2 倍。閉源領先者 Claude Mythos 5(78.0)與 GPT-5.6 Sol(76.5)仍領先約 24 分。
  • ExploitGym(UC Berkeley RDI 與 Max Planck 資安研究所;869 個容器化利用任務):GLM-5.3 在 2 小時預算內解出 105 題,6 小時達 130 題(15.0%),相較 GLM-5.2 的 29/39(4.5%)約 3.5 倍,約為 Claude Mythos 5(28.4%)的一半。

有兩個獨立數據點佐證這套測試的可靠性:Kimi K3 在 ExploitBench 的 32.2,恰好落在英國 AI 安全研究所與美國 AI 標準中心 7 月 23 日聯合評測的 32% 之上;GLM-5.2 的 24.4 也與他們測得的 24% 一致。

一個值得知道的但書:CyberGym 有四個資訊等級,Z.ai 的 84.5 屬白盒設定(提供標準修補 diff),在此設定下前沿模型群已飽和——前五名只差 7.3 分。開放式探索等級仍然困難得多。真正具鑑別度的是漏洞利用基準,而那裡才是與閉源前沿模型尚未縮小的差距所在。

2,436 個真實漏洞,一份公開帳本

基準成績只是正常的發布故事,真正讓 GLM-5.3 成為頭條的是那份帳本。與外部資安團隊合作之下,Z.ai 的模型找到:

  • 自 GLM-5.2 以來,在 269 個開源專案中發現 2,436 個漏洞
  • 其中 1,097 個屬中至高危(107 個 critical、990 個 high)
  • 53 個已公開並取得 CVE 編號;2,383 個仍在協調揭露的 Embargo 之下
  • 範圍橫跨系統核心、作業系統、瀏覽器引擎與網路協定——包括 Linux、WebKit、FreeBSD、GStreamer 與 Suricata
  • 最老的缺陷可追溯到 1981 年;從缺陷引入到被發現的平均延遲為 26.6 年

這個 26.6 年的平均值,可以說是整個發布中最重要的數字。它直接量測了所有人日常使用的軟體裡沉睡著多少未被發現的漏洞:積壓是以「世代」計的,而模型驅動的審計正以人類未曾有過的速度挖掘它。

揭露的程序也值得稱許——在 cvd.z.ai 公開帳本、分配 CVE、走協調揭露,而不是發一份滿是無法驗證數字的新聞稿。這比多數能力宣告的做法好得多。

權重為何延後

這就回到延後發布的原因。Z.ai 表示,模型在訓練過程中的攻擊性資安能力成長快於預期——據報導,模型開始能跨多個階段推理,為完整的攻擊鏈擬定連貫計畫,而不只是找出單一 bug。GLM-5.2 在軟啟動後幾天內就上架了 MIT 授權的權重;GLM-5.3 是該系列第一個把開源權重擋在額外審查之後的版本,發布時間指向八月底。

不論你是否照單全收廠商的說法,基準數據與其一致:單一漏洞挖掘(CyberGym)小幅進步,而鏈式利用(ExploitBench、ExploitGym)暴增 2.2 到 3.5 倍。能力的增長恰好落在宣稱所說的位置。一個為找 bug 而訓練、量測出攻擊鏈能力、然後在發布權重前踩剎車的實驗室,行為與它的說法自洽。

意義何在

對防守方而言,GLM-5.3 無疑是好消息:審計龐大老舊開源程式碼的成本再度下降,而協調揭露帳本是其他實驗室值得效法的範本。獨立測試者也指出,該模型在最困難的編程基準上仍落後 Anthropic 與 OpenAI 的前沿模型;另有報導稱它已經在 Cursor(最近被 SpaceX 收購的編程工具)中標記出一個安全問題。

對開源權重的辯論,這次發布是真正的轉折點。五週內,開源權重在漏洞利用上與閉源的差距縮半——ExploitBench 上 24.4 對 78.0 的鴻溝,如今是 54.4 對 78.0。一旦權重上架,在自己硬體上跑一個 ExploitBench 54.4 分、約 744B 參數的 MoE、且沒有任何廠商能在審計中途斷你存取權的模型,將成為務實的選項。

對 AI 治理而言,這標誌著一個轉變:高風險能力的存取管控不再只是美國實驗室的故事。一家開源權重實驗室自願因湧現的攻擊能力而延後旗艦發布,讓「開源 vs. 閉源」的框架變得更複雜——審查現在發生在實驗室內、在權重公開存在於世界上之前。

盯著八月底。權重一落地,預算有限與自架環境的資安團隊就能在自己的硬體上取得這一代的能力——而其他人則得到一場現場測試:安全閘門式的開源發布,究竟行不行得通。