← All posts / Models

GLM-5.3 的駭客能力超出 Z.ai 預期——開源權重因此暫緩發布

Z.ai 的新編程模型在正式環境軟體中找到 2,436 個真實漏洞,並成為首個因安全審查而暫緩開放權重的 GLM 版本。

GLM-5.3 的駭客能力超出 Z.ai 預期——開源權重因此暫緩發布

2026 年 8 月 14 日 Z.ai 發布 GLM-5.3 時,原本的主打賣點是編程能力:在自家 Code Bench 上比前一代提升 50%,而且用的是與 GLM-5.2 完全相同的基礎模型——所有進步都來自後訓練(post-training)。但過去一週讓這次發布持續佔據新聞版面的,卻是該公司坦承沒有完全預料到的現象:模型透過訓練資料中植入的漏洞偵測任務所培養出的資安能力,隨著訓練規模擴大而不斷增長,遠超 Z.ai 的預期——模型開始自主組合出完整的漏洞利用鏈(exploitation chain)。結果是 GLM 系列的首例:通常伴隨發布同步開放的模型權重,這次被暫緩約兩週,進行額外的安全審查與強化。

光靠後訓練就帶來 50% 的編程躍進

GLM-5.3 與 GLM-5.2 共用同一個基礎模型,所有提升都來自預訓練之後的工序,這讓進步幅度更顯可觀。在 Z.ai 內部 Code Bench 上,模型得分比前代高 50%;在公開基準上,Z.ai 報告它在 Terminal-Bench 3.0(28.3% 對 GLM-5.2 的 4.6%)與 Agents’ Last Exam(CLI)取得開源模型中的最佳成績。

技術細節對評估是否遷移的開發者很重要:GLM-5.3 僅支援文字輸入,具備 1M token 上下文視窗與 128K 最大輸出。推理功能永遠開啟、無法停用,改以三段強度(low、high、max)調節深度,複雜編程任務建議使用 max。API 同時支援 OpenAI Chat Completion、OpenAI Response 與 Anthropic Message 相容協定;每月 18 美元起的 GLM Coding Plan 採點數制,離峰時段(含整個週末)只消耗一半點數。

Z.ai 將編程進步歸功於訓練環境的重新設計:任務不再像「編程練習題」,而更像「真實的專家工作單元」——有些任務相當於資深工程師數天的工作量,例如在給定運算叢集、儲存系統、內部文件、程式碼庫與實驗結果的環境中,診斷訓練基礎設施的瓶頸、實作優化、執行實驗,並在保持正確性的前提下交付可量化的端到端加速。

意外:湧現的漏洞利用能力

真正出乎意料的部分在資安領域。Z.ai 在後訓練中加入了漏洞偵測資料與環境,預期得到一個更強的找漏洞模型。但實際觀察到的現象在質的層面上不同:GLM-5.3 不只是更擅長辨識孤立缺陷——它開始跨越漏洞利用的多個階段進行推理,為完整的利用鏈形成連貫計畫。

三個基準測試勾勒出全貌。在 CyberGym(從白箱原始碼出發,測試模型能否透過觸發故障來辨識並驗證漏洞)上,GLM-5.3 拿到 84.5%,不僅遠高於 GLM-5.2 的 77.2%,更是該基準的最佳成績,領先 Anthropic 的 Mythos 5(83.8%)與 OpenAI 的 GPT-5.6 Sol(83.6%)。在需要對真實漏洞及其利用進行更深層推理的 ExploitBench 上,GLM-5.3 以 54.4% 比前代翻倍有餘——但仍落後 Mythos 5(78.0%)與 GPT-5.6 Sol(76.5%)約 24 分。在以時間標準化預算計算完成任務數的 ExploitGym 上,GLM-5.3 兩小時完成 105 項、六小時 130 項(GLM-5.2 為 29 與 39),而 Mythos 5 仍以 181 與 247 大幅領先。

Z.ai 對這個型態的總結罕見地坦白:基準在利用鏈上位置越深,相對 GLM-5.2 的增幅越大——但與閉源前沿的差距也越大。能力成長最快的區域,恰好是開源模型落後最遠的區域。

2,436 個真實漏洞,最老的 40 歲

基準測試是一回事,正式環境軟體是另一回事。自 GLM-5.2 起,Z.ai 就與中國多個資安團隊合作,讓模型對真實程式碼庫進行測試。經過專家審查、篩選與去重後,GLM-5.3 的測試計畫在 269 個專案中辨識出 2,436 個漏洞,其中 1,097 個屬中高嚴重度。範圍涵蓋系統核心、作業系統、瀏覽器引擎、開源基礎設施、網頁應用與網路協定——包括 Linux 核心、WebKit 瀏覽器引擎與 FreeBSD。

最引人注目的細節或許是:許多漏洞已潛伏數年甚至數十年無人察覺,最古老的一個可追溯約 40 年前——約 1981 年就寫入程式碼的缺陷,比現在負責修補它的部分工程師還年長。VentureBeat 另外報導,模型在測試期間也在 Cursor(AI 編程工具)中標記出一個嚴重漏洞。

這些發現已發展成持續性的揭露工作:Z.ai 建立了 Security Disclosure Ledger(安全揭露帳本),公開記錄每項發現在揭露流程中的進度,區分已公開與仍在協調揭露中的問題。對已揭露的漏洞,帳本記錄受影響專案、嚴重度、可取得的 CVE 編號,以及該缺陷在程式碼庫中存活的時間。

權重為何被暫緩

對一個以開放權重為品牌核心的實驗室而言,延後旗艦發布是重大抉擇。Z.ai 表示,模型的漏洞利用技能在訓練期間的增長速度超出預期,將權重暫緩約兩週進行額外安全審查是刻意設下的關卡——這是 GLM 系列第一次這麼做。公開權重現指向 8 月底,屆時自架團隊才能在自己的硬體上運行這一代模型;在此之前,只能透過 GLM Coding Plan 與 Z.ai 的 ZCode 工具使用。

與模型同時,Z.ai 推出了以 GLM-5.3 為基礎的程式碼庫掃描器 OpenVuln。它沒有一口氣全面開放,而是先提供給經挑選的信任資安夥伴,兩週內再擴大——與模型本體相同的分階段邏輯。Z.ai 將 OpenVuln 定位為防禦工具:給每個資安團隊一支更快的手電筒,在入侵者之前找到黑暗建築裡的問題。公開揭露帳本追蹤每項發現直到修復,則是為了確保這些工作不會只留下一份無人處理、可供利用的弱點清單。

沒人解開的兩難

這起事件具體呈現了整個產業如今公開面對的困境:能找出並推理漏洞的模型,其價值與它利用漏洞的能力成正比——修補漏洞的技能,同樣可以武器化。OpenAI 在同一季推出了找漏洞並修復的代理 Codex Security;Anthropic 的模型在公開評估中也展現過類似的雙重用途行為。GLM-5.3 的特殊之處在於失敗模式的透明:Z.ai 預期得到更強的找漏洞模型,得到的卻是會規劃多階段攻擊鏈的系統,而它的回應是放慢定義自身聲譽的開放權重時程。

獨立測試者指出,GLM-5.3 在最困難的編程基準上仍落後 Anthropic 與 OpenAI 的前沿模型。但 CyberGym 的結果——開源血統模型站上排行榜首位,領先 Mythos 5 與 GPT-5.6 Sol——顯示差距並不均勻。真正值得關注的是軌跡:每一輪後訓練正在以比編程數據更快的速度複合堆疊資安能力。

對防禦方而言,這筆帳大致划算:1,097 個中高嚴重度發現,透過協調揭露與公開帳本處理,對生態系是實實在在的收穫。對開放權重的政策辯論,這卻是更棘手的案例——延後權重的理由過去是理論性的,現在則附上了一張基準測試成績單。無論如何,8 月底強化版權重預定釋出時,將是今年最受矚目的開源發布之一。