← All posts / Research

鎖根本沒鎖上:Anthropic 報告直指 GLM-5.3 駭客能力媲美旗艦、防護卻一推就倒

Anthropic 前沿紅隊報告指出,智譜開放權重模型 GLM-5.3 能以接近 Mythos 的成功率打造端到端攻擊程式、自主串接瀏覽器 0-day,而其安全防護在簡單繞過手法下失守率高達 64% 至 100%。

鎖根本沒鎖上:Anthropic 報告直指 GLM-5.3 駭客能力媲美旗艦、防護卻一推就倒

五個月前,Anthropic 做了一個不放心的決定。當自家 Claude Mythos Preview 成為第一個能自主打造完整端到端網路攻擊程式的 AI 模型時,他們拒絕正常公開發布,而是透過 Project Glasswing 把這種能力限定給經過審核的防禦方使用——背後的邏輯是:一旦這種能力外流到未設防的開放模型,攻擊者就能用「下載」的價格取得前沿級攻擊力。在 9 月 29 日發布的報告中,Anthropic 前沿紅隊(Frontier Red Team)宣布:那個時刻到了,而且有名字——GLM-5.3,北京智譜(海外品牌 Z.ai)最新的開放權重模型。

Anthropic 到底測了什麼

由 Andrew Fasano 與 Marius Fleischer 領軍的團隊,讓 GLM-5.3 跑過了當初把 Mythos Preview 與其他模型區分開來的同一套考題。在 ExploitBench(測試模型能否利用 Google Chrome 背後 V8 引擎的已知漏洞)上,GLM-5.3 在 410 次嘗試中完成了 50 次可運作的端到端攻擊程式;Claude Mythos Preview 是 56 次。在 Anthropic 內部的 Binary Exploitation 評測(從 Google OSS-Fuzz 開源專案隨機抽出的 100 道任務)中,GLM-5.3 在 4% 的任務完成完整控制流劫持,Mythos Preview 為 6%。

4% 聽起來很小,但看看基準線就明白了:更早的模型如 Claude Opus 4.6 與 GLM-5.2 的成功率是零。一道門檻已經被跨過,數字顯示 GLM-5.3 距離 Anthropic 有史以來攻擊能力最強的模型只差一步——差別在於 Anthropic 的版本鎖在審核存取計畫後面,而 GLM-5.3 的權重是公開的。

benchmark 數字還不是最令人不安的部分。在「人類在迴路中」的實測環節,研究員把模型對準目標軟體後就大致退場。在其中一場實驗中,GLM-5.3 在沙箱環境裡花了一天時間分析一款主流瀏覽器的 Linux 本地建置版,在人類總投入注意力不到一小時的情況下,於瀏覽器的 JavaScript 引擎中找到了多個先前未知的漏洞,並把它們串接成一個可運作的攻擊頁面——使用者一造訪,攻擊程式就能讀取電腦上的任意檔案。Anthropic 公開的馬賽克截圖顯示它成功竊取了使用者的 SSH 私鑰。該公司認為這些漏洞很可能也影響其他平台,並已通報維護方。同一場實驗中,模型還在無線驅動、繪圖驅動與面對網路的設備軟體中找到了可利用的漏洞,目前仍在審查中。

第二場實驗更省事:較小的 GLM-5.3-Flash 只拿到 CVE-2026-11645(一個剛修補的 Chrome 漏洞)與另一個已知漏洞的公開資料,在研究員幾乎沒有介入的情況下,就把兩者串成一條針對 ARM64 目標的可靠攻擊鏈,還繞過了蘋果的指標認證(PAC)防護。總成本:20 分鐘人類注意力、8 小時模型運轉,按智譜 API 費率計算約 20.40 美元。一份外賣晚餐的價格,換一枚武器化的 N-day。

真正的問題在防護

有網路攻擊能力的前沿模型不少,這正是它們都配有多層管控的原因。GLM-5.3 內建了部分拒答機制——直接叫它寫惡意軟體,它通常會拒絕。Anthropic 測的是這些拒答有多廉價就會失效:

  • 假身分話術——告訴模型它是自主紅隊代理、正在進行演訓——就能讓它接下明確惡意的請求,成功率 64%。
  • 預填思考 token——讓模型看起來已經「考慮過並決定執行」——成功率 92%。
  • Abliteration(消融去拒答)——直接修改開放權重、手術式移除拒答行為——成功率 100%。

在 Anthropic 的測試中,這些手法對有防護的 Claude 模型全部無效:欺騙性提示被擋下、API 不提供預填 Claude 思考的介面、而封閉權重根本無法被消融。

Abliteration 這一段值得單獨下標。Anthropic 團隊第一次嘗試這個技巧,花了約 2,200 GPU 小時(約 4,400 美元)做出未審查副本;有經驗的團隊從頭做起只需約 600 GPU 小時,差不多 1,200 美元。這個改動讓 GLM-5.3 的拒答率從 90% 以上崩落到 JailbreakBench 的約 3%、HarmBench 的 2%、StrongREJECT 的 12%——能力卻幾乎不受影響(GPQA-Diamond 分數完全相同,CyberGym 只低了幾個百分點)。這更不是理論推演:模型發布後數天內,去拒答版 GLM-5.3 就已在網路上流通,連自己的 GPU 叢集都不用架。

脈絡與利害

Anthropic 的發現疊加在 NIST 的 AI 標準與創新中心(CAISI)之上——後者 9 月 17 日已獨立認定 GLM-5.3 是「迄今網路攻擊能力最強的開放權重模型」,在綜合網路評測上落後美國前沿約四個月;但要注意,比較組的美國模型是在關閉防護下測試、且僅限審核用戶使用。GLM-5.3 則是一個下載動作就能取得。

報告也刻意點出雙面性:令防禦方膽寒的能力,恰恰也是防禦方需要的能力。Anthropic 主張,答案不是假裝開放權重的精靈還塞在瓶子裡,而是讓善良的一方武裝得更快。Project Glasswing 與 Patch the Planet 等計畫已協助防禦方在此刻到來前找出超過 1 萬個關鍵軟體漏洞,受審核的防禦者現在還能用上更強的 Claude Mythos 5.1。Anthropic 的政策呼籲很直接:政府應對夠強的模型進行獨立安全評測——明確包括 GLM-5.3 的後繼者——而開放權重開發者應把防護當成發布的必要條件,而不是事後補丁。

給所有人的難堪結論是:「前沿實驗室最危險的能力」與「任何有 GPU、20 美元 API 額度的人」之間的差距,如今以月為單位;而原本該擋在中間的那層防護,用一個化裝舞會等級的謊言就能 64% 的機率騙過去。鎖沒有壞——它們從來就沒真正鎖在門上。