← All posts / Research

只有一個模型完成入侵:Booz Allen「網路武器指數」讓 18 個 AI 當駭客實測,一套便宜工具就讓排名失效

Booz Allen 將 18 個美中新模型放到真實企業網路中當自主攻擊者,只有 Claude Mythos 完整走完攻擊殺傷鏈——但第 15 名的 Sonnet 5 加上攻擊框架後就能追平領先者。

只有一個模型完成入侵:Booz Allen「網路武器指數」讓 18 個 AI 當駭客實測,一套便宜工具就讓排名失效

Booz Allen Hamilton 發布了首份網路武器指數(Cyber Weapon Index, CWI),這是迄今最令人警醒的 AI 安全評測。這家國防科技顧問巨頭把 18 個領先的大語言模型——九個美國、九個中國——放上自主攻擊者的位置,每個模型控制一台真實的攻擊機,對一套生產等級的企業網路發動入侵。沒有工具選單、沒有輔助框架、沒有人類操盤。

只有一個模型完成了任務:Anthropic 的 Claude Mythos。而報告中最顛覆的發現是:排名第 15 的模型,在掛上一套便宜的輔助軟體後,戰績幾乎追平整臺最強者。報告的結論相當直白:風險的單位不再是模型,而是系統。

測試怎麼做

多數 AI 資安評測衡量的是模型「知道什麼」——漏洞知識問答、CTF 解題。CWI 衡量的是模型「做了什麼」。18 個模型各自獲配一台攻擊機,對一套有防禦的 Active Directory 網路逐一發出指令,目標是從初始入侵一路推進到完整的網域管理者控制權。

三個設計選擇讓結果格外可信:

  • 沒有現成工具。 模型收不到任何駭客工具清單或代理框架,藉此隔離出裸模型本身的能力邊界。
  • 看紀錄、不聽自吹。 每個動作都透過網路流量、主機日誌、網域控制站資料與入侵偵測感測器驗證。得分依據是網路日誌證明的事實,不是模型宣稱的戰果。
  • 條件完全對稱。 美中模型在相同條件下測試,首度做到兩大 AI 生態系攻擊能力的公正比較。

每個模型的 CWI 總分由兩部分組成:漏洞研究分數(VRS)——能否在沒有原始碼的情況下,找出被植入或新穎的漏洞——以及殺傷鏈達成分數(KCAS),依模型在端對端入侵中推進的距離計分,含「有憑證」與「無憑證」兩種情境。

排行榜

18 個模型按 CWI 總分由高至低:

  1. Claude Mythos(Anthropic)— 80
  2. Grok-4.5(xAI)— 49
  3. GPT-5.6 Sol(OpenAI)— 46
  4. Muse Spark 1.1(Meta)— 38
  5. Kimi K3(月之暗面)— 38
  6. GLM-5.2(Z.ai)— 37
  7. Claude Opus 4.8(Anthropic)— 36
  8. GPT-5.5-Cyber(OpenAI)— 34
  9. Nemotron-Ultra(輝達)— 33
  10. DeepSeek-V4-Pro — 23
  11. DeepSeek-V4-Flash — 17
  12. Qwen3.5-397B(阿里巴巴)— 17
  13. MiniMax-M3 — 15
  14. Nemotron-Super(輝達)— 15
  15. Claude Sonnet 5(Anthropic)— 13
  16. GLM-4.5-Air(Z.ai)— 11
  17. Qwen3.6-35B(阿里巴巴)— 9
  18. Qwen3-Coder(阿里巴巴)— 4

Claude Mythos 的表現自成一檔。拿到一份被竊的員工憑證後,它每一次都取得管理者控制權——而且它是根據網路內部所見自行規劃提權路徑,不是照著預寫的攻擊腳本走。在更難的無憑證測試中,它從外部突破防線,最終仍達成完整網域攻陷。沒有其他模型做到這一點。

龍頭底下的能力分布,才是真正讓 CISO 們睡不著的部分:

  • 四個模型——Mythos、Grok-4.5、Muse Spark 1.1、GLM-5.2——達成完整網域存取與控制。
  • 再四個——GPT-5.6 Sol、Kimi K3、GPT-5.5-Cyber、DeepSeek-V4-Pro——在網路內完成橫向移動。
  • 兩個——Claude Opus 4.8 與 Qwen3.5-397B——取得可擴大存取權限的憑證。
  • 除了一個例外(Qwen3-Coder),其餘全部自主完成初始入侵。

值得注意的是,Booz Allen 發現美中模型之間沒有顯著差距。能力曲線取決於前沿訓練規模,而非地緣——該公司評估,18 個模型中的多數將在六個月內具備 Mythos 等級的完整殺傷鏈能力。

讓排行榜失效的發現

接著,報告親手拆掉了自己的排行榜。Claude Sonnet 5 以 13 分排名第 15。當 Booz Allen 給它掛上攻擊框架(attack harness)——連接模型與駭客工具、讓它保持專注的軟體層——它的表現直逼 Mythos。67 分的差距,被「水管工程」填平了。

框架讓模型能保持專注、隨機應變、從失敗中恢復,並把單一動作串成持續性攻擊行動。這對威脅模型的意義深遠:攻擊者不需要前沿模型,只需要一個中階模型加上好的工程。Booz Allen 承認尚未測試中國或開放權重模型搭配優化框架的組合——而其結果「強烈暗示」這類完整威脅組合已經存在於野外。

第二個被忽略的發現強化了同一課題:某個模型以「沒有憑證」為由拒絕了任務,而它的網安特化兄弟模型接到完全相同的任務後,照做並完成了攻擊。Booz Allen 的通則:護欄不是模型的固定屬性,其效力隨情境與設定而變。在某個設定下觀察到的拒絕,對另一個設定不具任何參考價值。

所有模型仍會失敗的地方

最明確的能力邊界是真实世界的漏洞研究。面對刻意植入的漏洞,所有模型——無論美中、開放或閉源——都接近滿分。模型出身毫無影響。

但面對埋在大型生產級函式庫中的真實未見漏洞時,九個前沿 API 模型全部得零分。某個未具名的領先模型正確分析了有漏洞的元件,卻判定它安全。只有 Anthropic 的前沿模型發現了該漏洞,且只有 Mythos 理解到足以利用的程度。(Mythos 早有前科:五月時它曾在單月內找出 10,000 個重大漏洞。)

Booz Allen 將這個落差視為喘息空間:真實攻擊能力仍落後評測分數,為防禦方爭取到缺口閉合前的時間。該公司稱,來自勒索軟體集團與國家支持的駭客組織的主流 AI 攻擊已「迫在眉睫」,並以七月的 Hugging Face 資安事件為證——那是模型第一次在實驗室之外、在真實世界中走完殺傷鏈。

Booz Allen 要華府做什麼

報告的政策建議讀起來像國防承包商的願望清單——閱讀時也應留意,Booz Allen 在同一份新聞稿中發表了反制 AI 產品 Vellox Labs Guile(並宣稱、但未經第三方驗證,協同反制 AI 劇本在其自家測試中將攻擊成功率降低逾 95%)。但政策訴求與銷售話術是可以分開檢視的:

  • 約束性的整備標準:為關鍵基礎設施營運商設定可執行、分部門的期限,強制證明能遏制 AI 發動的入侵。
  • 持續性量測:建立國家級計畫,在擬真條件下測試外國與開放權重模型——因為對手一定會為它們掛上優化框架。
  • 攻勢性壓倒優勢:「我們必須積極發展代理式能力,加速授權的攻勢網路行動,同時建構能以機器速度偵測、決策、回應的 AI 防禦,」報告主張。
  • 治理下的存取權:讓通過審核的防禦者能在受控條件下使用他們必須防禦的攻擊能力。

有一個模型 conspicuously 缺席這份指數:OpenAI 的 GPT-6 Astra,並未受測。OpenAI 週二表示,Astra 已達到該公司「關鍵」網路安全能力門檻——意味著它找出並利用零時差漏洞的能力極強,無論是被惡意使用者利用、還是模型本身失準(misaligned),都對關鍵系統構成重大風險。換句話說,這份指數出版之時,它所丈量的戰場又已經向前移動了。

來自 McLean 總部的結論:模型本身就是攻擊者。問題不再是 AI 能否自主執行精密入侵——已有一個證明可以,另外十七個緊追在後,而一套夠好的框架能讓連落後者都變得危險。