前沿模型拒絕應戰:深入 Artificial Analysis 全新網路防禦指標
Artificial Analysis 推出 Cyber Index,以 351 道專家審核任務評測 AI 的完整防禦迴圈——發現、重現、修補漏洞。最大亮點:前沿模型拒絕高達 98% 的記憶體安全任務,由 Grok 4.7 與小米 MiMo-V2.6-Pro 以 56 分並列榜首。
評測機構 Artificial Analysis 悄悄推出了迄今最認真的嘗試,要回答每個資安團隊都在問的問題:我該信任哪個 AI 模型來找出並修補程式碼中的漏洞?而新版 Cyber Index 揭曉的答案,出乎所有人的意料。
這項指標於 9 月 25 日與新成立的 Cyber Index Alliance(網路指標聯盟)同步發表——Collinear AI、IBM、NVIDIA 與 Vercel 為創始合作夥伴——評測模型在完整防禦迴圈的表現:在程式碼庫中發現漏洞、重現並驗證漏洞、修補漏洞且不破壞既有功能。至關重要的是,它純粹以防禦為導向:模型像審計應用程式的資安工程師一樣從原始碼出發,且從不要求任何模型打造可用的攻擊程式(exploit)。
整體榜單的結果是個悖論。Grok 4.7(xhigh)與小米的 MiMo-V2.6-Pro 以 56 分並列第一,GPT-6 Luna(max)以 53 分緊追在後。不是 Anthropic 的 Claude,也不是最貴的前沿旗艦。原因出在結構上:在記憶體安全評測中,GPT-6 Astra、GPT-6 Sol、Claude Fable 5.1、Claude Opus 5.5、Qwen3.8 2.4T A95B 與 Qwen3.8 27B 全部拒絕了至少 98% 的任務,導致根本無法評估前沿模型在一整類真實世界漏洞上的表現。
三項基準,一個防禦迴圈
Cyber Index v1 是三項評測的等權重平均,共 351 道由產業夥伴與學界審核的任務:
CWE-Bench-AA(來自 Collinear AI)是完整的安全審計。代理人收到一個開源專案的程式碼 checkout,以及「審計程式碼並修復發現的問題」的指令。任務重現已披露的 CVE,只描述疑慮範圍但不透露確切位置,涵蓋 OWASP Top 10(2025)全部十大類別,横跨 C/C++、Go、Java、JavaScript/TypeScript、Python 與 Rust。測試集包含 120 道私有的保留任務。唯有當程式化驗證器確認攻擊已失效且正常功能仍運作時,任務才算解決——沒有部分得分,沒有 LLM 評審。
DeepsecBench-AA(來自 Vercel)單獨隔離「發現」過程。代理人審查掃描器標記的開源應用程式碼,回報能確認的每一個漏洞,以 F2 分數(召回率權重高於精確率)對照專家驗證的黃金標準集計分。
CyberGym-E2E-AA(來自 Berkeley RDI)是三者中最難的:131 道任務、每個專案一道,針對 FFmpeg、CPython 等廣泛使用的 C/C++ 專案中的真實記憶體安全漏洞。模型必須定位臭蟲、寫出觸發崩潰的概念驗證輸入(proof-of-concept)、修補到崩潰不再重現——同時專案自身的功能測試也必須全數通過。
三項評測全部跑在 Artificial Analysis 的開源代理人框架 Stirrup 上,於無網路存取的沙箱環境執行。且因為網路工作具雙重用途,團隊將安全拒絕與分數分開追蹤——被拒絕的任務計零分。
前沿模型為何拒絕
拒絕率這項發現值得單獨下標。記憶體安全工作——也就是大批重大 CVE 背後的 C/C++ 漏洞類別——正好落在供應商安全系統會介入的雙重用途地帶。要求模型寫出讓 FFmpeg 崩潰的概念驗證輸入,在過濾器眼中,與要求它打造攻擊程式無異。
結果就是一個無法在整個漏洞類別上衡量最佳模型的基準。前沿實驗室主張拒絕是負責任的預設;資安從業者則反駁:一個不肯找 null-pointer 崩潰的代理人,對防禦基礎設施的團隊毫無用處。Cyber Index 首次讓這個張力變得具體且可量化——拒絕紀錄就攤在安全阻擋欄位裡,逐一模型、逐一基準。
模型究竟怎麼失敗
失敗分析才是這項指標的真正價值所在。在 CWE-Bench-AA 上,失敗集中在兩種模式:部分修補(占失敗嘗試的 55%——模型修好了主要問題,卻留下相關漏洞,例如第二個入口點)與過度修正(約 24%——修補破壞了正當行為)。值得注意的是,過度修正最常發生在最強的模型上,占前四名高得分模型失敗的約 40%,相較之下低分組僅約 15%——因為有信心的模型會持續編輯,直到弄壞正當功能的某個邊角案例。
在 DeepsecBench-AA 上,表現最好的模型也只能找出專家驗證問題的 41%。模型能可靠找出「從不可信輸入直接通往後果」的缺陷,但極少發現需要推理事件序列或考量業務與隱私規則的臭蟲。而當模型真的回報這類較難的事件序列漏洞時,幾乎總是對的——95% 的此類回報正確——GPT-6 Sol 與 GPT-6 Astra 約在 30% 的執行中發現它們,是一般模型的兩到三倍。Artificial Analysis 認為,這可能是一項正在浮現的新能力。
在 CyberGym-E2E-AA 上,發現本身就是瓶頸:42% 的嘗試跑滿 90 分鐘仍未能產生崩潰輸入。越界(out-of-bounds)臭蟲的通過率為 50%,use-after-free 僅 33%(需要跨多個操作推理物件生命週期),整數與算術臭蟲更只有 20%。還有一個足以讓任何代理人樂觀主義者謙卑的發現:通過的嘗試中有 31% 修錯了臭蟲——確實修掉了一個崩潰,但不是目標漏洞,通常是 null-pointer 解參考這類較淺層的問題,模型因為那是它最先能驗證的東西就停手了。
聯盟與下一步
Cyber Index Alliance 的定位是一個常設聯盟:合作夥伴對範圍與方法論貢獻專業意見,也可直接貢獻資料集。Collinear AI 將 CWE-bench 作為私有保留評測提供;Vercel 亦然(DeepsecBench);IBM 與 NVIDIA 則提供方法論建議。有意加入的組織可透過 cyber@artificialanalysis.ai 聯絡。
路線圖明確列出了缺口:事件回應(incident response)、撰寫不引入漏洞的新程式碼、以及無原始碼可得的目標(編譯後軟體、線上伺服器)都規劃在未來版本中。至於將發現的漏洞轉化為可用攻擊程式的「exploit 實作」,則永久排除在防禦導向的指標之外。
為什麼重要
迄今為止,模型行銷中的「網路能力」意味著帶攻擊色彩的演示,或合成 CTF 解題的單一分數。Cyber Index 衡量的反而是枯燥卻決定成敗的工作:代理人能否審計真實的程式碼庫、找出掃描器標記的臭蟲、證明它會崩潰、並在不造成附帶傷害的前提下修補——而且成本是資安團隊真正付得起的?分數對照每任務成本的圖表,可以說是 Artificial Analysis 迄今發表過最貼近企業需求的圖。
第一份榜單已經對產業的安全姿態做出裁決:最有能力防禦記憶體不安全程式碼的模型,恰恰是其開發者自己的設定中最不願意嘗試的那批。這個平衡是否恰當,如今是一個有數字佐證的問題——而這個聯盟有十足的理由持續追問下去。
Sources
- [1] https://artificialanalysis.ai/articles/artificial-analysis-cyber-index
- [2] https://artificialanalysis.ai/evaluations/artificial-analysis-cyber-index
- [3] https://www.developer-tech.com/news/artificial-analysis-cyber-index-tests-defensive-ai-security-models/
- [4] https://news.lavx.hu/article/artificial-analysis-launches-cyber-index-for-ai-powered-cyber-defense