六比零:在 OpenAI 與 Anthropic 前沿模型掛零之後,AISLE 的自主 AI 系統在 curl 找出 6 個 CVE
Anthropic Mythos 與 OpenAI Codex Security 對 curl 回報「找不到更多問題」數天後,一家新創的專用 AI 系統提交了 29 份報告——其中 6 個成為 curl 8.22.0 的正式 CVE,Linux 核心維護者直言自己看到了同樣的現象。
2026 年 8 月 24 日,curl 的創始人兼首席開發者 Daniel Stenberg 發了一則看似「健康檢查全數通過」的狀態更新:下一個版本只剩三個待處理的 CVE,而他持續用來掃描程式碼的前沿 AI 資安系統全部空手而歸。「[Anthropic] Mythos 說它找不到更多了,」他寫道,「[OpenAI] Codex Security 給了一份空清單。」
七十二小時之內,這個結論被整個翻了過來。
事件經過
Stenberg 在 2026 年大半時間裡,有系統地把市面上每一套認真做 AI 程式碼稽核的系統都拿去跑 curl——這是全世界被審計次數最多的開源程式碼庫之一。這個函式庫部署在估計超過 200 億個實例上,從智慧冰箱到太空載具都有,因此即使只是「低嚴重度」的發現,也可能影響真實的基礎設施。
在前沿模型掛零的結果公開之後,一家名為 AISLE 的新創公司把自己開發的自主漏洞挖掘系統丟到了同一份正式版程式碼上。第二天,在 AISLE 的審查流程甚至還沒跑完之前,Stenberg 就發出了第一份公開對比:「Mythos:0,Aisle:29。」
在 AISLE 的 29 份報告中,curl 的資安團隊在幾天內完成了其中 6 項的審查,認定其嚴重程度足以列入 curl 8.22.0 的正式 CVE——該版本現已發布:
- CVE-2026-80229 — OpenSSL provider 使用後釋放(use-after-free)
- CVE-2026-80230 — OpenSSL 憑證固定繞過(pinning bypass)
- CVE-2026-80231 — 原生 CA store 連線重用
- CVE-2026-80255 — 以 tab 字元繞過 secure 屬性
- CVE-2026-82208 — wolfSSL CA 快取命中覆寫回呼
- CVE-2026-82209 — 網域範圍的 public-suffix cookie 問題
這六個漏洞全部評為低嚴重度。其中三個在 8 月 24 日回報、兩個在 8 月 26 日、一個在 8 月 27 日。到 8 月 28 日,curl 的待處理 CVE 數量從 3 個上升到 10 個——其中 6 個全部來自 AISLE。
為什麼這次對比異常乾淨
AI 系統之間的正面交鋒向來爭議不斷:模型可能在訓練資料裡看過答案;評測框架獎勵的是「長得像評測」的行為,而不是真正的發現能力。但這次事件具備一個幾乎所有 AI 評測都不具備的性質:基準結果在競爭結果存在之前,就已經公開且帶有時間戳。
Stenberg 在 8 月 24 日發布了前沿系統的掛零結果,AISLE 才在那之後對正式版程式碼跑了自己的系統。這裡沒有 capture-the-flag 的旗子可搶,沒有附帶標準答案的評測集——只有當下的正式程式碼,而且由 curl 的維護者(而非 AISLE 自己)來認定什麼是真漏洞、什麼夠格拿 CVE。正如 AISLE 創辦人 Stanislav Fort 所說,CVE 並非完美的指標,但每一個都代表正式程式碼中一個先前未知的缺陷,經過領域專家重現、認可,並為已部署的使用者修復。
脈絡:這場較量已經進行了一整年
八月這個結果其實是一場長期戰役的最新回合。早在五月,Stenberg 就記錄過另一次稽核:Anthropic 受限發布的 Claude Mythos 模型回報了五個「已確認的資安漏洞」,但 curl 團隊審查後只認可其中一個低嚴重度問題——三個是誤報、一個是早已記錄在案的舊問題。當時專家們意見分歧:Mythos 的表現究竟代表前沿模型的網安能力被高估了,還是 curl 這個程式碼庫真的已經「沒蟲可抓」?
八月的掛零結果一度支持後者:也許程式碼真的被撿乾淨了。而 AISLE 的 29 份報告則有力地支持前者——或者至少支持這個主張:通用前沿模型與專用挖掘系統,如今已是兩種不同等級的工具。
Linux 核心的迴響
這個模式可能不僅限於 curl。Linux 穩定版核心的資深維護者 Greg Kroah-Hartman 在回應 Stenberg 的貼文時,寫下了一句值得廣泛流傳的話:「我在 Linux 上也看到同樣的現象。不知道 Aisle 到底做了什麼不一樣的事,但……哇。」
當全球部署最廣的核心的發布者公開表示,一套 AI 系統的發現能力把前沿實驗室的工具甩在後面——而且坦承自己無法解釋這個差距——這個訊號值得認真對待。它也對每一個大型開源專案拋出一個實際問題:如果專用 AI 系統能在地球上被審計得最徹底的程式碼上,做出 6 倍到 29 倍的報告量差距,那麼在完全沒有 curl 這種審計強度的、一般水準的程式碼庫上,它們又會挖出什麼?
為什麼六個 CVE 都是「低嚴重度」——而這正是重點
把低嚴重度的發現當成雜訊很容易,但反向解讀才更準確。curl 已經吸收了數十年的稽核、模糊測試(fuzzing),以及整整一年的密集 AI 掃描。能在這種程式碼庫裡存活下來的漏洞,都藏在狹窄的配置條件與細微的互動之中——OpenSSL provider 的邊角案例、cookie 網域範圍判定的怪癖、只在特定建置下才觸發的 TLS pinning 繞過。要找到它們,需要的不是蠻力模式匹配,而是對條件路徑的耐心、系統性窮舉。
而這正是專用自主系統被設計來做的那種枯燥、徹底的工作;最佳化成一萬種任務通吃的通用模型,反而可能把它邊緣化。嚴重度評等衡量的是爆炸半徑,不是發現難度。
「系統重於模型」的論點
AISLE 把這個結果定位成其「System over Model」主張的證據:一套目的明確的挖掘系統——緊密耦合的工具鏈、持續的自主搜尋、領域專屬的驗證迴圈——可以在真實世界的零日漏洞挖掘上,與前沿實驗室的模型競爭甚至勝出。單一數據點當然證明不了一個命題,但這個數據點的結構很難反駁:同樣的程式碼、同一週、公開帶時間戳的基準、由維護者本人進行的外部裁決。
對 AI 產業來說,這個啟示落在天平的兩端。前沿實驗室該擔心的是:自家旗艦資安產品在自己最擅長的擂台上被公開超越。而各地的資安團隊該注意的是:「最佳通用模型」與「最佳專用系統」之間的挖掘差距,如今是用整數倍來衡量的,不是用百分比。
對 curl 與 Linux 的使用者來說,眼前的新聞單純是好消息:又找到、確認並修復了六個真實的漏洞(curl 8.22.0)。更深層的新聞,則是關於「誰」——或者說「什麼」——找到了它們。
資料來源
- AISLE:〈AISLE Discovered Six curl CVEs After OpenAI and Anthropic Found Zero〉(2026-09-02)
- Daniel Stenberg:〈Mythos finds a curl vulnerability〉(daniel.haxx.se,2026-05-11)
- Hacker News 討論串:〈Six curl CVEs after OpenAI and Anthropic came back with zero〉
- SecurityWeek:〈Claude Mythos Finds Only One Curl Vulnerability. Experts Divided on What It Really Means〉(2026-05-12)
- curl 官方資安頁面:curl.se/docs/security.html
Sources
- [1] https://aisle.com/blog/aisle-discovered-six-curl-cves-after-openai-and-anthropic-found-zero
- [2] https://daniel.haxx.se/blog/2026/05/11/mythos-finds-a-curl-vulnerability/
- [3] https://news.ycombinator/item?id=49536114
- [4] https://www.securityweek.com/claude-mythos-finds-only-one-curl-vulnerability-experts-divided-on-what-it-really-means/
- [5] https://curl.se/docs/security.html