OpenAI GPT-5.6-Cyber 發現兩個真實 Chrome 零日漏洞
OpenAI 專門訓練的資安模型發現了兩個先前未知的 V8 引擎漏洞,已由 Google 修補為 CVE-2026-15903,並在進階資安任務上達到 95% 完成率。
OpenAI 發布了 GPT-5.6-Cyber,一款專為資訊安全設計的 AI 模型。它已經在真實世界中證明了自己的實力:在 Chrome 的 V8 JavaScript 引擎中發現了兩個先前未知的零日漏洞,其中一個已被 Google 修補,編號為 CVE-2026-15903。這款模型代表著 AI 輔助漏洞研究的一大躍進——也是對傳統上限制 AI 模型在攻擊性安全領域應用的謹慎拒答策略的一次刻意突破。
一個驗證概念的實戰發現
最引人注目的成果是具體且可驗證的。OpenAI 的研究人員使用 GPT-5.6-Cyber 對 V8——驅動 Google Chrome 的 JavaScript 引擎——進行深入調查。模型發現了兩個先前未知的漏洞,這兩個漏洞可以被串接使用,導致記憶體損壞並逃逸 V8 的堆積沙箱——這是一類位於編譯器理論與漏洞利用技術交叉點上的高難度漏洞。
其中較嚴重的一個被命名為 CVE-2026-15903,是 V8 優化編譯器中的一個高危漏洞。該編譯器錯誤地跳過了一項安全檢查,創造出攻擊者可用來實現越界記憶體存取的條件。當與第二個漏洞串接時,攻擊者可能突破 V8 的堆積沙箱——這是邁向完整瀏覽器控制權的關鍵一步。
Google 透過協調漏洞揭露流程收到了通報,並發布了修補程式。一個 AI 模型,以研究角色運作,獨立地在一個全球受到最嚴格模糊測試的程式碼庫中發現了全新漏洞——這是 AI 驅動資安研究的分水嶺時刻。
95% 完成率:刻意的對齊策略轉變
發布數據中最驚人的數字莫過於完成率。OpenAI 建立了一套內部評測標準,稱為「進階資安任務評估」(Advanced Cybersecurity Tasks evaluation)。在這項測試中,GPT-5.6-Cyber 完成了 95.0% 的請求。這個數字與其前輩形成鮮明對比:
- GPT-5.5-Cyber(直接前一代):57.3% 完成率
- GPT-5.6 Sol(標準非資安版本):1.5% 完成率
- GPT-5.6 搭配 Daybreak Blue 存取權限:2.0% 完成率
從 57.3% 躍升至 95% 代表了跨世代的改進,但資安專用模型(95%)與標準模型(1.5%)之間的差距更值得關注。標準 GPT-5.6 幾乎拒絕所有雙用途安全請求——建構漏洞利用、分析惡意軟體、組建攻擊鏈。GPT-5.6-Cyber 則經過專門訓練,為授權使用者降低這些拒答率,同時維持防止濫用的防護機制。
OpenAI 還報告指出,該模型發現的漏洞利用數量是前一代的 3 倍,並顯著降低了誤報率——不僅更願意回答,也更加準確。
Daybreak:雙層存取架構
這款模型並非公開可用。它存在於 OpenAI 的 Daybreak 計畫中,並在此次發布時擴展為雙層存取架構:
Daybreak Red 提供對 GPT-5.6-Cyber 及其他專門訓練模型的存取權限,用於授權的漏洞研究、漏洞利用驗證和攻擊性安全工作。此層級僅限通過審核的防禦者和安全研究人員使用,需要經過申請批准流程。
Daybreak Blue 則提供更受限制的能力組合,偏向防禦性任務——安全程式碼審查、漏洞識別(但不包含漏洞利用開發)以及更高層級的惡意軟體分析。即便在 Blue 層級中,標準 GPT-5.6 模型也僅能完成約 2% 的進階資安任務請求,反映出與通用模型相同的對齊驅動拒答機制。
分層做法是 OpenAI 對一個根本矛盾的解答:讓模型有效發現漏洞的能力,同時也使其在錯誤的人手中變得危險。與其全面削弱模型,OpenAI 選擇了由存取控制把關的能力分層策略。
網路防禦窗口正在關閉
發布文章標題為「在網路防禦窗口收窄之際擴展 Daybreak」,這個框架是刻意的。OpenAI 的論點是:AI 驅動的攻擊工具終將被對手取得。問題不在於攻擊者是否會使用 AI 尋找零日漏洞,而在於防禦者是否能率先擁有同等或更強大的工具。
GPT-5.6-Cyber 被定位為答案——一款能在攻擊者之前發現漏洞並建構概念驗證利用的模型。V8 的發現就是鐵證:一個存在於 Chrome 最核心引擎中的漏洞,不是由人類研究員發現,而是由一個半自主運作的 AI 模型發現的。
這個框架對更廣泛的安全生態系統有深遠含義。如果 AI 模型能可靠地在經過嚴格審計的程式碼中發現新漏洞,尋找漏洞的經濟學將發生劇變。發現一個高危零日漏洞的成本——長期以來是精英研究員的專利——可能正在快速下降。
GPT-5.6-Cyber 做不到的事
值得注意的是一些限制。95% 的數字衡量的是完成率,而非準確率。完成 95% 請求的模型不意味著 95% 的時間都在產出正確或有用的結果——它只是更少拒答。The New Stack 的獨立報導指出,GPT-5.6-Cyber「並非在所有方面都優於 Sol」,且在某些類別中其報告「往往更短、細節更少」。
該模型的應用範圍也很窄。它在漏洞研究和利用驗證方面表現出色,但不是一個通用安全平台。儘管拒答率降低,OpenAI 仍堅稱該模型在發現和修復漏洞方面比將其武器化更為擅長——這一主張在當前的存取限制下仍然難以獨立驗證。
產業脈絡與影響
此次發布使 OpenAI 明確站在了資安 AI 競賽中,與 Google(Project Zero 的 AI 實驗)、微軟(Security Copilot)以及越來越多打造 AI 驅動漏洞掃描器的新創公司並列。但 GPT-5.6-Cyber 的獨特之處在於它願意處理攻擊性能力——漏洞利用開發和攻擊鏈建構——這是大多數競爭對手迴避的領域。
Chrome 零日漏洞的發現為 OpenAI 提供了純粹的行銷無法買到的信譽標記。在 V8 中發現一個新漏洞很難。發現兩個可以串接的漏洞更難。而研究結果產生了真實的 CVE 編號和真實的 Google 修補程式,意味著模型的輸出通過了外部驗證——漏洞是真實的,修復是真實的,協調揭露也確實奏效。
對安全社群而言,訊息很明確:工具已經到來。至於防禦窗口是否真的在收窄,還是只是被重新定義——這個問題的答案將在未來 12 個月的 AI 驅動漏洞研究中揭曉。
Sources
- [1] https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows/
- [2] https://venturebeat.com/technology/openai-launches-gpt-5-6-cyber-with-reduced-refusals-95-completion-on-advanced-cybersecurity-tasks
- [3] https://thenextweb.com/news/openai-gpt-5-6-cyber-daybreak-expansion-refusal-rate
- [4] https://www.infosecurity-magazine.com/news/openai-daybreak-blue-red-gpt-cyber/
- [5] https://cybersecuritynews.com/openai-expands-daybreak-cyber/
- [6] https://www.techtimes.com/articles/323884/20260811/gpt-56-cyber-uncovered-chrome-zero-days-standard-ai-wont-touch-alignment-gap-proven.htm