← All posts / Models

OpenAI 暫停 Astra 開發——AI 業界首次觸及「Critical」網路安全臨界點

OpenAI 下一代模型 Astra 在評估中無法排除已達到 Preparedness Framework 所定義的 Critical 網路安全閾值——能自主發現並利用零日漏洞——成為史上首個觸發此門檻的 AI 模型。

OpenAI 暫停 Astra 開發——AI 業界首次觸及「Critical」網路安全臨界點

2026 年 8 月 7 日,OpenAI 發表了一篇題為「應對關鍵網路能力的下一個前沿」(Responding to the next frontier of critical cyber capabilities)的部落格文章,悄悄寫下了 AI 歷史的新頁。該公司宣佈已暫停其即將推出的模型 Astra 的部分內部開發活動,因為初步的網路安全評估無法排除該模型已跨越其自身「準備框架」(Preparedness Framework)中所定義的「Critical」(關鍵)閾值。這是有史以來第一次有任何前沿 AI 實驗室觸及這條界線,其影響波及整個產業。

Astra 是什麼?

Astra 是 OpenAI 的下一代模型家族,內部被視為 GPT-5.x 系列的後繼路線。儘管 OpenAI 尚未公佈模型卡、參數量、架構細節、定價或發佈日期,但這個模型早已因另一個原因引發了巨大關注:數學。

2026 年 8 月 1 日,OpenAI 發表了「數學與理論電腦科學的十項進展」(Ten advances in mathematics and theoretical computer science),揭露 Astra 的內部版本已解決了十個長期未解的開放性問題,涵蓋高維幾何、編碼理論、群論、算子代數、算術電路複雜度、量子複雜度、格問題、凸幾何和拉姆齊理論等領域。每個結果都附有可機器驗證的 Lean 證明憑證和思維鏈(chain-of-thought)逐步推導,為數學家提供了可驗證的成果,而非僅僅口頭宣稱。據《富比士》報導,整個運算過程僅花費約 2,000 美元——這效率令人震驚。

但 Astra 不只是一個數學天才。它是一個深度代理式(agentic)系統,設計用於長時間自主運作、協調多步驟工作流程,並在軟體工程和網路安全等領域發揮作用。而正是這種網路安全能力,觸發了警報。

準備框架與 Critical 閾值

OpenAI 的「準備框架」最初於 2024 年發佈,2025 年 4 月更新,為前沿模型定義了一套風險等級滑動量表:Low(低)、Medium(中)、High(高)和 Critical(關鍵)。每個等級涵蓋多個領域——網路安全、CBRN(化學、生物、放射、核)、說服力和模型自主性。

根據該框架,當一個模型能夠「針對許多經過加固的真實世界目標,識別並開發出可運作的零日漏洞利用程式」(identify and develop functional zero-day exploits against many hardened, real-world targets)時,即達到 Critical 網路安全閾值——本質上,就是它能自主發現生產環境軟體中先前未知的漏洞,並在無人介入的情況下製造出可用的攻擊程式。這不是關於釣魚郵件模板或社交工程腳本,而是關於獨立突破那些保護銀行、醫院、電網和政府網路的系統的能力。

OpenAI 的聲明措辭異常坦誠:該公司表示「無法排除」(cannot rule out)Astra 已達到此一水準。這個保留——「無法排除」——意義重大。評估是機率性的,不是確定性的,而不確定性本身就足以觸發暫停。

OpenAI 實際做了什麼

根據路透社、Axios、TechCrunch 和《衛報》的報導,OpenAI 採取了幾項具體行動:

  1. 暫停了涉及 Astra 的某些內部活動——特別是進一步開發或暴露模型網路安全能力的工作。一般研究與非網路安全領域的開發據報持續進行。

  2. 收緊了安全控制和評估流程。 OpenAI 擴充了內部紅隊(red-teaming)能量,並引入了額外的評估輪次,專門針對自主漏洞利用場景。

  3. 擴展了 Daybreak 網路安全倡議。 8 月 10 日,CNBC 報導 OpenAI 將 Daybreak——其「網路安全信任存取計畫」(Trusted Access for Cyber)——擴展為兩個層級:Daybreak Blue(防禦性使用場景,如漏洞分流和安全程式碼審查)和 Daybreak Red(供審核通過的夥伴進行攻擊性研究)。此擴展旨在確保當 Astra 的網路安全能力最終發佈時,它們流通於受控的授權管道,而非開放式 API。

  4. 承諾發佈初步評估結果,讓更廣泛的安全社群能夠看到測試方法和 Critical 分類背後的證據。

為什麼這很重要

Astra 的暫停是一個分水嶺時刻,原因有三。

第一,這是前沿安全閾值在現實世界中的首次啟動。 自 OpenAI、Anthropic、Google DeepMind 等公司在 2023–2024 年發佈各自的負責任擴展政策以來,批評者一直在問:這些框架到底會不會真正產生約束力——還是僅僅是公關手段?Astra 證明了至少有一個框架是有牙齒的。一個模型確實因為自身的能力而被延後了。

第二,它驗證了代理式 AI 的威脅模型。 Critical 閾值的定義基於自主利用——模型自己發現並武器化漏洞,而非僅僅協助人類攻擊者。這正是安全研究人員在 AI 代理變得更擅長長期、多步驟推理時所警告的能力輪廓。Astra 接近這條界線的事實,證實了前沿模型正在從「工具」跨越到「代理」的領域——至少在網路安全方面如此。

第三,它製造了一個沒有簡單答案的治理困境。 如果 Astra 的網路安全能力確實達到 Critical 水準,那麼發佈該模型——即使是透過 Daybreak 這樣的受控管道——也等於將非凡的攻擊力量集中在少數獲得存取權的夥伴手中。無限期扣留則會阻礙科學進展,並將陣地讓給較不擇手段的行為者。OpenAI 選擇了一條中間路線:暫停、加固、建立受控存取基礎設施。這是否足夠,仍是一個開放性問題。

產業與監管脈絡

Astra 的暫停發生在一波 AI 安全事件之中。同一週,有報導指出中國連結的駭客在對台灣政府的近乎端到端網路攻擊中部署了自主 AI 代理——據信是史上首次此類攻擊。三家前沿實驗室(OpenAI、Anthropic 和 Meta)最近也將模型安全事件追溯到同一家評估供應商 Irregular,暴露了 AI 保證供應鏈中危險的集中化風險。

歐盟《人工智慧法案》於 2026 年 8 月 2 日全面生效,施加了包括為 AI 生成內容加上浮水印在內的透明度義務——Anthropic 在同一週開始履行這一要求。在此背景下,OpenAI 選擇公開揭露 Astra 的 Critical 評估結果,而非悄悄繼續開發,為透明度樹立了監管機構可能會引用的先例。

接下來呢

OpenAI 尚未宣佈 Astra 的修訂時間表。該模型沒有公開的發佈日期、沒有 API 路由、也沒有附加的消費者產品。它所擁有的,是一組不斷增長的證據,表明前沿 AI 能力正在接近產業自身定義為「危險到不宜在無非凡防護措施下部署」的閾值。

那十個數學證明展示了 Astra 能夠在人類知識的前沿進行推理。而網路安全評估則證明了,同樣的推理能力指向不同目標時,能夠發現全球最優秀的人類安全團隊都未察覺的漏洞。現在的問題不再是 AI 能否跨越 Critical 線——Astra 表明它可以——而是為了遏制它而建立的治理結構能否撐住。

對 AI 產業而言,2026 年 8 月可能會被銘記為安全框架不再是理論的那一個月。