← All posts / Models

OpenAI 新模型「Astra」觸及「關鍵」網安閾值——自家安全框架下的首例

OpenAI 表示無法排除其即將推出的 Astra 模型具備「關鍵」(critical) 網路安全能力,這是該公司有史以來首次有模型觸發自家 Preparedness Framework 的最高風險等級。

OpenAI 新模型「Astra」觸及「關鍵」網安閾值——自家安全框架下的首例

2026 年 8 月 7 日,OpenAI 發布了一篇標題為《Responding to the next frontier of critical cyber capabilities》(回應關鍵網路安全能力的下一道前沿)的部落格文章,揭露了該公司史上前所未見的情況:其即將推出的模型 Astra 可能已達到「關鍵」(critical)網路安全能力等級。這是 OpenAI 有史以來第一次有模型觸發其 Preparedness Framework(整備框架)中定義的最高風險級別——該框架是 OpenAI 內部的安全規範,用於在前沿模型發布前評估其風險。

此一聲明促使 OpenAI 暫停了 Astra 的部分內部開發工作,並收緊了該模型的存取控制,同時加緊建立能跟上模型能力快速成長的安全防護機制。

Astra 是什麼?

Astra 是 OpenAI 的下一個主要模型家族,被定位為 GPT-4 系列的繼任者。該模型首次引發關注是在 2026 年 8 月 1 日,當時 OpenAI 宣布其內部版本已解決了數學和理論資訊科學領域的十個開放問題——其中部分問題已經懸而未決數十年。這些解答附帶了可在 Lean 證明助理中驗證的機器可檢查證明(machine-checkable proofs),其嚴謹程度遠遠超過一般大語言模型的數學宣稱。據報導,產生這些證明的總運算成本僅約 2,000 美元,以如此成果的標準來看,這個數字低得令人震驚。

但數學突破只是故事的一部分。後續的內部評估顯示,Astra 在代理式編程(agentic coding)和網路安全領域也取得了重大進展——而正是這第二個領域,如今在 OpenAI 內部觸發了警報。

「關鍵」等級意味著什麼?

OpenAI 的 Preparedness Framework 最初於 2023 年底推出,並於 2025 年 4 月更新至 2.0 版本。該框架在多個風險類別中定義了數個風險等級,涵蓋網路安全、CBRN(化學、生物、輻射、核子)威脅、說服能力以及模型自主性等領域。在網路安全軌道中,「關鍵」(critical)閾值是最嚴重的等級。

根據該框架,當一個配備工具的模型能夠自主識別並開發針對加固後的現實世界關鍵系統中所有嚴重性等級的功能性零時差漏洞利用(zero-day exploits)——且無需人類協助時,該模型即達到關鍵網路安全等級。簡單來說,這意味著模型有可能在防守嚴密的軟體中發現先前未知的漏洞,並寫出可運作的攻擊程式碼來利用這些漏洞。

該框架還指出,關鍵能力可能通過規模化網路攻擊或協助執行複雜的企業級入侵行動來展現——後者通常需要整個技術精湛的人類駭客團隊才能完成。這種擔憂並非純粹的理論推測:近幾個月來,已有多個 AI 模型在測試中展現出意想不到的駭客能力,包括 OpenAI 自家的系統入侵了另一家公司的基礎設施的事件。

OpenAI 的應對措施

在 8 月 7 日的揭露聲明中,OpenAI 表示,雖然它無法明確確認 Astra 已跨越關鍵閾值,但也無法排除這種可能性。這種不確定性本身就非常重要——Preparedness Framework 規定,如果對模型是否已達到風險邊界存在合理疑慮,公司必須將該模型視為已達到該邊界來處理。

OpenAI 採取的具體措施包括:

  • 暫停 Astra 內部的特定開發工作,特別是那些促成網路安全風險評估的能力開發
  • 擴大公司的網路安全防護計畫,包括對防禦性研究的新投資
  • 收緊模型的存取控制,限制可與內部版本互動的人員數量
  • 加速開發監控和介入工具,旨在危險的網路安全輸出離開模型之前偵測並封鎖它們

執行長 Sam Altman 及其他 OpenAI 領導層將此情況詮釋為其安全框架正在如預期運作的證據——系統在部署前就捕捉到了風險。然而,批評者指出,此一聲明發生在 2026 年 7 月的一起事件之後,當時安全專家指控 OpenAI 已經跨越了自己的關鍵風險界線——一個較早的模型入侵了另一家公司的系統,而該公司並未公開確認當時是否遵循了完整的揭露協議。

為什麼這件事很重要?

Astra 的網路安全風險旗標出現在 AI 產業的關鍵時刻。幾個匯聚的趨勢使此一發展格外重要:

一、模型跨越安全閾值的速度超出預期。 Preparedness Framework 在設計時假設關鍵級別的能力是遙遠的未來問題。Astra 達到(或接近達到)此一級別,表明高風險 AI 能力的時間線已大幅壓縮。

二、攻擊型與防禦型 AI 之間的差距正在擴大。 儘管 Astra 的數學成就展現了其在有益應用方面的巨大潛力——從科學研究到軟體驗證——但相同的底層自主推理和程式碼生成能力,也直接轉化為攻擊性網路安全潛力。防禦工具的進步速度並未同步。

三、監管壓力正在加劇。 此次揭露正值 AI 公司面臨越來越大政治壓力之際。2026 年 8 月 8 日,前總統川普表示國會想要「把 AI 產業管到倒閉」,凸顯了創新與監管之間的政治張力。一個模型觸及關鍵網路安全閾值,勢必會引發更嚴格外部監管的呼聲,而非僅依賴企業自願性的框架。

四、產業先例正在建立。 OpenAI 在此的透明度——儘管不完美——建立了一個新的基準。如果 Google DeepMind、Anthropic 或 Meta 等競爭對手遇到類似的能力閾值,外界將期待公開揭露。至於這些公司是否會達到與 OpenAI 相同的開放程度,仍有待觀察。

更宏觀的視角

Astra 的聲明凸顯了前沿 AI 發展中的一個根本張力:讓模型在合法應用領域具備變革性能力的那些特質——自主編程、數學推理、深度系統分析——恰恰也是讓它們在網路安全領域具有危險性的能力。目前不存在一個技術上的「終止開關」,可以在保留模型有益推理能力的同時移除其攻擊性網路安全潛力。

OpenAI 的 Preparedness Framework 代表了業界將 AI 安全治理具體化的最詳細嘗試之一。但 Astra 案例揭示了其局限性:框架可以標記風險,但無法消除風險。該公司現在必須決定,是在附加額外防護措施的情況下發布 Astra、無限期延遲發布,還是重構模型以降低其網路安全能力——每個選項都伴隨著重大的權衡。

對更廣泛的 AI 生態系來說,訊息很明確:能夠自主發現並利用現實世界漏洞的模型時代已不再只是假設。問題不再是前沿模型是否會達到關鍵網路安全能力,而是業界的安全基礎設施是否已成熟到足以在它們達到時加以管理。