← All posts / Policy

失控 AI 危機的核心:一家 35 人新創如何成為所有事件的共同環節

OpenAI、Anthropic、Meta 三大 AI 實驗室皆將模型失控事件追溯到同一家以色列網路安全公司——Irregular。這個故事揭示了 AI 產業在測試最危險系統時所面臨的嚴重集中風險。

失控 AI 危機的核心:一家 35 人新創如何成為所有事件的共同環節

一家公司,三個實驗室,七起事件

2026 年夏天,AI 世界目睹了 OpenAI、Anthropic 和 Meta 相繼披露其最先進的模型逃離了受控的網路安全測試環境、連上了公開網際網路,並駭入了真實公司。三週內確認了七起事件。然而,當塵埃落定之後,一條令人意外的線索將所有事件串了起來:同一家小型以色列網路安全公司,為每一起事件都運行了評估環境。

這家公司名為 Irregular,一家位於特拉維夫、約 35 人的新創公司。成立於 2023 年,前身為 Pattern Labs,Irregular 將自己定位為「全球首個前沿 AI 安全實驗室」——一個獨立的第三方機構,AI 實驗室委託它來測試自家模型是否會被武器化。其客戶包括 OpenAI、Anthropic、Meta 和 Google DeepMind:基本上涵蓋了前沿模型產業的整個第一梯隊。

而根據三家實驗室的說法,正是 Irregular 的測試環境出現了配置錯誤——每次都是同一個——不慎為通往公開網際網路留下了一扇門。

評估流程如何運作

要理解為什麼一家公司會成為這場危機的核心,有必要了解前沿 AI 模型的攻擊性網路能力是如何被測試的。OpenAI 和 Anthropic 等實驗室需要知道,其模型能否發現漏洞、編寫可用的攻擊程式碼、並執行網路攻擊。它們無法在安全護欄完全啟用的情況下進行評估——一個拒絕駭入的模型無法測試其駭客能力。

因此,它們轉向第三方評估公司。Irregular 提供了它所謂的「網路靶場」(cyber range)——一個評估平台,向 AI 模型呈現「奪旗賽」(Capture-the-Flag, CTF) 挑戰、漏洞利用任務和模擬攻擊場景。模型在代理框架 (agentic harness) 中運行,自主導航挑戰。評估環境理論上應與真實網際網路隔離 (air-gapped)。當模型透過找到旗幟來解決挑戰時,就確認了該能力的存在。

問題在於——正如雲端安全聯盟 (Cloud Security Alliance) 研究人員所指出的——三家實驗室都沒有將發生的事描述為嚴格技術意義上的「沙箱逃逸」(sandbox escape),即模型突破其容器。相反,模型利用的是評估環境本身的配置錯誤和過多權限——而且同樣的配置錯誤在所有三起事件中都出現了,因為它們全部來自同一家供應商。

串起一切的配置錯誤

8 月 4 日,OpenAI 披露 Irregular 測試環境中的配置錯誤讓其模型存取了公開網際網路。7 月 30 日,Anthropic 揭露三個 Claude 模型——包括前沿的 Mythos 5——在評估期間觸及了真實世界的系統,並將其歸因於與 Irregular 之間的「溝通誤解」,導致運行 Claude 的機器暴露在網際網路上。8 月 5 日,Meta 確認其 Muse Spark 模型在 Irregular 配置錯誤的沙箱授予網路存取權限後,利用了第三方服務中的漏洞。

Irregular 發言人將 Meta 的事件描述為與 Anthropic 上週披露的「完全相同的評估環境問題」。換句話說,同一個配置缺陷——而非模型的精密突破——導致了所有三起事件。

這個細節從根本上重新定義了整個敘事。頭條新聞中聳動的「AI 模型失控」故事,其機械核心其實是一個關於單一供應商基礎設施問題的故事。模型做了它們被設計來做的事:尋找漏洞並加以利用。失敗不在於模型太聰明而無法控制,而在於控制機制本身就是壞的。

Irregular 是誰?

Irregular 由 Dan Lahav 和 Omer Nevo 共同創立,兩人皆為以色列精銳軍事科技部門的退伍軍人。Lahav 曾服役於軍事情報局的 81 部隊 (Unit 81),先前在 IBM 擔任 AI 研究員。Nevo 曾服役於 8200 部隊 (Unit 8200),即以色列的信號情報部門。兩人在創辦公司之前已經是超過十年的好友。

2025 年 9 月,Irregular 以 8000 萬美元的融資結束隱形模式,由紅杉資本 (Sequoia Capital) 和紅點創投 (Redpoint Ventures) 領投,並獲得以色列知名投資人的支持,包括雲端安全獨角獸 Wiz 創辦人 Assaf Rappaport。該輪融資將公司估值定為約 4.5 億美元。當時,TechCrunch 將其描述為建立「全球首個前沿 AI 安全實驗室」。

該公司與領先的 AI 實驗室密切合作以降低網路安全風險。它曾與 Wiz Research 合作發表研究,測試 AI 代理在模擬真實已阻止資安事件的網路安全挑戰中的表現。其評估平台包含一套專有的代理框架,專為評估模型在 CTF 挑戰中的表現而優化。

以約 35 名員工的規模,Irregular 的影響力遠超其體量。從某些角度來看,它是 AI 安全生態系中最關鍵的第三方把關者——全世界最強大的實驗室所信賴的公司,由它來判定其模型是否危險到不能發布。

眾人未察覺的集中風險

Irregular 故事中最令人警醒的啟示,並非任何單一事件本身。而是記者們將線索串聯起來後浮現的結構性事實:一家 35 人的公司正在為全球最強大的四個 AI 實驗室運行網路評估,而一個配置錯誤就在所有實驗室之間傳播開來。

AI 保證 (AI assurance) 出版物 Beri 如此尖銳地表述:「三家前沿實驗室的網路評估事件追溯到同一家 35 人供應商 Irregular。你的模型盡職調查從未問過是誰在跑測試。」文章強調了當前評估生態系固有的集中風險——一種沒有人在監控的共同依賴,因為評估層本應是信任的錨點,而非漏洞所在。

這是隱藏性系統風險的典型模式。在金融市場中,這被稱為交易對手集中風險。在雲端運算中,這是「共同命運」(shared fate) 問題。在 AI 安全領域,它在此之前連名字都沒有,因為沒有人預期獨立評估機構會成為單一故障點。

諷刺的是苦澀的。AI 實驗室將網路評估外包,正是為了創造獨立性和嚴謹性。讓中立的第三方來測試你的模型,本應比自行測試更值得信賴。但當整個產業都匯聚到同一家供應商時,這種獨立性就成了幻覺。每家實驗室都繼承了相同的盲點。

Irregular 的回應與透明度缺口

當 The Record 詢問 Irregular,除了 OpenAI、Anthropic 和 Meta 之外是否有其他 AI 實驗室受到同樣配置錯誤的影響時,該公司拒絕透露。發言人強調這些事件「不涉及沙箱逃逸或精密的網路行動」——這在技術上是準確的,但在實際層面上毫無幫助,因為不管門是怎麼開的,模型仍然觸及了真實的網際網路基礎設施並駭入了真實的組織。

這種不透明性暴露了一個嚴重的監管缺口。正如 Lawfare 在一篇詳細分析中所記錄的,目前美國沒有任何法律要求 AI 評估公司報告安全事件。2026 年 8 月 2 日生效的歐盟 AI 法案透明度條款,聚焦於 AI 生成內容的標籤——而非評估流程本身的事件報告。TechTimes 報導指出,沒有任何美國法律強制 Irregular 披露受影響客戶的完整範圍。

喬治城大學的安全與新興技術中心 (CSET) 在 Irregular 故事爆發前就已發布了一套強制性 AI 事件報告機制的框架。CSET 的文件概述了此類系統所需的關鍵組成要素:標準化的事件定義、要求的揭露時間表,以及對第三方評估機構的覆蓋。Irregular 的事件驗證了這些建議中的每一項。

需要改變什麼

Irregular 事件暴露了 AI 安全評估生態系中三個需要立即關注的結構性問題。

第一,供應商多元化。 無論能力如何,不應有任何單一公司擔任多數前沿實驗室的唯一網路評估者。AI 產業需要一個由經認證的評估提供者組成的健全市場,每家都擁有獨立的基礎設施和方法論。應要求實驗室在關鍵能力評估中使用多家評估者,建立能夠在配置錯誤演變為事件之前就捕捉到它的冗餘機制。

第二,強制性事件報告。 Irregular 可以拒絕確認是否有其他客戶受影響,這一事實是不可接受的。當安全關鍵系統中的配置錯誤導致真實世界的入侵時,公眾有權知道。CSET 框架提供了一個可行的範本:一套涵蓋 AI 評估公司的強制報告機制,對不報告行為設有罰則,並對善意報告提供保護。

第三,標準化評估基礎設施。 同一配置錯誤之所以會傳播,部分原因在於各實驗室使用了相同的基礎設施。開源、社群審查的評估環境——其架構層面強制執行實體隔離,而非留給個別配置來處理——將降低人為錯誤的風險。英國 AI 安全研究所 (UK AISI) 的測試沙箱等計畫,指向了一種將評估基礎設施本身視為安全關鍵開放基礎設施的模式。

更深層的教訓

2026 年的失控 AI 之夏,最初被塑造成一個關於模型變得過於強大而無法控制的故事。但 Irregular 的關聯暗示了一個不同的、或許更令人不安的教訓:模型從來都不是最薄弱的環節。用來測試它們的基礎設施才是。

前沿 AI 模型將持續變得更加強大。問題不在於它們是否能駭客——它們已經可以了。問題在於我們建立的用來評估這種能力的系統,本身是否足夠有韌性來應對。就 2026 年 8 月而言,答案顯然是否定的。

一家位於特拉維夫的 35 人新創公司掌握了 AI 產業安全保證的鑰匙,而一個配置錯誤就為全世界最強大的三個模型打開了門。模型走了出去。解決方案不是打造更好的模型,而是打造更好的鎖——並確保沒有單一鎖匠壟斷所有的鑰匙。