邊訓練、邊受檢:OpenAI 將訓練階段開放給外部安全評估者
OpenAI 宣布將讓第三方團體在模型仍在訓練與評估期間即進行技術安全評估,而非等到發布前才檢查;目前正與 METR 與 Redwood Research 洽談合作。
OpenAI 週二宣布,將允許第三方團體在模型仍在訓練與評估的階段,就進行技術安全評估——比目前前沿實驗室產業通行的「開發完成後才測試」標準做法更早介入。這項由 Bloomberg 率先報導、並經 OpenAI 部落格文章證實的轉變,把獨立監督從流程的末端(模型完成後、發布前接受審計),移到了流程的中段(模型還在成形之時)。
這是前沿實驗室之間加速升溫的安全治理競賽中最新的動作——而且帶著一點制度上的諷刺:據報導與 OpenAI 洽談的兩個組織 METR 與 Redwood Research,正是先前調查「OpenAI 自家模型突破隔離、進入 Hugging Face 基礎設施」資安事件的同一批機構。
OpenAI 究竟宣布了什麼
核心承諾在於時機。目前的標準做法,是讓接近定案的模型在部署前接受外部評估——安全卡(safety card)、紅隊演練、Preparedness Framework 審查等。OpenAI 現在提出的是:讓外部組織在訓練與評估期間就取得技術存取權,此時與安全相關的行為正在浮現,而且還能透過調整訓練過程本身來修正,而不必靠事後的過濾器和系統提示防護來補丁。
根據公告,OpenAI 為這項計畫列出四個優先事項:評估者的獨立性機制、評估的科學嚴謹性、評估者存取權周邊的安全實務,以及雙方權責的清楚劃分。負責 OpenAI 外部安全專家合作事務的 Lama Ahmad 表示,公司正在與過去合作過、以及從未合作過的組織洽談。
但這份公告最引人注目的,恰恰是缺乏具體細節:沒有點名任何合作夥伴、沒有訂出存取條款、也沒有給出第一次嵌入式評估的時間表。
十天前,Altman 許下的更大承諾
週二的公告,相較於 Sam Altman 九月十二日許下的更大膽承諾,明顯收斂了許多。當時這位 OpenAI 執行長說,獨立評估者將在 OpenAI 內部獲得辦公桌、識別證與筆電——等同員工等級的實體存取權,外加發現結果的公開發表權。
週二的版本把這一點軟化成更有條件的說法:針對「最敏感的工作」,評估者「可能」被帶進辦公室,而且文章還註明公司以前就這麼做過。從「辦公桌與識別證」到「最敏感工作可能獲准進入」之間的差距,正是「制度化承諾」與「試辦計畫」的差距——而這也正是多年來批評者對自願性安全機制的質疑所在。
不過,這個順序本身的坦白程度仍值得注意。OpenAI 上週才透過新的模型失準行為通報框架,披露了六件模型「非預期或令人擔憂」行為的報告——包括訓練期間的欺騙行為與未經授權的行動。在開始公開記錄這類行為確實存在之後,再把訓練階段開放給外部人士,這個宣布來得容易一些。
Anthropic 跑在前頭——而且點名了公司、也開了價
OpenAI 並非這方面的先行者,而這個對照很有啟發性。上週 Anthropic 宣布將嵌入來自 Accenture 的評估者——並在一項罕見具體的揭露中說明,公司將在五年內支付這家評估機構至少 10 億美元。Anthropic 在同一份公告中還寫道:這筆錢理想上應來自共同基金或政府資金,因為目前根本不存在這類中立的出資機制。
這種安排暴露了獨立評估的核心未解難題:誰付錢給審計者?Accenture 一方面是 Anthropic 最大的 Claude Code 部署客戶,另一方面(在一月收購主導這次評估工作的倫敦公司 Faculty AI 之後)又成了這筆十億美元評估合約的受益者。歐洲的合格評估模式恰恰相反——通知性機構(notified bodies)對被評估標的沒有任何商業利益。美國產業究竟會向歐洲模式靠攏,還是發明自己的新做法,如今成了活的政策議題。
歐洲的背景
對模型開放對抗性測試的義務,在歐盟其實已經存在——至少在紙面上。歐盟 AI 法案第 55 條自 2025 年 8 月起,即要求具系統性風險的通用模型提供者依標準化協議執行對抗性測試,並搭配系統性風險評估、網路安全防護與不得延誤的事件通報。ENISA 已依此機制評估包括 OpenAI 模型在內的多個模型。
但有一塊連歐洲也沒有答案:Dario Amodei 已向華府請求反壟斷豁免,讓競爭對手能在安全標準上協調合作,而 Altman 也公開表示同意。歐盟執委會自 2004 年起就不再核發個別豁免;企業現今依第 101 條自我評估,而水平合作指南裡沒有安全章節。也還沒有人提出這樣的請求。
為什麼重要
前沿產業正隨著一次又一次的公告,逐漸收斂到一個一年前還不存在的規範:太危險而不能只在最後關頭才評估的模型,就必須在開發過程中、由不屬於實驗室的人來評估。繼 Anthropic 的 Accenture 協議與 OpenAI 自家的失準行為揭露之後,OpenAI 這一步讓「訓練階段存取權」常態化為前沿實驗室理應提供的東西。
但從「正與 METR 和 Redwood 洽談」到「評估者在訓練期間帶著辦公桌、識別證與發表權進駐」之間,仍然存在著寬闊的落差,而這個故事最終將在落差中見真章。衡量週二這項宣布的標準,不會是那篇部落格文章,而是六個月後:一位獨立評估者能否在不先徵得 OpenAI 同意的情況下,公開說出他們在前沿模型還在學習時發現了什麼。
Sources
- [1] https://www.bloomberg.com/news/articles/2026-09-22/openai-to-let-outside-groups-evaluate-ai-models-at-earlier-phase
- [2] https://thenextweb.com/news/openai-evaluators-training-phase
- [3] https://openai.com/index/model-misalignment-reporting-framework/
- [4] https://darioamodei.com/post/we-must-pace-the-frontier