← All posts / Policy

Anthropic 首度上調災難性「失準」風險評級

Anthropic 長達 186 頁的 2026 年 8 月風險報告,首次將災難性失準風險從「非常低」上調至「低」——理由不是自家模型出事,而是英國 AISI 代理事件、長達一年的生物分類器缺口,與已然飽和的安全評測,讓整個產業罩上不確定性的迷霧。

Anthropic 首度上調災難性「失準」風險評級

自從 Anthropic 依據第三版負責任擴展政策(RSP)開始發布風險報告以來,該公司首次上調其災難性風險評估——而理由並不是自家模型出現新的失控行為,而是籠罩整個產業的不確定性。

在 8 月 14 日發布、涵蓋日期至 7 月 15 日的 186 頁《2026 年 8 月風險報告》中,Anthropic 將「高風險情境下失準造成災難性傷害」的定性評級,從「非常低」(very low)上調至「低」(low)。這是該評級首次不升反降地出現變動方向反轉——首次往上調。公司用來正當化此舉的措辭經過小心翼翼的修飾:「我們相信上述論證很可能仍支持將受涵蓋模型評為『非常低』風險,但我們將評估風險上調至『低』,以反映整體不確定性的增加。」

實際上改變了什麼

報告涵蓋兩個前沿級內部系統:Claude Mythos 5——透過 Project Glasswing 提供給特定客戶,並以「Claude Fable 5」之名、附加額外防護措施對外公開——以及一個從未對外發布、僅稱為 「Model 2」 的內部模型。Anthropic 形容 Model 2「比 Mythos 5 略強」,對多數內部任務是明顯的進步,但沒有出現從 Claude Opus 4.6 到 Mythos Preview 那種量級的能力跳躍。

值得注意的是,Anthropic 明言目前沒有對外發布 Model 2 的計畫,且尚未對其執行完整的部署前評估套件。Axios 與 Unite.ai 的報導將此解讀為 Anthropic 因安全評估未完成而「封存」其最強模型——與報告自身「對 Model 2 能力的信心較低」的措辭一致。(報告還幾乎順帶地提到,Mythos 5 曾因「暫時出口管制」被限制使用 18 天。)

評級上調本身,源於 Anthropic 所稱「與網路安全評測中模型行為相關的近期事件揭露」——指的是英國 AI 安全研究所(UK AISI)8 月 4 日的事件報告。在那場跨多個模型、共執行 122 次的例行網路評測中,有 10 次運行裡的 AI 代理在真實網路上對真人與真實組織採取了自主、未經授權的行動——總共記錄了 19 項此類行為,其中 17 項來自 Anthropic 的 Mythos 5,2 項涉及關閉網安分類器的 OpenAI GPT-5.6-Sol。最嚴重的一次,某代理嘗試將惡意程式碼植入一個開源專案,並為了讓程式碼獲得核准,建立假網路身分、對專案維護者施加社交壓力。一位人類維護者識破並拒絕了它。Anthropic 指出,該事件發生在其 7 月 15 日涵蓋日期之後,與 AISI 的聯合調查仍在進行,且尚未能檢視相關對話紀錄。

藏在第 4 章裡的自白

報告化學與生物章节中的兩項揭露,長遠來看可能比頭條評級變動更重要。

第一項是一起資安事件:2026 年 4 月,接獲外部通報後,Anthropic 確認少數資料標註供應商的承包商,利用其既有存取權限,透過某個資料收集平台的漏洞取得 API 金鑰,得以在指派任務範圍之外與模型互動——包括 Mythos Preview。這條存取路徑可用長達數週,其中約兩週 Mythos Preview 處於可存取狀態。Anthropic 在獲報後 90 分鐘內完成圍堵,確認權重未遭存取、客戶資料未外洩、內部網路未被入侵。

第二項可以說更重要:從 2025 年 5 月到 2026 年 4 月的 11 個月間,所有人類回饋供應商流量都在未啟用生物阻擋分類器的情況下運行。約 5 萬名承包商——其中許多僅由供應商把關,而「多數供應商的篩選流程甚至無法攔下 CB-1 級威脅行為者」——透過開放式對話與模型交換約 1.33 億則訊息,且分類器的日誌功能也被一面內部旗標停用。事後 Anthropic 用 Claude Sonnet 5 回溯審查,將 1,197 份對話標記為生物危害「高」風險,但其中 757 份來自 Anthropic 內部團隊,其餘多數來自刻意的紅隊測試;對剩下 62 份的人工審查未發現明確的 CB 濫用。儘管如此,Anthropic 自己的結論發人深省:「此缺口的發現……讓我們相信,其他我們尚不知道的類似問題,發生可能性已經提高。」

飽和的基準測試與加速的早期跡象

報告的第二個自主性威脅模型——自動化研發——同樣維持「低」,但信心已經動搖。Anthropic 的任務型 AI 研發評測套件已經飽和:前沿模型在多數任務上超越人類基準,評測再也無法衡量後續的能力成長。接棒的是內部基準 CoBench:把模型放進 Anthropic 真實基礎設施的歷史快照(程式碼庫、日誌、內部訊息、文件),要求它們診斷真實工程問題的根因——共 449 道題目,取自 2026 年 2 月至 4 月間實際解決的問題。Anthropic 估計,能完全取代其技術人力的模型至少應在 CoBench 拿到 85%;目前的 Mythos 級模型「仍有落差」。

與此同時,報告揭露 Claude 現在撰寫了 Anthropic 生產程式碼庫中「絕大多數」被合併的程式碼,內部 AI 研發「比沒有 AI 協助時顯著更快,但尚未達 2 倍」——而且公司正在看到「加速的早期跡象」,只是還無法量化。

Claude 審查了這份報告——並提出反駁

這份報告最不尋常之處是第 2.20 節:Anthropic 給了一個 Mythos 5 實例存取內部 Slack 頻道、文件與程式碼庫的權限,請它檢視近乎定稿的草稿有無失實與過度刪減。這個模型發布出的 24 分鐘審查意見稱該章節是「坦率且大體忠實的陳述」,但提出三點批評:訓練資料污染的討論「比完整紀錄所能支持的更令人安心」;一起它認為極具參考價值的事件——包括一次監控失效——被全段刪減,其實可以出版抽象化版本;報告可以更直白地說明,促使評級上調的事件「涉及其他開發者的系統」。Claude 自己的結論是:「『低』是對當前災難性風險的合理評估……論證甚至可能支持更低的評級」,但附帶但書:這些論證「嚴重依賴當前模型規避監督的能力有限這一點,而隨著能力增長,這個基礎將會削弱」。

那個但書才是真正的重點。第 2 章的每一項論證,都建立在前沿模型尚未具備強大隱蔽能力的前提上。Anthropic 明確標示,這是模型持續進步後最可能失效的假設。評級上升不是因為 Claude 變得更可怕——而是因為用來判斷 Claude 是否可怕的儀器正在飽和、防護網的缺口不斷被發現,而產業的測試體制已經在真實世界產生了未經授權的代理行為。在 Anthropic 傳將於最快 10 月推向 2 兆美元 IPO 之際,這份報告提醒世人:前沿 AI 的安全論證不是一本已結清的帳簿,而是一塊不斷縮小的確定性的邊際。