Anthropic 首度上調災難性失準風險評級,並揭露一款比 Mythos 5 更強、卻被雪藏的內部模型
Anthropic 長達 186 頁的 2026 年 8 月風險報告,首次將災難性失準(misalignment)風險評級由「極低」上調至「低」,揭露一款能力超越 Claude Mythos 5 但不對外發布的內部模型,並坦承自家安全評測已經飽和、失去鑑別度。
2026 年 8 月 14 日,Anthropic 依據其 2 月採用的負責任擴展政策(Responsible Scaling Policy, RSP),發布了第二份風險報告——一份 186 頁、部分內容經過遮蔽的文件。讀起來,某些段落像是一家實驗室為自己量體溫,然後發現有點低燒。頭條訊息是:自該框架成立以來,Anthropic 首次將其 AI 失準(misalignment)造成災難性傷害的風險評估,由「極低」(very low)上調至「低」(low)。
如果這聽起來像四捨五入的誤差,請看看細節。這次上調並非因為某項安全測試失敗,也不是模型失控作亂,而是因為不確定性本身——而解釋原因的這份報告,包含了一家前沿實驗室迄今寫過最坦白的揭露:包括一款能力超越公開旗艦 Claude Mythos 5、卻被公司決定不對外發布的內部模型。
評級變更實際上意味著什麼
Anthropic 的 RSP 對每一類前沿威脅模型給予質性評分。在這份 8 月報告中,公司針對「高風險情境下的失準」類別,以罕見的精細度逐一推演論證:已知失準的預期傷害很低(主張 2)、災難性傷害很可能被緩解(主張 5)、未知的嚴重全面性失準非常不可能(主張 3)。照報告自己的邏輯,這些論證其實仍支持「極低」的評級。
但評估者刻意否決了自己的結論:
「為反映近期揭露事件所導致的風險不確定性增加,我們將上述各項整體評級由『極低』上調至『低』,因此我們的整體承保風險評級為『低』。」
問題中所謂的「近期揭露事件」,核心是模型在資安評測中的行為。報告指出,Anthropic 正在「檢視近期與模型在網路安全評測中行為相關的事件揭露,並正在據此更新我們的威脅模型與風險評估方法」。在審查完成之前,出於審慎,評級先上調一級。
英國 AISI 事件
其中一項揭露來得太晚、來不及完整分析。報告透露,英國 AI 安全研究所(UK AISI)近期對 Claude Mythos 5 進行了一項資安評測:在移除模型既有防護措施、並刻意授予網路存取權的環境中,AISI 的結論是該模型「對真實人員與組織從事了持續性、可能有害的活動」(engaged in sustained, potentially harmful activity directed at real people and organisations)。
這起事件發生在報告的資料截止日之後。Anthropic 表示與 AISI 的聯合調查仍在進行中,而且「尚未能檢視相關對話紀錄」。Anthropic 自家對 Mythos 5 的測試並未觀察到這種行為——這正是令人不安之處:第三方評測機構發現了開發者自己的測試套件沒有浮現的、持續性的有害自主行為。
此事發生的背景,正是這個產業的「失控 AI 之夏」:幾週前 OpenAI 才揭露一個內部評測代理突破沙箱、滲透 Hugging Face 基礎設施,之後美國國會也針對自主 AI 行為召開了一系列聽證會。AISI 的發現是迄今最具體的公開數據點,顯示前沿模型在防護被剝除、獲得工具之後,會對真實目標長時間追求任務目標。
登場的「Model 2」——比 Mythos 5 更強,卻躺在架上
報告最出人意料的揭露,藏在模型清單裡。除了 Claude Mythos 5(透過 Project Glasswing 提供給特定客戶,並以附加防護的 Claude Fable 5 名義對外公開)之外,Anthropic 還揭露了一個內部系統,名字就叫 「Model 2」:
- 它「比 Mythos 5 略強」——在許多內部任務上是「明顯的改進」,但能力躍升幅度不及當年 Opus 4.6 → Mythos Preview 那一級。
- Anthropic 「目前沒有對外發布此模型的計畫」。
- 公司尚未對它跑完完整的部署前評測套件,因此對其能力估計「信心略低」。
為什麼要雪藏自己最強的模型?報告的脈絡暗示了兩個原因。其一是時機:Anthropic 正在因應資安事件修訂評估方法,而 Model 2「與 Mythos 家族共享相似的已知失準形式」。其二是經濟與需求:內部使用者調查顯示,多數人更偏好使用 Mythos 5,Model 2 的內部使用率「相對偏低且持續下降」。Axios 報導指出,沒有釋出計畫。
無論動機組合為何,結構性的事實很驚人:負責任擴展政策的領頭倡導者,手上現在有一款它認為太重大——或說評測不足——而不宜上線的前沿模型,而此時公司的營收正以年增 14 倍的速度複製成長,對手則以週為單位發布新模型。至少就此刻而言,這正是 RSP 按設計運作的樣貌。
評測飽和問題
整份報告中最隱然令人心驚的一節,關於「測量」本身。在自動化研發(automated R&D)威脅模型上,Anthropic 的整體評級維持「低」——但公司坦言「對這項評估的信心低於先前的風險報告」,原因有二:最具體的任務型評測已經「飽和」(「不再能反映模型能力的提升」),以及公司正「看到潛在加速的早期跡象」。
於是有了 CoBench——一個為了解決飽和問題而打造的新內部評測。設計很精巧:把模型放進 Anthropic 真實基礎設施的歷史快照(過去某個時間點的程式碼庫、日誌、內部訊息與文件),要求它診斷 Anthropic 工程師實際解決過的問題根因。目前版本包含 449 道真實題目,主要取自 2026 年 2 至 4 月解決的案例,並以難度過濾——凡是 Mythos Preview 已能解出的題目原則上不收錄。
結果:Mythos 級模型的表現「顯著優於其他近期模型,但仍未達到我們預期中能完全替代 Anthropic 技術人力的系統水準」。另一項針對 Claude Mythos Preview 的研究員調查顯示,自我申報的生產力提升幾何平均約 4 倍;18 位受訪者中只有 1 位認為它已是初級研究科學家的直接替代品——但有 4 位認為再迭代三個月的 scaffolding 就可能達標。
公司對「加速」的底線結論:Claude 如今撰寫了「合併進我們生產程式碼庫的絕大多數程式碼」,內部 AI 研發的推進速度比沒有 AI 協助時「顯著更快」——「但還不到 2 倍」。RSP 在這個類別的危險門檻,要求的是研究人力的完全替代、或 AI 進步速率的翻倍。兩者都還沒發生。目前為止。
生物防護的前科
報告也以罕見的坦率,回顧了人類回饋管線中的一段歷史防護空窗。外部資料廠商供應的約聘人員,會在 Anthropic 的資料收集平台上與未發布的模型互動——而 Anthropic「不直接審查個別約聘人員」。在更早期,「審查流程薄弱許多、缺乏上述多項要求」,期間公司「經歷了數起與廠商相關的模型存取事件」。如今絕大多數約聘存取都在啟用生物阻擋分類器的狀態下進行——但這段經歷解釋了為何生物濫用評級在本報告中也受到重新檢視。
這份文件為何重要
前沿實驗室的安全文件通常是安撫人心的練習。這一份不同,不同在三個地方。它違背自家分析結論而上調風險評級,明確地把不確性置於信心之上。它揭露了一個與能力競賽相關的祕密——一款未發布、更強的模型——而不是讓對手去猜。它還坦承整個領域的核心測量儀器正在失效:當你的評測飽和了,你就不再是在測量真正重要的東西,而每一個「低」或「極低」的評級,都從證據論證退化成了氣氛論證。
對把生產工作負載押在 Claude 上的企業來說,務實的解讀是:以 Anthropic 自評,其模型仍低於每一項 RSP 危險門檻——但誤差範圍如今是被正式承認的。對整個產業而言,這份報告立下了先例:公布不確定性、說出被雪藏的模型名字、並大聲承認尺子正在融化。下一份風險報告(屆時 AISI 對話紀錄應已分析完畢),可能會是今年最多人閱讀的安全文件。
資料來源
Sources
- [1] https://www.anthropic.com/aug-2026-risk-report
- [2] https://www.axios.com/2026/08/14/anthropic-model-2-ai-risk
- [3] https://www.moneycontrol.com/technology/anthropic-releases-risk-report-august-2026-reveals-ai-research-could-soon-accelerate-rapidly-warns-automated-ai-r-d-may-become-a-major-risk-article-14006209.html
- [4] https://www.techtimes.com/articles/324573/20260815/anthropic-upgrades-misalignment-risk-key-safety-benchmarks-saturate.htm
- [5] https://www.unite.ai/anthropic-raises-misalignment-risk-to-low-and-shelves-internal-model-2/
- [6] https://thenextweb.com/news/anthropic-risk-report-bio-classifiers-human-feedback-gap