Anthropic 重寫 Fable 5 生物安全分類器,誤攔率降低 85%
Anthropic 重新改寫 Claude Fable 5 的生物安全分類器,將誤判降級率降低約 85%,同時維持對病毒學、毒理學等雙重用途研究的嚴格封鎖。
2026 年 6 月 Anthropic 推出 Claude Fable 5 時,這個模型帶著一個刻意的缺陷:幾乎所有與生物學相關的查詢都被封鎖。醫生想解讀血液檢查結果、學生想了解細胞訊號傳導、藥師想確認藥物交互作用——全部被毫不留情地轉送到能力較弱的 Opus 5 模型。8 月 7 日,Anthropic 宣布對這些安全機制進行重大更新,將生物相關的誤判降級減少約 85%,同時對可能被用於生物武器的雙重用途研究維持嚴格封鎖。
問題根源:過於粗糙的分類器
Fable 5 是 Anthropic 的 Mythos 等級前沿模型,能夠在某些複雜的生物學任務上超越領域專家。正是這種強大能力使其變得危險。Anthropic 的能力評估顯示,Fable 5 可能為惡意行為者提供「顯著的提升」——也就是他們無法輕易在其他地方獲得的能力。美國情報界 2026 年度威脅評估報告也強化了這一擔憂,指出多個國家級行為者可能仍維持活躍的攻擊性生物和化學武器計畫,而這些計畫可能因接觸前沿 AI 能力而加速。
面對這一風險,Anthropic 在模型發布時做了一個刻意選擇:以幾乎全面封鎖生物查詢的方式上架 Fable 5,接受高誤判率作為安全的代價。公司承認這會讓正當使用者感到沮喪,特別是在醫療保健和教育領域,但認為在生物學這種雙重用途領域被濫用的成本「可能是災難性的」。
結果是可以預見的。使用者在論壇和社群媒體上抱怨,常規醫療問題——解讀血液報告、了解症狀、學習基礎生物學——都被封鎖。醫療專業人員發現 Fable 5 在臨床決策支援上基本無法使用。粗糙的分類器把「在研發降血壓藥物 captopril(一種真正源自蛇毒的藥物)的語境下討論蛇毒」和「討論如何將蛇毒武器化」當成同一件事。
修復方案:重寫分類器的「憲法」
在模型發布後的幾週內,Anthropic 的安全團隊仔細重寫了分類器的「憲法」——一組幫助分類器辨別受保護內容和允許內容的規則集合。團隊向多元化的內部和外部專家徵求回饋,然後根據修訂後的憲法開發更新的訓練資料,重新訓練分類器。
關鍵的概念轉變在於移動分類器的邊界。在 Anthropic 自己的圖表中,發布時的邊界位於非常左側:幾乎所有與生物學相關的內容都被封鎖,包括幾乎可以確定是良性的內容(即「安全邊際」)。更新後,邊界向右移動。分類器變得更善於辨識良性查詢和雙重用途查詢之間的細微差異,讓更多正當請求通過,同時仍然對真正有害或雙重用途的內容觸發攔截。
在 Anthropic 各個產品介面上測量的結果相當顯著:
- 整體生物相關降級減少 約 85%
- Claude.ai 總降級減少 約 67%
- Cowork 減少 約 55%
- Claude Code 減少 約 17%
- Claude Platform 減少 約 7%
什麼開放了——什麼仍然封鎖
更新後的分類器讓 Fable 5 能夠協助更廣泛的生物學任務。Anthropic 特別指出幾個現在可以使用的類別:
日常健康與教育。 使用者可以要求 Fable 5 解讀實驗室檢查結果、了解症狀、在教育情境下學習生物學概念,而不會觸發降級。
臨床決策支援。 醫療專業人員可以從 Fable 5 獲得更多臨床任務的實質協助,不過 Anthropic 強調這仍是一般用途 AI,而非醫療器材。
一般生物學知識。 模型可以討論不涉及雙重用途領域的生物學過程、機制和研究成果。
但這次更新有明確的界線。Fable 5 仍然會對被歸類為雙重用途專業生物學和藥物開發的內容降級到 Opus 5——一個能力強但生物能力不如 Fable 5 的模型。具體被封鎖的領域包括:
- 病毒學——病毒相關研究,包括需要培養病原體的疫苗開發
- 毒理學——毒素及其影響的研究,包括源自毒液的藥物
- 分子設計——設計新分子,包括潛在的治療藥物,也可能包括有害物質
這意味著專業生物學研究人員和藥物開發者仍然無法將 Fable 5 用於核心研究流程。Anthropic 將此定位為它「承諾縮小」的暫時性缺口,計畫透過「信任存取途徑」(trusted access pathways)來解決——這是一些專門的計畫,可以在受控條件下讓經過審核的研究人員使用模型的完整生物能力。
雙重用途難題的實際面
Anthropic 的部落格文章提供了一個揭示性的例子,說明為什麼生物安全防護如此獨特地困難。開發治療高血壓的藥物 captopril,需要科學家從蛇毒中分離出會使人血壓驟降的毒性成分。產出救命藥物的研究和產出生物武器的研究,在分子層面上幾乎看起來一模一樣。
這種模糊性正是老練的惡意行為者所利用的。Anthropic 指出,這類行為者「知道如何利用這種模糊性來掩飾意圖,使危險任務看起來像普通的研究活動」。一個無法區分這些情況的分類器,要麼必須封鎖一切(造成誤判),要麼冒著讓危險能力通過的風險(造成漏判)。
85% 的降級減少幅度表明,Anthropic 在這項區分上取得了有意義的進展——分類器現在能夠分辨一個學生詢問 captopril 的作用機制,和一個惡意行為者詢問其毒性前體的合成路徑。但公司也承認「還有更多工作要做」。安全邊際內的誤判將持續存在,而取得存取權與防止災難之間的根本矛盾,對專業研究人員來說仍未解決。
更廣泛的影響
Fable 5 安全防護更新的意義超越了對 Claude 使用者的直接影響。它是迄今為止最透明的案例研究之一,展示了 AI 實驗室如何嘗試解決生物學中的雙重用途問題——這個問題只會隨著模型能力增強而更加尖銳。
有幾個動態值得關注:
分類器作為守門人的模式。 Anthropic 的做法依賴小型、專門的 AI 分類器,它們位於前沿模型前方,決定什麼能夠到達模型。隨著這些分類器改進,它們可能成為整個產業管理雙重用途風險的主要機制。但他們也創造了單一故障點:如果分類器透過越獄被繞過,前沿模型的全部力量就會暴露出來。
信任存取的缺口。 專業生物學研究人員——正是 Anthropic 表示最想服務的使用者——仍然被鎖在 Fable 5 的完整能力之外。在信任存取途徑落實之前,模型最有價值的生物學應用場景仍無法使用。批評者稱之為「破碎的承諾」,指出該模型部分是基於其生物學能力來宣傳的。
監管壓力。 這次更新正值全球對 AI 生物風險的關注加劇之際。歐盟的 AI 法案現已全面生效,包含與高風險 AI 系統相關的條款。美國情報界的威脅評估明確標示出 AI 加速的生物威脅。Anthropic 主動——雖然不完美——的安全防護做法,可能會影響監管機構對合規期望的思考方式。
競爭態勢。 其他前沿實驗室面臨同樣的雙重用途矛盾。OpenAI 的 Astra 模型已觸發自身的「關鍵」網路安全閾值擔憂。每個實驗室如何平衡存取與安全,將日益成為其產品的差異化因素,特別是對企業和研究客戶而言。
展望未來
Anthropic 明確表示這是一個反覆迭代的過程。公司預期將繼續完善分類器、徵求使用者回饋,並為專業研究人員開發信任存取計畫。85% 這個數字是一個里程碑,而非終點。
對更廣泛的 AI 安全社群來說,Fable 5 生物學事件提供了一個具體數據點,證明前沿模型的細粒度、基於分類器的安全防護是可行的。它證明了誤判問題可以在不完全放棄防護模式的情況下大幅減少——但也表明最困難的情況,即有益研究和有害研究幾乎無法區分時,仍然真正未解。
對使用者的訊息很明確:Claude Fable 5 現在在日常生物學和醫療保健問題上明顯更加好用,但如果你是從事病毒學、毒理學或分子設計的專業研究人員,你仍然會碰到一道牆。這道牆是刻意存在的,而 Anthropic 正在押注研究社群會接受這個取捨,同時它努力開發一條受控的通道。
Sources
- [1] https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
- [2] https://thenextweb.com/news/anthropic-claude-fable-5-biology-safeguards-fallbacks-dual-use
- [3] https://www.techtimes.com/articles/323619/20260808/claude-fable-5-opens-biology-clinicians-researchers-wait-broken-promise.htm
- [4] https://www.developersdigest.tech/blog/fable-5-biology-safeguards-update-2026