科學分數翻倍、安全一分為二:Anthropic 的 Claude Fable 5.1 與 Mythos 5.1
Anthropic 的 Fable 5.1 在 Terminal-Bench-Science 上從 24.7% 翻倍至 52.6%,價格維持 10/50 美元,而移除安全防護的孿生模型 Mythos 5.1 則透過信任存取計畫提供給審核通過的資安防禦者與生命科學家。
就在 OpenAI 推出 GPT-6 Astra 的短短幾天後,Anthropic 給出了回應——而這次回應的重點不是單一亮眼數字,而是前沿 AI 部署方式的結構性分野。2026 年 9 月 1 日,該公司發布了 Claude Fable 5.1 與 Claude Mythos 5.1:兩個版本本質上是同一個底層模型,區別不在能力,而在於誰被允許使用哪些能力、以及在哪種安全防護之下使用。
Fable 5.1 對所有 Claude API 客戶與訂閱用戶全面開放。相比之下,Mythos 5.1 僅透過 Anthropic 的信任存取計畫(trusted access programs),提供給美國境內經審核的資安防禦者與生命科學家。這對組合讓一場原本可能平淡的小版本更新,變成了一場分層模型部署的活體實驗——而早期的基準數字顯示,這場實驗正在奏效。
科學能力大躍進:24.7% 到 52.6%
最引人注目的結果是 Terminal-Bench-Science 0.1——一個要求模型在真實環境中執行多步驟科學研究任務的代理式基準。Fable 5.1 拿下 52.6%,不只翻倍了 Fable 5 的 24.7%,也大幅領先 Opus 5 的 29.0% 與 GPT-5.6 Sol 的 22.4%(依 Anthropic 自家揭露,標準誤約在 ±3.5 至 ±4.5 個百分點之間)。在一次小版本更新中讓代理式科學分數翻倍,並不是正常的迭代節奏——這反映了模型全新的自適應推理系統:依任務動態分配運算資源,而非對所有輸入套用固定的推理深度。
在通用代理式編碼基準 Terminal-Bench 4.0 上,Fable 5.1 拿到 55.8%,對比 Fable 5 的 42.0% 與 Opus 5 的 52.3%——而擺脫部分拒絕行為的 Mythos 5.1 在同一套測試中達到 60.9%。獨立評測機構 vals.ai 的報告顯示,Fable 5.1 在其 RSI Index(一個衡量 LLM 自主研發能力的五任務基準)上排名第一。在 Artificial Analysis 的 Intelligence Index 中,Fable 5.1 的 Adaptive Reasoning Max Effort 配置在目前追蹤的 192 個模型中名列第一。
Anthropic 自己的說明一如既往地直白:在內部基準中,Fable 5.1「解決了我們比 Fable 5 或 Opus 5 更多的編碼問題,並在交易直覺上達到業界最佳」。
Mythos 的分野:同一個模型,卸下防護
這次發布中影響更深遠的一半是 Mythos 5.1。它與 Fable 5.1 是同一個模型,但刻意為專業用途放寬了資安與生命科學相關的安全防護。根據系統卡(system card),Mythos 5.1「在幾乎所有資安評估項目上大幅超越 Claude Opus 5」,包括 ExploitBench 與 OSS 相關測試套件。針對系統卡的評論指出,該模型「正接近」Tier 2 能力門檻——即模型能夠完全自主地執行網路行動、並產生新型攻擊手法的層級。
這正是存取受到嚴格管制的原因。Mythos 5.1 僅透過兩個信任存取計畫,提供給一群經審核的美國資安防禦者與生命科學家。背後的邏輯很直接:防禦性資安工作與生物學研究經常會觸發一般的安全過濾器,因為調查一個漏洞或一種病原體,本來就要求模型對漏洞與病原體進行推理。單一帶防護的模型迫使你在「拒絕正當工作」與「放行濫用」之間二選一。Anthropic 的答案是:分割部署,而不是分割模型。
定價:牌面價不變,實際更便宜
Fable 5.1 沿用 Fable 5 的費率:每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。真正的成本亮點在快取:快取讀取從每百萬 1.00 美元降至 0.25 美元——降幅 75%——對於這類模型日益執行的長時程代理式工作負載來說,影響巨大。當一個編碼代理在數百個步驟間維持百萬 token 的上下文,快取價格就主導了整張帳單。兩個模型都支援 1,000,000 token 的上下文視窗,單次回應最多可輸出 128,000 token。
時空背景:競爭激烈的一週,心存懷疑的受眾
這次發布落在近年來前沿 AI 最熱鬧的一週之中——OpenAI 的 GPT-6 Astra 於 9 月 3 日上線並伴隨明確的 AGI 相關宣稱,Gemini 3.8 Flash 則以每百萬 0.75 美元進攻價格地板。Fable 5.1 的定位刻意與之不同:沒有 AGI 修辭、沒有破紀錄宣言,只有翻倍的任務分數與一場治理實驗。
市場反應呈現出值得玩味的分歧。API 用戶熱烈回報,自適應推理模式正是長時程代理所需的東西。訂閱用戶的體驗則粗糙得多——Reddit 上 Max 方案用戶的討論串形容 Fable 5.1 是個「資源怪獸」,消耗用量的速度遠快於 Fable 5,這是模型預設選擇更高推理力度的副作用。而一股揮之不去的基準懷疑論貫穿社群討論,並因 Opus 5 上市的前車之鑑而更加尖銳:數字漂亮,實際表現令人失望。「再也沒有人相信基準測試了」,一則高讚留言如此總結。
分析:真正的故事是「一分為二」
除了數字之外,有三件事讓這次發布值得持續觀察。
第一,分層部署正在成為產品架構。Anthropic 等於把安全政策變成了一個出貨功能:同樣的權重、兩個產品、不同的防護、管制的存取。如果 Mythos 5.1 的信任存取計畫能在不出事故的情況下明確加速防禦性資安工作,預期每一家前沿實驗室都會複製這套模式——同時也預期監管機構開始追問:審核「經審核者」的又是誰。
第二,自適應推理改變了使用成本結構。依任務分配運算資源,意味著牌面 token 價格的重要性讓位給「每完成一項任務的有效成本」。Artificial Analysis 已將 Fable 5.1 的 Max Effort 配置評為前沿選項中每任務成本最低者(6.12 美元)。75% 的快取讀取降幅更加放大了這一點:定義 2026 年的代理式工作負載是長上下文且高度依賴快取的,而 Anthropic 剛剛重新定價了它最重要的工作負載。
第三,科學基準的暴漲拉高了評測的賭注。Terminal-Bench-Science 0.1 上的分數翻倍,要麼是真正的能力躍遷,要麼證明該基準很快就會飽和——也可能兩者皆是。在同一時間,OpenAI 宣稱 Astra 跨過了「關鍵資安門檻」,整個產業正在同時進行兩場實驗:模型在高風險任務上變得極其強大,而基準測試則愈來愈難以可信地衡量這種能力。RSI Index 的第一名——自主研發能力稱王——正落在這個令人不安的交會點上。
Fable 5.1 現已透過 Claude 各平台提供給 API 與訂閱用戶。Mythos 5.1 仍留在存取高牆之內,一個刻意保持小規模的部署,對應著一個連 Anthropic 自家系統卡都描述為「接近自主網路行動領域」的模型。這兩個可用性設定檔之間的落差,才是真正的產品:一家前沿實驗室押注,強大 AI 的未來不是「一個模型給所有人」,而是「同一個模型,精準分配」。
Sources
- [1] https://www.anthropic.com/claude-fable-and-mythos-5-1
- [2] https://www.anthropic.com/claude/fable
- [3] https://www.vellum.ai/blog/claude-fable-5-1-mythos-5-1-benchmarks-explained
- [4] https://venturebeat.com/technology/anthropics-claude-fable-5-1-and-mythos-5-1-arrive-with-a-75-cost-reduction-for-fable-cache-reads
- [5] https://www.rdworldonline.com/anthropic-doubles-a-science-benchmark-score-with-fable-5-1-while-openai-says-its-astra-models-crosses-critical-cyber-threshold/
- [6] https://www-cdn.anthropic.com/0339e6a7c5c7b87f5c07798616dc32c215d14235/Claude%20Fable%205.1%20&%20Claude%20Mythos%205.1%20System%20Card.pdf