以六折價買到旗艦戰力:Anthropic 發布 Claude Opus 5.5,改寫前沿模型的定價規則
Anthropic 在呼籲「調節前沿速度」十天後推出 Claude 5.5 家族首款模型:效能比照 Fable 5.1、API 定價每百萬 token 輸入 4 美元/輸出 20 美元,行為稽核史上最高分,整體成本較 Opus 5 大降 40%。
在 Anthropic 公開呼籲全產業放慢腳步十天之後,他們推出了一款悄悄重塑前沿經濟學的模型。2026 年 9 月 22 日發表的 Claude Opus 5.5,是全新 Claude 5.5 家族的第一款作品,也是執行長 Dario Amodei 提出「pacing the frontier(調節前沿速度)」訴求後該公司的第一個發布。諷刺之處正是重點:在 Anthropic 的論述裡,調節速度不代表放棄能力,而是把前沿級效能與更嚴謹的評測、更強的防護機制綁在一起——而且罕見地在這個市場裡,還附帶降價。
這次發布了什麼
根據 Anthropic 的說法,Opus 5.5「在多數工作上達到 Claude Fable 5.1 的水準」,而運行成本比前代 Opus 5 低 40%。API 定價為每百萬輸入 token 4 美元、每百萬輸出 token 20 美元,比 Opus 5 便宜 20%。更關鍵的降價在快取讀取(cache reads)——這通常是 agent 與程式工作負載帳單的大宗:每百萬 token 僅 0.20 美元,比 Opus 5 的 0.50 美元低 60%。Fast 模式定價 8/40 美元,在 Claude Code 與 Claude 平台上可提供最高 2.5 倍速度。模型具備 1M token 上下文視窗與 128,000 token 最大輸出,文字生成速度比 Opus 5 快 30% 以上。Claude Sonnet 5.5 與 Haiku 5.5 將在「未來幾週」接續登場。
效能榜單說的是同一個故事。在 Terminal-Bench 4.0(xhigh 強度)上,Opus 5.5 拿下 66.4%,對比 Opus 5 的 52.3%、GPT-6 Astra 的 57.9%、GPT-5.6 Sol 的 37.3%。在 FrontierCode v1.1(main)以預設強度跑出 54.4%,小勝 GPT-6 Astra 的 53.3%——而每項任務成本僅約其五分之一。CursorBench 4.0:57.8%,領先 GPT-5.6 Sol 達 11 分,成本約三分之一。知識型工作同樣如此:GDPval-AA v2.1 拿下 1846 Elo(高於 Fable 5.1 的 1735 與 Opus 5 的 1708),Humanity’s Last Exam 搭配工具為 67.7%。例外同樣值得注意——GPT-6 Astra 在 Terminal-Bench-Science(64.6% 對 58.7%)與 Zapier 的 AutomationBench(41.4% 對 40.0%)上仍保持領先。
效率才是頭條
最值得引用的數據是 HAProxy 實驗。Anthropic 要求 Opus 5.5 與 Fable 5.1 同時把廣泛部署的 C 語言負載平衡器 HAProxy 翻譯成 Rust。兩個重寫版本都通過了 HAProxy 自家幾乎全部的回歸測試——但 Opus 5.5 只花 9.5 小時,Fable 5.1 需要 12 小時,而且成本低了 51%。一位早期測試者用它在三小時內審計並修復一個 20 萬行的程式碼庫,而 Opus 5 花了超過 20 小時、用掉 2.5 倍的 token。另一位測試者在一天內完成 68 萬行程式碼遷移——這種工作量原本需要一個工程團隊數週。在一項網頁應用優化的對照測試中,Opus 5.5 在 40 次嘗試中成功 39 次降低載入時間,而 Opus 5 的改善幅度較小、還改變了應用行為。
客戶回饋不斷強化同一主題。GitHub 產品長 Mario Rodriguez 表示,Opus 5.5 在 VS Code 裡「以不到一半的步驟」解決了比 Opus 5 更多的終端任務。Quantium 把一項原本需要 38 次提示、耗時四天的工作,壓縮到 11 次提示、三小時完成。高頻交易商 Optiver 以一半的輪次、時間與輸出 token 達到與 Opus 5 相同的品質。Kiro 在命令列任務上測得約 40% 更少的 agent 呼叫與一半的 token 用量。駐留 Slack 與 Teams 的 AI 員工 Viktor,成本近乎減半、最難任務的正確率翻倍。在 agent 以小時為單位燃燒 token 的市場裡,token 效率才是真正的定價故事——單價調降與每項任務 token 用量下降,複合成那個 40% 的總降幅。
這次有量化數據的安全設計
「調節前沿速度」的論述在安全章節變得具體。Opus 5.5 發布前經外部機構評測,包括 Frontier Design 與 METR,並在 Anthropic 的自動化行為稽核(涵蓋數千個模擬情境的對齊測試套件)中創下至今最高分。據 Anthropic 說明,它比近期的模型更不容易採取難以回復的行動或越出給定的邊界,對提示注入(prompt injection)的抗性也優於 Opus 5——在編碼、工具使用、電腦操作與網頁瀏覽等設定中全部追平或超越。在資安公司 Gray Swan 的基準上,它與 Fable 5.1 並列所有受測模型中最低的提示注入成功率。Anthropic 也表示已擴大對齊測試範圍,涵蓋更長的任務、不可能的任務,以及取材自真實事件的情境——但仍然有限制,細節詳見 Opus 5.5 System Card。
由於 Opus 5.5 在生物與資安能力上「與 Claude Mythos 5.1 相當」,它搭載了 Fable 5.1 等級的防護:通過審核的組織現在即可申請 Life Sciences Verification Program 將其用於生物研究,Cyber Verification Program 也將在數週內擴大。對企業客戶,Anthropic 同時主打「最安全的編碼 agent」——每一步動作前都有分類器把關、提供可稽核的開源沙箱,以及合併前的程式碼安全審查。
溝通風格也是功能
一個較安靜但意義深遠的改變:Opus 5.5 的寫作方式不同了。Anthropic 公開的對照樣本顯示,Opus 5 的臭蟲解釋技術上正確但行文冗長繞圈;Opus 5.5 則先把結論講清楚、加上清楚的小節標題,讓長時間工作階段保持可讀。測試者的評語是:「它寫出來的東西跟我一樣。」這聽起來很軟性,但可驗證性本身就是安全屬性:人類讀得懂的輸出,才是人類查核得了的輸出。Walleye Capital 的團隊甚至看到模型抓到他們自己評測指令裡的一個差一錯誤(off-by-one)並主動修正,還註明這會讓它在評分上吃虧——過去沒有任何模型做到這件事。
競爭格局解讀
比分數更重要的有兩件事。第一是價格:一款 4/20 美元、快取讀取 0.20 美元的前沿級模型,直接擠壓 OpenAI GPT-6 家族的毛利——Opus 5.5 在多項基準上以五分之一到二分之一的每任務成本追平或擊敗 Sol 與 Astra。有報導指出,Opus 5.5 在一項軟體開發基準上以約三分之一的價格勝過 GPT-5.6 Sol。第二是敘事:Anthropic 過去一個月不斷主張國際協調管理前沿發展,而訴求後的第一個發布證明了「調節速度」與「持續出貨」可以並存。無論監管者與對手把這解讀為領導力還是兩面手法,模型本身已可在 Claude 平台、Claude Code、AWS Bedrock 等服務使用,Sonnet 5.5 與 Haiku 5.5 也將在近期補齊整個家族。
Sources
- [1] https://www.anthropic.com/news/claude-opus-5-5
- [2] https://platform.claude.com/docs/en/models/opus-5-5/overview
- [3] https://mashable.com/tech/claude-opus-launch-promises-better-performance-cheaper-price
- [4] https://aws.amazon.com/blogs/machine-learning/claude-opus-5-5-is-now-available-on-aws/
- [5] https://llm-stats.com/blog/research/claude-opus-5-5-launch
- [6] https://www.reddit.com/r/Anthropic/comments/1wnecjb/introducing_claude_opus_55_the_first_model_in_our/