中階模型的大逆轉:Claude Sonnet 5.5 在 Agentic Coding 上超越 Opus 5.5,任務成本再降 30%
Anthropic 新款中階模型在 Terminal-Bench 4.0 拿下 70.6%,高於旗艦 Opus 5.5,輸出速度快 30% 以上、每任務成本最多省 30%,更是首款配備網安防護與反蒸餈分類器的 Sonnet。
就在 OpenAI DevDay 前一天,Anthropic 低調重塑了自家模型產品線的經濟學。2026 年 9 月 28 日,該公司發布了 Claude 5.5 家族的第二位成員 Claude Sonnet 5.5——而最搶眼的數字不是什麼基準測試紀錄,而是一款中階模型在 agentic coding 上超越自家旗艦:Terminal-Bench 4.0 拿下 70.6%,高於 Opus 5.5 的 66.4%,掛牌價卻只有旗艦的一半。
Sonnet 5.5 距離 Opus 5.5(9 月 22 日)發布僅一週,距離主打低成本代理部署的 Sonnet 5 約三個月。新模型延續同一命題並繼續推進:輸出速度比 Sonnet 5 快 30% 以上——是迄今最快的 Sonnet 模型——而且完成同樣工作所需的 token 大幅減少,即使牌價不變,每任務成本最多仍可降低 30%。
基準測試數字怎麼看
Anthropic 公布的數據顯示相較 Sonnet 5 有戲劇性躍升,在知識型工作上則接近 Opus 5.5:
- Terminal-Bench 4.0(agentic coding): 70.6%,相較 Sonnet 5 的 10.3%——約七倍提升——也高於 Opus 5.5 最佳成績的 66.4%。
- FrontierCode 1.1(Main): Anthropic 表示 Sonnet 5.5 在 High 力度下的表現,以約五分之一的每任務成本匹配 GPT-6 Sol 的最佳分數。在 Max 力度下為 46.2%——略低於自家 Xhigh 的結果,公司解釋這是因為 FrontierCode 會懲罰超出範圍的修改:模型的 code-review skill 把審查拆給多個 subagent 時,在兩個案例中導致逾時或額外編輯而被扣分。
- CursorBench 4.0: 55.5%,與 Opus 5.5 的 57.8% 相差約兩分,遠高於 Sonnet 5 的 34.1%。
- GDPval-AA v2.1(橫跨 44 種職業的真實工作): 1844 分——只比 Opus 5.5(1846)低兩分,比 Sonnet 5(1449)高出約 400 分。GPT-6 Sol 為 1487。
- Humanity’s Last Exam(含工具): 64.5%,Opus 5.5 為 67.7%。
- OSWorld 2.1(電腦操作,partial): 80.1%,Opus 5.5 為 81.8%。
- Chartography(圖表視覺辨識,無工具): 61.6%,Sonnet 5 僅 15.6%,GPT-6 Sol 為 53.6%。
還有一個既是迷因也是里程碑的第一次:Sonnet 5.5 是首款僅憑截圖就能破關《寶可夢 紅》的 Sonnet 模型。
TechCrunch 對「超越 Opus」的解讀是:在 agentic 工作中,靈活度比原始智能更重要——便宜的模型可以平行生成多個 agent 而不會爆掉成本上限,這在旗艦級模型上是要付出高昂代價的選項。
效率故事才是真正的降價
牌價與 Sonnet 5 相同:每百萬輸入 token 2 美元、輸出 10 美元、快取讀取 0.2 美元、快取寫入 2.5 美元(Opus 5.5 為 4/20 美元)。真正的折扣在 token 消耗量。Anthropic 橫跨五個力度等級(Low、Medium、High、Xhigh、Max)的每任務成本分析宣稱:
- 在 Terminal-Bench 上以 Medium 力度(Claude 應用程式的預設值),Sonnet 5.5 以不到十分之一的每任務成本,遠超 Sonnet 5 的最佳分數。
- 在 CursorBench 上以 Low 力度,用不到十分之一的成本擊敗 Sonnet 5 的最佳表現。
- 在 FrontierCode 上以 High 力度,比 Sonnet 5 在相同設定下高出十分,每任務成本約為十五分之一。
早期測試者印證了這場 token 節食。Balyasny Asset Management 在一套 2,441 項金融任務的私有測試中,測得每個答案約消耗 12.1 萬 token,而 Sonnet 5 要 49.7 萬。Slack 在 Slackbot 評測中少了約 14% 的輸出 token,Zendesk 工單處理快 20%,Box 回報速度快 2.4 倍且 token 少 12%,Lovable 統計工具呼叫少了三分之一、shell 執行數約減半,Atlassian 預期 Rovo Agent 最多可快 30%。
開發者見證也是同一方向。Epic Games 營運長 Daniel Vogel 表示,該模型「達到了你對更高階模型才會期待的品質標準」,且能在多小時的系統設計審查中撐住場面。SpaceXAI 機器學習總監 Sualeh Asif 報告:在 118 次真實 app 構建中,Sonnet 5.5 產出的 app 與 Opus 5 同級——平均每次構建 3.6 次迭代,而 Opus 5 需要 7.7 次。Unity 表示它在多步驟 Unity Editor 基準中完成了 90% 的任務。
中階模型的安全首例
由於 Sonnet 5.5 的網路安全能力與 Opus 5 相當,Anthropic 為它裝上了以往只在旗艦模型出現的護欄。這是首款以網安防護與降級機制發布的 Sonnet:較高風險的資安任務會明顯回退到 Sonnet 5,日常開發不受影響。擴充後的 Cyber Verification Program 將對 Sonnet 5.5、Opus 5.5 與 Claude Mythos 模型提供分級的進階能力存取。
它也是首款配備「防止推理萃取」安全分類器的 Sonnet——對抗工業級蒸餈攻擊的防禦——並擴大了「preserved thinking」機制,將 Claude 的思考過程綁定到產生它的帳號(經常跨帳號搬移對話的開發者需注意遷移說明)。
在 Anthropic 約 1,850 個情境的自動化行為稽核中,Sonnet 5.5 在多數對齊指標上持平或優於 Sonnet 5。更引人注目的是:在封圍(containment)評測中,它嘗試逃出沙盒的頻率接近目前測過最好的 Opus 5.5,而且是所有 Anthropic 模型中最不可能去探測容器邊界的一個。在業界正嚴格檢視失控 agent 的此刻,這個宣稱承擔著實實在在的聲譽分量。
為什麼重要
有兩個結構性轉變值得觀察。第一,中階逆轉:當一款 2/10 美元的模型在 agentic coding 基準上擊敗旗艦,「哪個模型最聰明」就不再是採購問題——「哪個模型最便宜地做完任務」取而代之。第二,價格戰已從牌價轉移到每任務 token 消耗。GPT-6 Sol 同樣掛牌 2/10 美元,兩家中階模型的牌價完全相同;競爭純粹在於一個任務要燒掉多少 token。Sonnet 5.5 在真實金融工作上四倍的 token 縮減,正是會撬動企業預算的那種數字。
Sonnet 5.5 現已於 Claude Platform 以 claude-sonnet-5-5 名稱上線,同時提供 AWS、Google Cloud 與 Microsoft Azure,支援零資料保留。預設力度依介面而異——Claude 應用程式與 Claude Code 為 Medium,平台端為 High——關閉思考模式運行 Sonnet 的開發者須先切換到新的 between_tools 設定再遷移。主打高吞吐量的 Claude Haiku 5.5 將在未來數週跟上。
在 DevDay 前一天,這個訊息對 OpenAI 再明顯不過:旗艦發布搶走鎂光燈,但真正承載工作負載的,是這些快速、便宜、如今還加上安全強化的中階模型。
Sources
- [1] https://www.anthropic.com/claude-sonnet-5-5
- [2] https://techcrunch.com/2026/09/28/anthropic-releases-sonnet-5-5-which-it-calls-a-significantly-cheaper-faster-work-partner/
- [3] https://venturebeat.com/technology/anthropic-releases-claude-opus-5-5-beating-fable-5-1-on-key-agentic-benchmarks-at-60-cheaper-api-price