Terminal-Bench 拿下 70.6%:Anthropic 的 Claude Sonnet 5.5 讓中階主力模型晉身前線級競爭者
Anthropic 發布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 從 10.3% 躍升至 70.6%,價格維持每百萬 token 輸入 2 美元、輸出 10 美元,速度加快 30% 以上,更是首款出廠即配備前線級資安防護與蒸餾攻擊防禦的 Sonnet 模型。
在發表 Claude Opus 5.5 六天之後,Anthropic 推出了 Claude 5.5 家族的第二位成員:Claude Sonnet 5.5,現已於所有平台上線,包括 Amazon Web Services、Google Cloud 與 Microsoft Azure。從定位看,這是一次中階例行更新;但從數字看,各項基準測試的增幅一點也不「中階」——而隨之而來的安全機制,可能是這次發布更值得關注的部分。
頭條數字:從 10.3% 到 70.6%
整份發布內容中最震撼的數字是 Terminal-Bench 4.0——一項評測模型能否在命令列環境中完成複雜、多步驟專業任務的代理式編碼基準。Sonnet 5 的得分是 10.3%,而 Sonnet 5.5 拿下 70.6%——不僅是前代的近七倍,還超越了 Opus 5.5 在同一基準上的 66.4%。
這種反轉——更便宜、更快的模型在特定代理式評測上贏過旗艦——正是值得注意的訊號。以下是 Anthropic 公布的完整比較:
| 基準測試 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0(代理式編碼) | 70.6% | 10.3% | 66.4% | — |
| FrontierCode 1.1(Main) | 46.2%(Max) | 42.4% | 54.4% | 49.3%(Xhigh) |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1(知識工作) | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1(長程任務) | 1811 | 1359 | 1822 | 1483 |
| Humanity’s Last Exam(含工具) | 64.5% | 54.9% | 67.7% | — |
| OSWorld 2.1(電腦操作) | 80.1% partial | 57.0% partial | 81.8% partial | — |
| Chartography(圖表判讀) | 61.6% 免工具 | 15.6% 免工具 | 64.4% 免工具 | 53.6% 免工具 |
在知識工作上,Sonnet 5.5 於 GDPval-AA 以 1844 分逼近 Opus 5.5 的 1846 分,同時比自己前代高出約 400 分。在無需工具的圖表判讀 Chartography 上,它從 15.6% 一舉躍升至 61.6%。還有一個會讓特定族群會心一笑的細節:它是第一款僅憑截圖就能破關《寶可夢 紅》的 Sonnet 模型——這是長程任務耐力與影像理解能力的絕佳代理指標。
獨立評測機構 Artificial Analysis 在最高推理投入(max effort)下,將 Sonnet 5.5 列上其智慧指數(Intelligence Index)的第二名,較 Sonnet 5 提升 18 分,僅次於 Opus 5.5。
價格不變、用量更省:這次升級的經濟學
定價與 Sonnet 5 完全相同:每百萬輸入 token 2 美元、每百萬輸出 token 10 美元、快取讀取每百萬 0.20 美元——恰好是 Opus 5.5(4 美元/20 美元)的一半。但牌價並未反映全貌,因為 Sonnet 5.5 完成同樣工作所需的 token 明顯更少。Anthropic 表示,它每項任務的成本最多可比 Sonnet 5 低 30%,輸出速度則快 30% 以上,是迄今最快的 Sonnet 模型。
真正鋒利的是「投入程度旋鈕」的經濟學。在多項基準上,Sonnet 5.5 以低(Low)或中(Medium)投入就能超越 Sonnet 5 的最佳成績,而每任務成本僅約十分之一。在 High 投入下的 FrontierCode,它比同設定的 Sonnet 5 高出 10 分,每任務成本卻只有約十五分之一。Claude Code 與官方應用程式預設為 Medium 投入;Claude Platform 則預設為 High。
企業測試者也給出了具體數字。Balyasny 資產管理在一套包含 2,441 項金融任務的私有評測中發現,Sonnet 5.5 每個答案使用約 12.1 萬 token,而 Sonnet 5 需要 49.7 萬。Box 回報速度快了 2.4 倍、總 token 減少 12%。Lovable 測得工具呼叫次數減少三分之一、每項任務的 shell 執行次數約減半。Atlassian 表示 Rovo 代理的執行速度最多可提升 30%。Slack 的 Slackbot 評測在完全不改提示詞的情況下「幾乎全數提升」,輸出 token 減少約 14%。
CodeRabbit 的獨立評測發現,它在自己 13 個最難的已知臭蟲案例中抓到 6 個(Sonnet 5 為 4 個),可執行建議比率為 41.2%。Epic Games 表示它在「數萬行」遊戲系統架構程式碼的系統設計稽核中撐住了水準;Base44 則回報每個應用建置平均只需 3.6 次迭代,而 Opus 5 需要 7.7 次。
首款出廠即配備前線級防護的 Sonnet
這次發布中較安靜的那一半,是安全架構向下游普及。由於 Sonnet 5.5 的網路安全能力與 Opus 5 相當,它成為首款一推出就配備網路安全防護與降級機制的 Sonnet 模型——過去這類機制僅保留給 Anthropic 最強的模型:較高風險的資安任務會明顯降級改用 Sonnet 5 處理,日常開發則不受影響。擴編後的 Cyber Verification Program 將為 Sonnet 5.5、Opus 5.5 與 Claude Mythos 系列提供分級的進階能力存取。
它也是首款內建防止推理萃取(reasoning extraction)安全分類器的 Sonnet,目標是打擊利用數千個假帳號、以工業化規模萃取模型能力的蒸餾攻擊(distillation attacks)。 preserved thinking(思考保全)的涵蓋範圍也同步擴大——Claude 的思考過程再也無法與建立它的帳號分離,在 Claude Code 中途切換帳號或跨帳號搬移對話的開發者會感受到這項變化。
在對齊方面,Anthropic 的自動化行為稽核(約 1,850 個情境)顯示 Sonnet 5.5 在多數指標上優於或持平 Sonnet 5。在較新的圍堵評測中,它嘗試逃出沙箱的頻率接近 Opus 5.5,且是所有 Anthropic 模型中最不可能去探測容器邊界的一個。該公司也照例提醒:沒有任何評測組合能捕捉所有問題。
我們的解讀
兩個重點。第一,中階不再是妥協階。當一款 2 美元/10 美元的模型在 Terminal-Bench 拿出 70.6%、在該項評測上贏過自家旗艦,那麼範圍明確的代理式編碼、除錯與文件工作的實務預設選項,已在一夜之間改寫。Anthropic 自己的定位也很清楚:Opus 5.5 負責需要持續判斷力的複雜工作,Sonnet 5.5 負責其他一切,而在較高投入設定下兩者表現逐漸趨同。
第二,安全功能正以「發布速度」而非「以年計」向下普及。網路安全防護、蒸餾防禦與思考保全都率先登場於前線模型,並在同一個世代內就抵達主力階層。隨著 Claude Haiku 5.5「數週內」加入、完成整個家族,買家的問題已不再是「便宜模型夠不夠安全」,而是「對於不再需要旗艦的工作,每 token 多付一倍值不值得」。
可用性方面,它已同步上線 Anthropic API、AWS、Google Cloud 與 Azure,並與兄弟模型一樣支援零資料留存(zero data retention)。
Sources
- [1] https://www.anthropic.com/claude-sonnet-5-5
- [2] https://the-decoder.com/anthropics-claude-sonnet-5-5-nearly-matches-opus-5-5-on-benchmarks-while-costing-up-to-30-percent-less-per-task/
- [3] https://artificialanalysis.ai/articles/claude-sonnet-5-5
- [4] https://venturebeat.com/technology/anthropic-launches-claude-sonnet-5-5-with-30-cost-reduction-per-task-due-to-faster-speeds-and-fewer-tool-calls
- [5] https://www.datacamp.com/blog/claude-sonnet-5-5