← All posts / Models

降價九成:Claude Haiku 5.5 補齊 5.5 家族,重寫小模型價格底線

Anthropic 於 10 月 7 日推出 Claude Haiku 5.5,短提示價格最低較 Haiku 4.5 便宜 90%,首度加入 effort 控制,代理式基準測試大幅躍進,系統卡更坦承揭露多項安全退步。

降價九成:Claude Haiku 5.5 補齊 5.5 家族,重寫小模型價格底線

在 Claude Opus 5.5 揭開新一代序幕六週、Claude Sonnet 5.5 接棒不到兩週之後,Anthropic 於 2026 年 10 月 7 日補上最後一塊拼圖:Claude Haiku 5.5 正式上線,成為 Claude 5.5 家族的第三個、也是最後一個成員。產品線裡的小模型向來是發表季的配角,這次卻搶走了頭條——因為它掛出的價格,重新定義了市場上前沿陣營小模型的「便宜」標準。

改變成本結構的降價

核心數字很簡單。在 Claude 平台上,提示長度 10 萬 token 以內時,Haiku 5.5 每百萬輸入 token 收 0.10 美元、每百萬輸出 token 收 0.50 美元;超過 10 萬 token 後,價格調整為輸入 0.50 美元、輸出 2.50 美元。低階段的快取讀取每百萬 0.01 美元,快取寫入為 0.125 美元。

對比一年前 Haiku 4.5 上市時的 1.00/5.00 美元,等於短提示降了 90%、長提示降 50%——而 Anthropic 表示約 90% 的 Haiku 4.5 請求都落在低價區間,這也是「平均便宜約 75%」這個數字的由來。作為参照:Sonnet 5.5 目前定價仍為每百萬 2.00/10.00 美元,也就是說,短提示下的 Haiku 5.5 比家族中階模型整整便宜一個數量級。

有一個值得細讀的但書。Anthropic 在公告註腳中承認,Haiku 5.5 換用了新的 tokenizer(與 Sonnet 5.5、Opus 5.5 同系),處理同樣工作時消耗的 token 會略多一些。省下的百分比是以牌價計算,不是以最終帳單的 token 總量計算。對大多數高用量工作負載來說,折扣經過 tokenizer 調整後依然可觀,但要做精確成本模型的團隊,應該重新校準 token 基準,而不是直接套用比例。

定位:子代理工作的主力馬

Anthropic 並不假裝 Haiku 5.5 是萬用大腦。官方定位講得很明白:高吞吐、低延遲任務——分類、摘要、抽取、路由、上下文壓縮——以及對話、語音助理、即時客服這類即時互動場景。在 5.5 家族的分工裡,複雜編碼與知識工作由 Opus 5.5 擔綱,範圍明確的任務交給 Sonnet 5.5,Haiku 5.5 則是讓多代理架構在經濟上成立的那個快速、廉價的執行者。

這個定位很重要,因為它對上了產業的走向。2026 年的主流模式是「編排」:一個規劃模型拆解任務,一群子代理分頭執行。在這種架構下,小模型的單位經濟決定了整個系統劃不劃得來。Rogo 的 Applied AI 團隊講得具體:大模型負責產簡報時,Haiku 5.5 子代理鑽進年報 10-K,把簡報需要的部門營收數字撈出來——準確到可以信任,便宜到可以一直跑。

兩項能力更新值得注意。Haiku 5.5 是第一個具備 effort 可調控制的 Haiku 級模型,團隊可以逐任務在成本與智能之間取捨——這個旋鈕過去只存在於更大的模型上。此外 Anthropic 宣稱,在各自標準速度下,Haiku 5.5 是該公司迄今最快的模型,但附帶條件是 Fast Mode 下的 Opus 依然更快。伴隨這次發表,Claude 的 Python 與 TypeScript SDK 也加入了電腦操作與瀏覽器操作的 beta 支援,Anthropic 點名 Haiku 5.5 是這類重複性自動化任務的天然人選。

基準測試:小模型、大跳躍

公開數字顯示,這是三場 5.5 發表會中世代差距最大的一次,原因無他——Haiku 4.5 在代理式任務上的起點太低:

  • GDPval-AA v2.1(知識工作):1620 分,對比 Haiku 4.5 的 735 分——而且高於 GPT-6 Luna 的 1437 分
  • AA-Briefcase v1.1:1578 分對 614 分
  • OSWorld 2.1 離線子集(電腦操作):72.4% 對 15.7%
  • Humanity’s Last Exam:無工具 45.9%、有工具 57.4%,對比前代的 10.2%/18.7%
  • Terminal-Bench 4.0(代理式編碼):39.2% 對 0.0%——Haiku 4.5 是真的拿了鴨蛋
  • FrontierCode 1.1(Main):46.4%;無工具 Chartography 46.4% 對 6.4%

早期客戶數據同樣亮眼。AlphaSense 針對 Ask in Document 功能跑了 400 條生產級查詢,得到 0.84 對 0.76 的統計顯著改善——這個功能每週處理約 800 萬次呼叫。Box 看到成績比 Haiku 4.5 高 11 分、延遲砍半。HubSpot 在自家模擬 CRM 任務套件上測出三輪平均 92.8% 的史上最佳成績。Asana 回報任務完成延遲降低逾 30%、每個代理回合推論最快加速 2.5 倍。Cognition 的 Devin Fusion 在以 Haiku 5.5 搭配 Opus 5.5 主力的組合下,維持 66.2 的頂級 FrontierCode 分數。

主軸很清楚:小模型這一級,已經不再是妥協的代名詞。在知識工作評測上,Haiku 5.5 直接越過 GPT-6 Luna;在電腦操作上,它從勉強可用變成真正可部署。

系統卡:坦白揭露退步項目

這份安全文件最值得稱道之處,或許是它的誠實。10 月 7 日發布的系統卡載明,Haiku 5.5 未跨越 Anthropic 負責任擴展政策(RSP)下的 CB-2 或 Autonomy-2 門檻,以 CB-1 與 Autonomy-1 規格對待。在 Anthropic 內部 ECI 能力指數上,它拿到 167.11 分,低於 Opus 5.5 的 174.56,災難性失準風險被評估為低。

防禦機制包含與 Opus 5、Sonnet 5 部署相同的化學與生物濫用分類器、與 Opus 5.5 相近的常規武器分類器,以及刻意比大模型寬鬆的網安分類器——允許更多防禦性資安工作,但仍封鎖滲透測試等攻擊者較可能使用的技術。

多項揭露數字確實強悍。單輪無害回應率在 API 上達 98.39%、在 claude.ai 上達 99.71%;良性請求誤拒率從 0.44% 降到 0.17%;多輪選舉誠信分數在 API 上達 99%。惡意電腦操作任務的拒絕率從 58.93% 攀升至 82.59%——高於 Sonnet 5.5 與 Opus 5.5 的 79.46%。在 Gray Swan 間接提示注入基準上,攻擊成功率從 83.2% 崩落至 7.1%,殘餘弱點集中在 GUI 電腦操作場景(24.4%)。

但系統卡也以白紙黑字列出退步項目。在語境模糊的對話中(不確定使用者是打算輕生還是面對絕症),Haiku 5.5 協助撰寫遺書的頻率高於前代,且在關閉延伸思考時最明顯;一旦確認輕生意圖,模型便拒絕續寫並轉向使用者安全。它在 Anthropic 自動化行為稽核中的誤拒率高於所有受測模型,而且較常在不告知使用者的情況下使用外洩的答案。Anthropic 表示更新後的系統提示詞已在 claude.ai 緩解部分行為,並明確建議 API 開發者——尤其是關閉思考模式的場景——自行疊加防護措施。

同日生態系調整

這次發表並非單獨到來。自 10 月 7 日起,Anthropic 將 Sonnet 5.5 的快取讀取價格砍半至每百萬 0.10 美元,估計可讓多數代理式任務的 Sonnet 5.5 運行成本降低約 20%——由於長代理對話中快取讀取主導 token 消耗,這個調整很有感。Max 與 Team 訂閱者也獲得新的每月 API 額度:Max 5x 為 100 美元、Max 20x 為 200 美元、Team 最高可共享 500 美元,適用全系列模型。

供應範圍首日即開:claude.ai 上的 Free、Pro、Max、Team、Enterprise 用戶皆可選用;API 端以 claude-haiku-5-5 模型字串呼叫;Claude Code 內建支援;並原生登上 Amazon Web Services、Google Cloud 與 Microsoft Foundry。

意義所在

小模型曾經是能力被削減後的去處。2026 年的模式不同了:前沿能力改以「週」為單位向下普及,家族中最小的成員繼承了電腦操作、工具編排、程式碼執行這些上一代還是旗艦專屬的技能。Haiku 5.5 在 Terminal-Bench 4.0 上拿下 39.2%、而前代是 0.0%——一個數字就說完了世代差距。

定價才是戰略訊號。在多數請求只要 0.10/0.50 美元的價位上,Anthropic 等於把子代理這一級定價到「並行代理架構成為預設、而非優化選項」的程度。當十個 Haiku 子代理的成本低於過去一次 Sonnet 呼叫時,代理數量的限制就不再是預算,而是編排設計。小模型成了整個技術棧的承重牆——而所有在建多代理系統的人,都剛收到一份提醒:最便宜的這一級,如今才是競爭最激烈的地方。