← All posts / Industry

Glean 實測宣稱 Claude Cowork 每任務成本貴 5 倍:重塑企業 AI 的基準測試大戰

Glean 的基準測試顯示,其自動路由助理完成企業任務平均每件僅 0.58 美元,而 Claude Cowork 要價 2.98 美元——81% 的差距來自上下文架構而非模型優劣。在 Uber、ServiceNow 相繼提早燒光年度 AI 預算之際,這份報告直擊每個 Anthropic 客戶的痛點。

Glean 實測宣稱 Claude Cowork 每任務成本貴 5 倍:重塑企業 AI 的基準測試大戰

本週對 Anthropic 企業市場野心最尖銳的一擊,並非來自競爭模型實驗室,而是來自合作夥伴。Glean——一家產品完全架設在他人模型之上的企業搜尋與工作 AI 公司——發布了一份基準測試,宣稱其助理完成典型企業任務的成本為每件 0.58 美元,而 Claude Cowork 在同樣工作上平均要 2.98 美元。這是 81% 的 token 成本差距,而 The Information 的 Kevin McLaughlin 把它濃縮成一個保證傳遍每個握有 Anthropic 合約的 CFO 手機的標題:「Glean 說,Anthropic 客戶的帳單比必要水準高出 80%。」

這項宣稱落地之時,市場對 AI 支出的焦慮正處於高點。Uber 披露自己只用四個月就燒光了 2026 全年的 AI 編碼預算;ServiceNow 幾週後通報同樣命運,其 CIO 稱之為「非常棘手的問題」。Glean 為這個時代的前半段取了個名字——「tokenmaxxing」(token 最大化),把 token 消耗量當生產力指標來追蹤的行為——而它的部落格文章既是對那個時代的悼詞,也是對取代方案的推銷:路由、上下文、與恰到好處的智慧。

這份基準測試到底測了什麼

實驗設計很直接。Glean 讓自家的 Assistant 開啟自動路由,對上執行 Claude Sonnet 5 高推理等級的 Claude Cowork——這是 Anthropic 官方建議的日常工作組態——橫跨超過 180 項企業任務,涵蓋業務、工程、行銷、人資、產品、財務與客戶支援。Claude Cowork 獲得的配備也算公平:Google Drive、Gmail、Google Calendar、Slack、Atlassian Rovo、Linear、Intercom 與 Sigma 的現成 MCP 連接器,加上 Salesforce、GitHub 與 GCP 的本地 MCP 伺服器。

核心數字:

  • 每任務成本: Glean 0.58 美元 vs. Cowork 2.98 美元——降低 81%
  • 總 token 用量: Glean 130 萬 vs. Cowork 440 萬——減少 70%
  • 人類偏好: 在整體偏好、正確性、完整度與互動品質上,評分者 78% 的時間偏好 Glean 的答案

值得注意的是,這已經是 Glean 第二次進行這項比較。八月中旬版的本基準測試(當時在 LinkedIn 上廣泛流傳)顯示每任務 0.45 美元對 1.84 美元——4 倍差距。新數字在絕對值上對雙方都更贵,但比例大致一致,這表示該比較並非一次性挑樣本,而是對架構差異的可重複測量。

Glean 自認勝出的原因:上下文,而非模型

這份測試最有意思的部分是它的解釋——因為它與「模型更強」毫無關係。Glean 根本沒有前沿模型。它的論點是,成本差異來自架構:

預先索引的企業上下文。 Glean 從一個統一、具備權限感知、經排序的公司資訊索引出發。Claude Cowork 的聯邦式 MCP 作法必須逐一搜尋每個連接的系統——經典的過度抓取(overfetch),然後燒 token 去正規化資料、解決衝突、重複執行本不必要的推理迴圈。如果回答「EMEA 團隊上季對定價做了什麼決定」需要經由 Slack、Drive 與 Salesforce 打五次工具呼叫,而不是一次檢索,token 計量器就會全程狂轉。

Harness 設計。 Glean 把工具輸出與中間狀態保存在沙盒檔案中,而不是每一輪都重新載入上下文視窗。它漸進式地只載入任務所需的工具與 schema,而隔離的子代理讓無關上下文進不了主推理迴圈。這其實是對多數代理 harness 構建方式的含蓄控訴:把每個中間結果塞回上下文的預設模式,正是每任務成本的最大單一驅動因素。

品質結果——78% 偏好——可以說比成本結果更具殺傷力,因為它拔除了最顯而易見的反駁。如果 Cowork 只是更便宜但更差,Anthropic 大可主張一分錢一分貨。Glean 的宣稱是:更好的上下文檢索同時產出更便宜且更受偏好的答案。

Pareto 前沿:沒有單一贏家模型

除了正面對決,Glean 還發布了一份 Pareto 前沿分析,橫跨 1,000 項企業任務、37 種模型與推理組態、11 個模型家族、81 場頭對頭對決,用 Bradley–Terry 方法論算出「Glean 品質分數」。結果值得細看:

  • GPT-5.6 Luna(xhigh) 站上前沿:品質分數 55,每任務 0.0819 美元
  • GLM 5.2(high)——開源——分數 57,成本 0.3489 美元
  • Gemini 3.7 Flash(high) 分數 61,成本 0.4748 美元
  • Kimi K3(high) 分數 63,成本 0.8995 美元
  • Claude Opus 5(high) 鎮守昂貴端:分數 67,成本 2.9605 美元

差距有多大:前沿上最便宜與最貴的模型成本相差 36 倍,品質分數卻只差 22%。 而 Kimi K3 與 Gemini 3.7 Flash 這類模型,以 3–6 倍更低的成本拿下了 Opus 5 品質優勢的大半。Glean 的結論——「沒有單一最佳模型」——同時也是它的產品命題:其自動路由使用一個名為 Glean Waldo 的小型專門模型(以 NVIDIA Nemotron 3 Nano 後訓練而成),在執行期決定 40 多個模型與推理力度的組合中哪個配得上眼前任務。

時機並非偶然。過去一個月出現了定價激進的新開源模型——GLM 5.2、Kimi K3、DeepSeek V4 Flash——加上 OpenAI 七月調降 GPT-5.6 Luna 與 Terra 的價格。企業的回應是把開源模型混入自家技術堆疊,支援這些模型的推理平台市占率也在上升。一份顯示開源模型站上成本—品質前沿的基準測試,就是一份推銷路由服務的基準測試。

Botsitting:沒被編列預算的隱形成本

全文最值得引用的統計數字,其實與 token 無關。Glean 的 Work AI Institute 調查了 6,000 名全職數位工作者,發現他們每週花 6.4 小時在「botsitting」(盯 bot)——餵 AI 上下文、監督輸出、收拾錯誤。這比他們用 AI 實際產出生產內容的時間還多。基準測試的評分者回饋把這些修正勞務追溯到具體的失敗模式:誤讀任務、難以閱讀或分享的輸出、缺少角色或客戶上下文、不完整或過時的證據、以及缺乏依據甚至錯誤的結論。

這對空間裡的每一家供應商都是不舒服的暗示:如果模型需要每位員工每週六小時的監督才能用,勞務成本將碾壓 token 成本。Glean 的論點是:從正確上下文就位的状态出發,大部分修正工作根本不會發生。

但請細讀但書

健全的懷疑仍然適用。這是一份廠商基準測試:由 Glean 執行、用合成查詢、跑在 Glean 自己的生產資料上,比較組態也是 Glean 挑的。Sonnet 5 上的 Claude Cowork 只是 Anthropic 組態空間中的一個點,Anthropic 大可主張 Opus 級模型或不同 harness 設定能拉近偏好差距。78% 的偏好數字來自 Glean 自己的評分者。而且 Glean 有明顯的商業利益:它與基準測試同一週發表了桌面 AI 工作區 Glean Tau,而其平台做出的每一個路由決策,都是它能變現的一個項目。

但即使打上自利折扣,核心發現仍與企業自己在發票上發現的狀況吻合:Agent 式 AI 的經濟學主導因素,不是你選了哪個前沿模型,而是你的架構為了取得系統本來就該有的上下文,燒掉了多少 token。Anthropic 至今的回應是結構性的而非話術性的——Fable 5.1 大幅調降快取讀取定價、企業用量計費——這顯示它讀到了同一面牆上的同一行字。

2026 年的基準測試大戰,比拼的已經不是誰的模型最聰明,而是誰能用數字證明:通往同一個答案的那條路,自己這條更便宜。Glean 剛剛開出了最響的幾槍之一。