HarnessTax 研究:模型沒問題,是外面的「框架」讓你多付一倍錢
UC Berkeley 與 Arena 實測 21 種「模型 × 框架」組合,發現框架選擇幾乎不影響成功率,卻會讓成本差到 2 到 5 倍——Claude Code 跑同樣任務的花費約是 Pi 的兩倍。
你讀過的每一篇 coding agent 比較文,焦点大概都擺在模型上:哪個前沿模型解掉最多 GitHub issue?誰寫的 diff 最乾淨?UC Berkeley 與 Arena 的新研究把這個問題倒過來看:當模型固定不變時,harness(框架)——那套管理模型工具、上下文與執行迴圈的軟體系統——幾乎不影響任務能不能解開,卻大幅影響你要付多少錢。團隊把這個價差稱為「harness tax」(框架稅),而對每天跑大量 agent 的團隊來說,這可能是沒人拿出來 benchmark 過、卻最昂貴的一條開銷。
研究怎麼做
研究人員評測了 21 種「模型 × 框架」組合:7 個模型 × 3 種框架——Claude Code、Codex CLI 與 Pi。模型陣容橫跨當前商用光譜:Claude Fable 5、Claude Opus 4.8、Claude Sonnet 4.6、Claude Haiku 4.5、GPT-5.6 Sol、GPT-5.6 Luna,以及開放權重的 Kimi K3。
評測錨定在兩個開源 benchmark 上:SWE-bench Lite(在真實 GitHub issue 上測軟體修改能力)與 Terminal-Bench 2.0(測複雜命令列任務)。方法學收得很緊:每個 benchmark 隨機抽同樣 30 個任務、每個任務跑 3 次以捕捉變異、每種框架用其高強度設定、每次嘗試上限 100 個 agent 輪次。成敗由各 benchmark 官方評分器判定——不自創評分標準——token 成本則用一份固定在 2026 年 9 月 1 日的直連 API 價目表計算,對所有框架一視同仁。團隊還刻意中和了環境差異:在 SWE-bench Lite 上,所有任務容器都對外斷網,並停用 Claude Code 與 Codex 的網頁工具,確保沒有框架靠查資料佔便宜。
統計處理比多數 agent 評測嚴謹:用 10,000 次 bootstrap 重抽樣估計 95% 信賴區間,並把結果放到 Pareto 前沿上呈現——那道「在某個成本以下能達到的最佳成功率」的階梯線——讓讀者看到成本與品質的取捨,而不是單一排行榜數字。
發現一:框架收的是你的錢,不是成功率
頭條結果很直白。模型固定下,跨框架的平均成功率差異在 SWE-bench Lite 上落在 ±2% 內、在 Terminal-Bench 2.0 上約 ±5%——成本卻能差到 5 倍。
最具代表性的案例是 Claude Fable 5:在 Claude Code 裡解開 97.8% 的嘗試,在 Codex 和 Pi 裡各是 96.7%。但 Claude Code 每次嘗試的花費約是 Pi 的兩倍($1.33 對 $0.67)。團隊特別指出,輪次數幾乎一樣——Claude Code 平均 15.3 輪、Pi 15.4 輪——所以溢價並非因為 agent 多走了幾步。同樣的工作、同樣的結果、兩倍的帳單。
用幾何平均跨共用模型彙總:在 SWE-bench Lite 上,Claude Code 成本約為 Pi 的 2.0 倍、Codex 的 1.6 倍;在 Terminal-Bench 2.0 上約為 Pi 的 1.5 倍。如果你從未比較、直接接受 coding agent 的預設框架,這份研究暗示你一直在繳一筆從不出現在任何成功率指標上的稅——因為它根本不改變成功率。
錢花到哪去了?線索藏在第一次模型呼叫裡。跨全部 7 個模型,Claude Code 的平均初始上下文超過 Pi 的 10 倍——指令敘述更長、工具 schema 更大,agent 還沒做任何事之前,平均就先載入約 77,000 字元的工具規格與指令。輸入 token 的成本隨這段「開場白」膨脹,不過作者也附帶說明:快取、生成的 token、後續呼叫都會影響最終帳單,初始上下文本身無法解釋全部價差。
發現二:只有四個工具的框架站上 Pareto 前沿
第二個發現更顛覆:Pi——一個只提供 read、write、edit、bash 四個工具的極簡開源框架——在兩個 benchmark 上都觸及 Pareto 前沿。沒有專利鷹架、沒有跟模型共同訓練、沒有繁複的權限編排,最赤裸的基本配備就足以在成本上與最好的商業堆疊抗衡。
這個結果重新定義了「框架工程」的價值:在這些 benchmark 上,功能豐富並沒有轉換成可見的成功率提升——agent 的能力主要住在模型裡,框架的職責是把智慧接到對的工具上,而不是燒 token。作者也明說了它的研究政策含義:研究人員現在不需要接觸專有系統,就能用最先進的 coding 框架做研究,因為開源的已經站在前沿。
不過作者抗拒過度延伸:這些發現限於兩個開源 benchmark,模型在訓練時可能見過它們;在其他工作負載上結果可能不同。框架複雜度該被當成實證取捨,而不是美德。
發現三:模型不需要「原廠」框架
第三個發現戳破了原廠配對的神話。OpenAI 曾形容 GPT-5-Codex 是為 Codex 中的軟體工程任務所優化。然而跨 6 個 Anthropic 與 OpenAI 模型、兩個 benchmark 的 12 組比較中,有 9 組是別家框架拿到最高成功率。
這個模式在各個層級都重複出現:Sonnet 4.6 在 SWE-bench Lite 上於 Codex 解開 68.9%,高於 Claude Code 的 66.7%,成本卻相近;GPT-5.6 Sol 在 Terminal-Bench 2.0 上於 Pi 拿到 83.3%,勝過 Codex 的 78.9%——成本還只有約一半($0.42 對 $0.76)。用部落格文章裡更直白的說法:你的 Claude 模型未必需要 Claude Code。模型能力是可移轉、可泛化的,同一個供應商不保證最佳配對。
數據裡還有一場開放權重的安靜勝利:Kimi K3 在 SWE-bench Lite 上貼近 GPT-5.6 Sol 附近的 Pareto 前沿,在 Terminal-Bench 2.0 上也緊鄰其下——開放權重模型打出了有競爭力的 coding agent 表現。
為什麼重要
coding agent 的經濟學通常被當成模型定價故事來討論——每百萬 token 多少美元、訂閱層級、批次折扣。HarnessTax 告訴我們還有第二層、而且大致隱形的定價層:包裝層的 token 開銷,它能在不移動成功率指針的情況下,把相同工作的成本拉開 2 到 5 倍。對訂閱制的個人用戶,這是雜訊;對每天跑數千 agent 小時的公司,這是一張雲帳單與另一張雲帳單的差別。
這項研究的方法論貢獻可能比它的具體數字更長壽:只變模型、固定框架的評測,系統性地漏掉了成本這個軸。作者主張,模型評測應該比較同一個模型在不同常用框架下的成本與成功率——並展望一種能隨任務開展而自我調適的框架,而不是讓使用者靠江湖傳說做組態決定。
值得記住的但書:每個 benchmark 30 個任務是個小樣本;benchmark 可能在訓練時被污染;「高強度」設定與 100 輪上限依各框架自身定義;真實開發流程——需求會變、有人類回饋、任務跨越多個 session——與 benchmark 容器不同。作者公開釋出分析用的 profiling traces,對一個結論這麼重的研究來說,這是正確的選擇。
結論
對日常任務而言,coding agent 本質上是模型智慧的介面。模型越強,可能越不需要今天的鷹架——而你不需要的鷹架,對按 token 計費的人來說就是純利潤。HarnessTax 提醒我們:在 agent 堆疊裡,模型是人才,框架是合約。合約要讀。