← All posts / Tools

TrueFoundry 開源 TrueForge:中立廠商 Agent Harness,成本最多比 Claude Managed Agents 低 75%

MIT 授權的 agent harness 以相同準確率、最多便宜 75% 的姿態挑戰 Claude Managed Agents,萬美元黑客松今天登場。

TrueFoundry 開源 TrueForge:中立廠商 Agent Harness,成本最多比 Claude Managed Agents 低 75%

AI 技術堆疊中的 agent 層正快速整併,而 TrueFoundry 剛做出了迄今最激進的開放策略。2026 年 8 月 19 日,這家企業級 AI 基礎設施公司發布了 TrueForge——一套 MIT 授權、開放原始碼的 agent harness,讓你能在自己的基礎設施上、用任何模型執行生產級 AI agent。五天後,這次發布已成為一場開發者社群活動的核心——由 WeMakeDevs 主辦的 The Agent Harness Hackathon 於今天(8 月 24 日)登場,一路舉辦到 8 月 30 日。

TrueForge 到底是什麼

撥開行銷話術,市面上多數「agent 平台」的本質都一樣:一個模型、一組工具,再加上一個協調兩者之間循環的 harness。harness 決定上下文如何組裝、工具何時被呼叫、子代理(subagent)如何生成、程式碼執行如何沙箱化,以及人類審批如何注入流程。Anthropic 的 Claude Managed Agents 把這套循環打包成付費的封閉服務;TrueForge 則是 TrueFoundry 的回應:自己在自己的基礎設施上執行同樣的循環,模型任你選——包括開放權重模型。

根據 GitHub 儲存庫的說明,TrueForge 負責完整的作業循環:模型呼叫、MCP(Model Context Protocol)工具整合、技能(skills)、沙箱、審批流程與上下文管理。它明確標榜廠商中立:不綁定單一模型供應商,harness 本身是可以檢視、可以 fork 的程式碼,而非黑箱 API。這個專案可與 TrueFoundry 的商業產品 AI Gateway 搭配使用——後者負責路由、支出治理與合規等企業級需求——但 harness 本身可獨立運作。

基準測試數據:相同準確率,便宜 30-75%

真正吸引目光的是成本。TrueFoundry 發布了名為 Enterprise-Bench 的正面對決基準測試:14 項生產級 agent 任務,端到端完整執行。核心結論是 TrueForge 在搭載 Opus 4.8 時,任務完成率的平均值與 Claude Managed Agents 相當,但以牌價計算的成本低了約 30%——每跑一次 8.50 美元對 11.80 美元。

更激進的 75% 數字則來自更換底層模型。根據第三方報導,TrueFoundry 用較便宜的模型(DeepSeek 等級)執行同一套 harness 時,每次執行成本降到約 2.90 美元——在相近解題率下,比 Claude Managed Agents 基準線低約 75%。這就是發布報導中「便宜 30-75%」區間的由來:保留 Anthropic 旗艦模型就是省 30%,善用廠商中立特性換上低成本模型,最多可省 75%。

成本差距不只來自模型定價。基準數據還顯示 TrueForge 驅動循環的方式更省:報導指出它平均每項任務約 19 次工具呼叫,Claude Managed Agents 則是 32 次,且在相同準確率下整體 token 消耗少了約 30%。更少、更精準的工具呼叫意味著更少的上下文堆疊、更少的往返,月底帳單自然更輕。

獨立評測者也開始檢驗這些說法。Wavect 的評測指出,這份 14 項任務的基準測試「在 Opus 4.8 上與 Claude Managed Agents 的平均任務完成率相當,牌價成本低約 27%」——與 TrueFoundry 自己的數據接近,不過是以牌價而非企業議價後的費率計算。Reddit 上的社群討論中,也有使用者自行比較後回報了類似的工具用量差距。

為什麼戰場從模型轉向 Harness

這次發布的戰略意義超出單一產品。隨著前沿模型價格下滑——我們先前在報導前沿價格戰時提過——agent 每次執行的邊際成本越來越取決於 harness 層:塞了多少 token 進上下文、做了幾次工具呼叫、子代理委派得是否有效率。TrueFoundry 在發布文章〈The Agent Harness Should Be Open〉中闡述的立場是:這一層屬於客戶,而非供應商。

這背後有直接的競爭邏輯。Claude Managed Agents 向客戶收取 Claude 模型使用費,外加每 agent 運行小時 0.08 美元——這個錶不管你的 agent 用工具呼叫是否精簡,照樣一直跳。開源 harness 把這個錶變成你可以剖析、可以優化的東西。而當基準測試顯示雙方在生產級任務上準確率相當時,企業問的問題就從「用哪個模型?」變成「誰掌握了循環?」

這也吻合 2026 年的整體格局:Cloudflare 的 agentic web stack、MCP 生態系的快速標準化,以及阿里巴巴、DeepSeek 等業者持續釋出開放權重模型。這些趨勢每一項都讓廠商中立的 harness 更有價值——因為每一項都增加了你可能想串接的模型與工具數量。

黑客松今天登場

時機點很關鍵,TrueFoundry 的社群策略顯然經過設計。由 WeMakeDevs 主辦的 The Agent Harness Hackathon 於 2026 年 8 月 24 至 30 日舉行——全球線上參與,並在舊金山設有實體活動日。總獎金 10,000 美元,頭獎是一台 NVIDIA DGX Spark 個人 AI 超級電腦(價值約 5,000 美元),頒給 TrueForge 的最佳應用,另有 Mac Mini 與工作機會。參賽者要打造能使用真實工具、安全執行程式碼、跨子代理委派任務的 agent——正是這套 harness 設計來傳授的技能。

對開發者來說,這是低門檻接觸一套可能成為基本盤的基礎設施的機會;對 TrueFoundry 來說,這是漏斗:黑客松參賽者成為貢獻者,貢獻者成為讓 MIT 授權專案在發布熱潮退去後仍持續存活的力量。

幾個值得留意的但書

有三點值得保持懷疑。第一,基準測試是廠商自己跑的。14 項任務作為展示樣本有意義,但不是獨立評測,而且「Enterprise-Bench」是 TrueFoundry 自己的建構。獨立重現已經出現,但都還很早期。第二,「最多便宜 75%」的前提是換掉 Anthropic 的模型——數據沒錯,但這個說法把兩種不同的比較壓縮成一個數字。第三,自架 harness 意味著自扛可靠度:沙箱、審批流程、上下文管理從此是你的營運負擔,不是供應商的。Claude 收的每小時 0.08 美元,某種程度上是保費。

即便如此,方向很明確。有公開基準測試的開源 harness,會逼迫封閉 agent 平台為自己的定價提出正當理由,也給了企業一年前還沒有的談判籌碼。TrueForge 已經以 MIT 授權上架 GitHub,等著被壓力測試——而這一週,數千名黑客松參賽者就要做 exactly 這件事。