← All posts / Tools

一次 API 呼叫,一個代理:OpenAI 把 Codex Harness 包進全新 Agents API

OpenAI 的 Agents API 公開測試版,把代管的 Codex harness——sessions、上下文壓縮、子代理與沙箱全包——開放給所有開發者。不加收平台費,但目前僅限美國資料駐留、不支援 ZDR。

一次 API 呼叫,一個代理:OpenAI 把 Codex Harness 包進全新 Agents API

過去兩年,如果你想要一個能連續工作數小時的 AI 代理——調查事故、審閱文件、重現 GitHub 上的 bug——你只有兩個不太吸引人的選擇:在 Responses API 之上自己拼一套編排迴圈,或者採用 Agents SDK 這類開源框架,然後自己扛下所有管線工程。2026 年 9 月 10 日,OpenAI 把這整疊技術壓縮成一個產品。Agents API 現以公開測試版向所有開發者開放,把驅動 OpenAI 自家編碼代理的代管 Codex harness——sessions、編排、上下文壓縮與恢復機制——全部包進一次 API 呼叫。

實際上線了什麼

Agents API 是建構在開源 Codex harness 之上的代管執行環境。OpenAI 代管並維護 harness;你的應用程式只需提供工具、選擇執行環境。官方文件以四個概念組織整個產品:

  • Agent(代理)——模型、指令、可用工具與 MCP 伺服器。
  • Environment(環境)——可選的沙箱,代理在其中存取檔案、載入技能、執行指令。
  • Session(工作階段)——一個持久存在的代理實例,能持續處理任務並回應輸入。
  • Events and items(事件與項目)——傳送給代理的輸入,以及工作階段中產生的輸出。

一個 session 的生命週期分四步:建立並設定、交付任務、透過串流或 webhooks 追蹤進度、接著指派新任務或在當前回合中途轉向。發表示範只用一次 client.beta.agents.sessions.create() 呼叫就建出一個事故調查代理——模型、MCP 工具、多代理設定與沙箱全部行內宣告,代理隨即開始根因分析某個飆升的 5xx 錯誤率。

OpenAI 對這項產品的出處毫不掩飾:規模化 Codex 與 ChatGPT for Work 的經驗,說明了長時間運行的代理真正需要什麼。它們需要一個能管理上下文、有效率使用工具、協調子代理的 harness;也需要能讓它們可靠連跑好幾天的基礎架構——而不是以秒計的請求/回應週期。

環境的選擇

代理在哪裡執行,是核心的架構決策。API 支援三種沙箱模式,也可以完全不用沙箱:

  1. OpenAI 代管沙箱——使用 Codex 與 ChatGPT 背後同一套沙箱基礎架構,可設定檔案、套件、技能與外掛。
  2. 自行代管(self-hosted)——你在自己的環境裡跑 codex exec-server;它以受限金鑰註冊,透過 WebSocket 連線,且所有連線均為對外發起。
  3. 合作夥伴沙箱——與 Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel 的一級整合。

這份合作夥伴名單是此案最安靜的戰略布局。OpenAI 並未強迫所有工作負載搬進自家基礎架構,而是把自己定位為代理生態系的編排層——無論代理在哪運算,控制平面都是它。這是一場要當「代理生態系控制平面」而不只是「眾多執行場所之一」的豪賭。

Harness 替你處理了什麼

OpenAI 打包進來的功能,恰恰是把玩具代理與生產級代理區分開來的那些不起眼工程:

  • 自動上下文壓縮——session 接近上下文上限時,較早的回合會被自動摘要。開發者不必再自寫壓縮邏輯,而這向來是長時間運行代理中最脆弱的一環。
  • 工具搜尋(tool search)——工具定義只在需要時載入,降低 token 用量與成本,同時保住模型的快取。
  • 程式化工具呼叫——代理平行執行呼叫、在程式碼中串接操作,過濾合併結果後,只讓相關資料回到上下文。
  • 子代理(subagents)——啟用多代理支援後,主代理把複雜任務拆成獨立片段;每個子代理有自己的上下文,協調者再彙整結果。
  • Session 恢復——代理從中斷處繼續,跨回合持久保存,不必重建對話狀態。

OpenAI 讓 harness 與自家模型同步維護,每次模型發版都提供版本化存取——執行環境與它所編排的前沿模型一起演化,而不是漸行漸遠。

三種執行環境的比較

OpenAI 自己的比較表把三種執行環境放在同一光譜上。Agents SDK 在你的應用程式內執行,整合 effort 中等,狀態存在你的儲存空間。Responses API 則把執行完全留給你。Agents API 坐在低整合那一端:OpenAI 代跑 harness、保存 session 設定與所有回合和項目、管理執行——代價是把執行環境交給供應商。

早期客戶數據由廠商提供,解讀時請保持警覺:Ciridae 回報評測分數從 0.71 升至 0.85,子代理流程延遲降低 4 倍;SafetyKit 遷移案件審閱流程後,每案成本降低 60%;Hypha 宣稱把 harness 與沙箱分離後,代理失敗回應減少 86%;Nash.ai 則在全球物流網路上跑著數千個長時間運行代理。

但書與限制

對受監管的工作負載,有兩個限制必須注意:資料駐留目前僅限美國,且不支援 Zero Data Retention(ZDR)——值得留意的是,選擇自行代管沙箱並不會讓 API 符合 ZDR 資格,因為 session 狀態仍然存在 OpenAI 那裡。有歐盟資料駐留要求或嚴格保留政策的企業,只能再等等。

計價採用量制、不加收平台費:模型 token 依標準 API 費率、OpenAI 工具依標準費率、代管沙箱依標準容器費率。成本隨代理實際做多少事規模化,而不是隨席位或訂閱。

為什麼重要

Agents API 最貼切的解讀,是代理層的基礎架構整併。每個在建長時間運行代理的團隊,都在重複解決同樣的問題——上下文管理、工具路由、子代理協調、沙箱生命週期——只是品質參差。OpenAI 的賭注是:這一層是天然壟斷。經營前沿模型的公司,理應也經營模型思考時所在的 harness。

這一步也拉高了那些靠這類管線維生的框架與平台的賭注。當模型供應商直接內建附贈子代理、壓縮與九家沙箱合作夥伴的代管 harness,「我們幫你編排 OpenAI 模型」就不再是差異化,而是供應商免費奉送的功能。反方論點也真實存在——廠商鎖定、美國資料駐留、無 ZDR、以及把地基蓋在 beta 之上的風險——多雲團隊必然會衡量這些。但方向無可誤認:代理執行環境正在成為模型 API 本身的一部分,而從「點子」到「能自主工作的代理」之間的距離,剛剛縮短到一次 API 呼叫。