← All posts / Industry

10 億用戶、3.1 個 Agent 工作天與自研晶片:拆解 OpenAI「The Work Now Within Reach」

OpenAI 財務長 Sarah Friar 於 9 月 8 日發表專文,把整部機器串成一個飛輪:每週逾 10 億活躍用戶、250 萬企業客戶、研究團隊每人類工作天對應 3.1 個 Agent 工作天、GPT-6 Astra 基準成績、服務成本降低 20%,以及自研推理晶片 Jalapeño —— 這是一份攤在陽光下的商業論證。

10 億用戶、3.1 個 Agent 工作天與自研晶片:拆解 OpenAI「The Work Now Within Reach」

2026 年 9 月 8 日,OpenAI 發表了一篇文章,讀起來不像產品公告,倒像一場投資人簡報。這篇名為「The Work Now Within Reach」(此刻觸手可及的工作)、由財務長 Sarah Friar 撰文的專文,是該公司迄今最完整的一次公開自陳:解釋消費端規模、企業採用、前沿研究與垂直整合的算力佈局,為何不是四張獨立的賭注,而是一個互相強化的單一迴路。

時機耐人尋味。整個 2026 年,OpenAI 持續吸收鉅額資本承諾——資料中心、晶片設計、信用架構——這篇文章實際上就是在論證:這些支出為何會轉化為營收,而不是變成一場昂貴的科學實驗。

飛輪,說得白話一點

Friar 的核心論點是:消費端與企業端互相餵養。每一次研究進展都會改良 ChatGPT、ChatGPT Work、Codex 與 API;每一位新用戶帶來的使用資料與需求,又為下一輪研究循環提供資金;而從自研晶片到服務軟體的全端算力策略,則讓智慧的邊際成本持續下降。

規模數字是論證的錨點:OpenAI 產品現在觸及超過 10 億每週活躍用戶與 250 萬家企業。由廣告支撐的免費版承擔「發現」的功能;訂閱與用量計費則讓客戶在發現更多價值時,自然花費更多。

為了支撐「使用者會找到越來越多價值」這個主張,OpenAI 研究了個人 ChatGPT 方案的行為:註冊六個月後,每日訊息量比第一個月高出約 50%,且使用者嘗試的任務種類約為兩倍。方法論也攤開來講——抽樣 2025 年 10 月 15 日至 2026 年 5 月 1 日間建立帳號的 0.1% 帳戶,追蹤至 5 月 31 日,將訊息歸入 53 個能力分類,以每位使用者最初 28 天為基準比較。這是一個用罕見粒度講出來的「留存與擴張」故事。

Agent:每個人類工作天對應 3.1 個 Agent 工作天

全文最驚人的數字,借自 OpenAI 9 月 6 日的研究報告:在其研究組織內,以八小時標準工作天計算,截至 2026 年 8 月中,Agent 現在貢獻每個人類工作天 3.1 個工作天的運行時間。2026 年 6 月之前,Agent 總運行時間還低於人類總工時——交叉點在一個夏天之內就發生了。

伴隨數字同樣激進:到 8 月中,按 Agent 用量排序的中位數研究員,每天以 API 牌價計消耗超過 600 美元的推理成本;第 90 百分位的研究員每天燒掉超過 7,000 美元的 token。

OpenAI 在措辭上很小心,讀者也應該如此。一個 Agent 工作天不等於一個等產出的人類工作天——機器會走死路、會產出需要修正的內容。而且成功仍需人類導引:回溯前六個月,在預估需要四到八小時人力的成功任務中,超過一半至少涉及一次人為介入。正如 The New Stack 對同一批數據的批判性解讀所指出的:更多 Agent 時數不必然等於更快的前沿突破——監督能量可能才是真正的瓶頸。研究優先順序的設定與結果的判斷,仍然由人類掌舵。

五個客戶案例,附上數字

飛輪的企業端由五個部署案例來呈現,每個數字都來自客戶自己的陳述、由 OpenAI 呈現:

  • 波士頓兒童醫院(Boston Children’s Hospital)回報,透過 AI 輔助研究,在先前無法確診的罕見疾病案例中達成超過 40 例診斷。
  • Cars24 表示其 Agent 每月處理超過 100 萬分鐘的買賣車對話。
  • Circles 回報在支援的工作流程中,客服互動達到 65% 自主解決率。
  • Balyasny Asset Management 表示,其中央銀行演說分析器把總體經濟情境分析從兩天縮短到約 30 分鐘。
  • Replit 推出 Free Mode,讓使用者規劃軟體而不消耗用量額度。

單獨看是案例研究;合起來看,勾勒的正是 Friar 投資框架所需要的需求面——OpenAI 表示,每一筆投資都用三個標準檢驗:能服務多少需求、多快投入生產、報酬是否對得起投入的資本。

Astra、服務成本與 Jalapeño 晶片

能力面,專文將 GPT-6 Astra 定位為當前引擎:在電腦操作、瀏覽、軟體工程、資安、科學與專業工作上,達到(依 OpenAI 自家基準)最先進水準——FrontierMath Tier 4 拿下 98%、ARC-AGI-3 達 99.9%、ExploitBench 100%,並在該公司的 Preparedness Framework 下達到網路安全的 Critical 門檻。Astra 已於 2026 年 9 月 3 日開始向少數組織推出,隨後幾天在 ChatGPT 付費方案、API、Microsoft Azure 與 AWS Bedrock 全面上市。

成本面,專文重申了 OpenAI 7 月 29 日 GPT-5.6 工程文章的兩項成果:生產環境服務端改善讓端對端服務成本降低 20%,投機解碼則讓 token 生成效率提升超過 15%——這些增益是在 GPT-5.6 Sol 於 Codex 內運行時達成的,包括自主改寫生產環境核心程式。

戰略分量最重的一節,回顧了 OpenAI 的自研推理晶片 Jalapeño。在橫跨 GPT-OSS 120B、DeepSeek R1 與 Kimi K2.5 的 InferenceX 測試中,OpenAI 報告其每瓦峰值 token 吞吐量為受測商業系統的 1.5 至 1.9 倍,端對端延遲低 1.7 至 3.6 倍。計畫年底前在 OpenAI 自有算力基礎設施中開始部署,與 NVIDIA、AMD 等合作夥伴的加速器並行——第二與第三代設計已在開發中。若這些數字在生產環境成立,OpenAI 的毛利結構將開始與商用 GPU 市場脫鉤。

解讀

文中每個數字背後都有利益方:基準是自報的、客戶數字是客戶提供的、Agent 用量快照是無外部稽核的內部視角。但這正是這份文件有趣之處——它是 OpenAI 自己對「能力如何變成現金流」的會計:使用量逐月加深、Agent 放大研究員的產能、每 token 服務成本下降、自研晶片進一步扭轉成本曲線。

沒被回答的問題,正是批評者不斷提出的:3.1 倍的 Agent 運行時間,是否等比轉化為更快的前沿進展?抑或導引、驗證、修正這些輸出所需的人類注意力,會成為新的約束?Friar 的文章隱然承認了這一點——「優先順序由人制定、結果由人判斷」——同時押注這個約束會隨每一代模型鬆動。

無論如何,這個飛輪現在已由那位必須讓它賺錢的人,正式記錄在案。