← All posts / Models

比 Excel 世界冠軍快四倍:OpenAI 把 GPT-6 Astra 定調為「工作模型」

OpenAI 新發布的「GPT-6 Astra for work」文章為商業市場端出硬數據:Terminal-Bench 4.0 拿下 57.9%、安全性測試非預期結果減少 89%、Excel 競賽任務速度達人類四倍,並推出全新企業管控與桌面外掛。

比 Excel 世界冠軍快四倍:OpenAI 把 GPT-6 Astra 定調為「工作模型」

OpenAI 於 9 月 3 日發布 GPT-6 Astra 時,輿論焦點全在「AGI 時代」的宣言、FrontierMath Tier 4 的全數攻克,以及強勁到讓公司暫停 ChatGPT Pro 新訂閱的需求海嘯。八天後,公司發布了後續文章——〈GPT-6 Astra: The next generation in intelligence for work〉——把哲學論述換成了試算表。這篇新文章就是商業提案本身:以每任務成本計價的基準測試、以「非預期結果次數」量測的安全性,以及一場接近荒謬的 Excel 世界錦標賽限時挑戰。

這些訊息瞄準的是採購決策者,而不是基準分數追蹤者。而它出現的時間點,正是「前沿模型進企業」市場殺成紅海的时刻:Anthropic 的 Claude Fable 5.1 在 Astra 上市兩天後搶下 Artificial Analysis 智慧指數王座;微軟與亞馬遜爭著把這個模型搬進自家的企業雲;OpenAI 自己才剛向員工表示可能需要放慢最強模型的部署節奏。這篇「for work」文章,就是 OpenAI 對每個採購團隊此刻都在問的問題給出的答案:哪個前沿模型能用可辯護的成本,真正交付「完成的工作」?

比世界頂尖人類快四倍

全文最值得引用的主張來自電子競技——財務建模電競。GPT-6 Astra 透過電腦操作(computer use)能力,完成 Financial Modeling World Cup 挑戰的速度,約為奪冠人類選手的四倍。這個參照的是 2023 年微軟 Excel 世界錦標賽——頂尖分析師限時建立完整財務模型的那項「運動」。Astra 不是在回答關於試算表的問題;它是在親自驅動應用程式本身:閱讀畫面、規劃模型、逐步執行操作,全程端到端。

這個框架重要,因為它就是整個產品論點的縮影。OpenAI 認為,多數 AI 系統要求企業先整理資料、重新設計工作流程、建置客製整合,然後才談得上創造價值。Astra 的提案恰恰相反:它直接透過人們每天在用的那些應用程式工作——即使那些應用程式根本沒有 API。不需要資料管線專案,不需要整合衝刺。模型像新進員工一樣打開 Excel、瀏覽器和老舊 CRM,一邊做一邊學會這份工作。

OpenAI 表示,早期客戶已經在近似生產環境中驗證這個承諾:最佳化 GPU 配置、找出行財務報表中的數字不一致、產出符合品牌規範的簡報。公司也把模型用在自己身上——Astra 在正式發布前數週就內部上線,OpenAI 的工程團隊用它找出一個導致 Codex 測試環境連線變慢的記憶體配置瓶頸。依照 Astra 的建議切換記憶體分配器後,單輪延遲降低了 25 倍,尖峰記憶體用量僅增加約 30%——一項由模型而非效能分析工具發現的系統調校戰果。

預算負責人真正在乎的數字

對於走 API 的工作負載,新文章把效率論證錨定在 Terminal-Bench 4.0——一項測試代理在終端機環境中處理軟體工程、系統設定與資料分析等複雜任務的基準。GPT-6 Astra 拿下 57.9%,創下該基準新高,對比 Claude Fable 5.1 的 55.8% 與 OpenAI 自家 GPT-5.6 Sol 的 37.3%。但更關鍵的數字是成本:OpenAI 估計 Astra 完成任務的 API 成本比 Fable 5.1 低約 9%,比 GPT-5.6 Sol 低 63%。在一個世代之內,把自家前代模型的性價比甩開三分之二——這種算術才搬得動企業預算。

定價底線維持不變:每百萬輸入 token 10 美元、每百萬輸出 token 50 美元;Azure 版本的快取輸入為 1 美元,長上下文費率為 20/75 美元。但 OpenAI 的主張遠比牌價更廣——Astra 經過訓練,能用更少 token、更少重試次數完成任務,這代表更少重工、以及每件「完成工作」更低的真實成本。在涵蓋專業工作與編碼評測(包括 Terminal-Bench 4.0 與 Artificial Analysis 智慧指數)的成本效率前緣上,OpenAI 聲稱已占據多數席位。

安全性終於有了數字:非預期結果減少 89%

全文技術上最重要的部分,或許是安全性的量化。讓代理存取企業系統,在是能力問題之前,先是一個治理問題——而 OpenAI 現在給出了實踐中對齊程度的具體數字:在內部電腦操作安全基準上(測試最嚴苛的商業情境,例如洩露機密資訊、把儀表板分享給過廣的對象、刪除資料),GPT-6 Astra 產生非預期結果的頻率比 GPT-5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。加入額外確認步驟與自動審查後,數據還能進一步改善。

這項基準伴隨著全新的企業管理控制:組織可以限制 Astra 僅存取核准的網站與桌面應用程式、管理上傳與下載、管控瀏覽歷史。確認政策可以要求關鍵操作前須經人工核准,自動審查機制則檢查潛在不安全或未授權的工具呼叫。設計哲學說得很明白——從受限配置起步、逐步擴大存取範圍,而不是第一天就把一切交給前沿模型。

Astra 同時是第一個達到 OpenAI Preparedness Framework「Critical」網路安全能力門檻的模型——它在尋找與利用零日漏洞上的能力,強到被公司視為雙重用途風險。OpenAI 表示已強化對抗濫用與未授權模型行為的防護,包括訓練模型遵守安全與保安邊界、提升對繞過防護嘗試的抗性,以及部署攔截有害回應的自動檢查。符合資格的 API 客戶可在支援的端點上使用零資料保留(Zero Data Retention),需經核准。

佈局分發:桌面外掛與兩大雲端

兩個分發動作補完了這場商業提案。第一,OpenAI 在 ChatGPT Desktop 推出全新企業外掛,由最新瀏覽器操作能力驅動——來自 Oracle Analytics、Power BI(微軟 Fabric 服務)、Navan 與 Avalara。這份外掛清單本身就是訊號:分析、費用管理與稅務合規,正是「能登入並操作 UI 的代理」勝過「苦等 API 的代理」的後台辦公場域。

第二,雲端巨頭正把 Astra 當成搶地盤產品。微軟在發布當天就讓 GPT-6 Astra 在 Foundry 全面可用,提供標準與預備吞吐量部署選項,涵蓋全球與美國資料區域——Azure 的文章強調範圍限定的憑證、關鍵操作的人工檢查點、以及對齊組織風險要求的活動紀錄,且提示與輸出一律不用於訓練。亞馬遜不甘示弱,同一週就把模型帶上 Bedrock。當你的前沿模型同時是 OpenAI 第一方產品、Azure Foundry SKU、又是 Bedrock 端點,還在觀望的企業買家就再也沒有「怕被鎖死」的理由拖延採用了。

冷靜的解讀

三個但書必須並列。第一,OpenAI 的比較數據來自 OpenAI 自己的評測——四倍 Excel 速度、89% 安全改善、每任務成本估計,全數是自行發布,而對手也會發布對手的數字。第二,獨立排行榜說的故事比部落格文章混亂:Artificial Analysis v4.2 指數仍將 Claude Fable 5.1 排在第一,Astra 的兩個配置分居二、三,兩家實驗室是在逐項基準輪流戴冠,而非單一模型碾壓全場。第三,讓 OpenAI 暫停 Pro 訂閱的需求並未完全退燒——每任務便宜 63% 的模型,只有在你拿得到算力時才真的便宜。

但方向無可置疑。發布週的那個問題——「這是 AGI 嗎?」——在企業採購簡報裡已經被另一個問題取代:「一件完成的工作,成本是多少?」OpenAI 的答案,在本文撰寫前三小時發布:世界上最強的模型,同時也是以最低單位工作成本結案、建模、起草簡報的那一個——而且產生非預期結果的次數少了 89%,正是讓資安長失眠的那種問題。這不是 AGI 宣言。這是一筆line item(預算科目)。而在工作軟體市場,贏家向來是預算科目。