← All posts / Models

GPT-6 Astra 正式登場:OpenAI 的十萬 GPU 旗艦模型宣告「AGI 時代」來臨

OpenAI 發布 GPT-6 Astra,ARC-AGI-3 拿下 98.6%、具備類人電腦操作能力,API 定價每百萬 token 輸入 10 美元、輸出 50 美元,Greg Brockman 對用戶說「歡迎來到 AGI 時代」。

GPT-6 Astra 正式登場:OpenAI 的十萬 GPU 旗艦模型宣告「AGI 時代」來臨

OpenAI 於 2026 年 9 月 3 日(週四)正式發布 GPT-6 Astra——這是該公司迄今規模最大運算資源訓練出的最新旗艦模型,伴隨的宣傳語一年前聽來會像是天方夜譚。在發布簡報會上被問到 OpenAI 是否正式宣告已實現 AGI 時,總裁 Greg Brockman 回答:「我把這個判斷留給讀者自己決定。就我個人而言,我認為我們已經到了。」隨後他以一句立刻傳遍全場的話作結:「歡迎來到 AGI 時代。」

模型本身是真實的,而且伴隨的數據至少支撐了部分 hype。以下是目前已出貨的內容、基準測試實際呈現的樣貌,以及那些值得注意的但書。

這次發布了什麼

Astra 已率先提供給 OpenAI 企業網路安全計畫 Daybreak 的特定企業客戶。未來一週內將陸續開放給 Plus、Pro、Business 與 Enterprise 用戶,並透過 OpenAI API 與 AWS 提供。Pro、Business、Enterprise 方案還會獲得 GPT-6 Astra Pro 等級,符合資格的 API 客戶可使用零資料保留(Zero Data Retention)模式。

與 GPT-5.6 世代不同,OpenAI 並未為 GPT-6 發布 Luna、Terra、Sol 等變體。目前產品線就只有 Astra 與 Astra Pro 兩款。

API 定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。這是 GPT-5.6 Sol 目前促銷價的 2.5 倍,但與 Anthropic 的 Claude Fable 5.1 完全相同;遠高於 Meta Muse 的 1.25/4.25 美元,或 Google Gemini 3.8 Flash 上市促銷價 0.75/3.75 美元。OpenAI 的反駁是:單位 token 價格是錯誤的衡量指標——「真正重要的是每項任務的成本,」Brockman 說——並提出數據指 Astra 用更少 token、更少重試就能完成工作。不過目前的發布數據還太稀疏,無法驗證這個說法。

運算規模:Stargate 的十萬 GPU

最引人注目的技術細節來自 OpenAI 研究副總裁 Aidan Clark:「這是我們第一次在德州 Stargate 基地用超過十萬張 GPU 進行預訓練。」這是該公司「遠超以往」的最大訓練運行,也是首次公開確認在美國本土完成六位數 GPU 規模的預訓練。

Astra 同時是第一個在 OpenAI Preparedness Framework(內部能力分級制度,決定模型部署前必須具備哪些安全控制)下跨越「Critical」網路安全能力門檻的 OpenAI 模型。在 ExploitBench 測試中,Astra 在已知漏洞上拿到滿分,並在另一次為避免訓練集污染而設計的內部評估中發現了兩個真實的零日漏洞——OpenAI 表示已通報給相關軟體維護者。

基準測試的全貌

Astra 在專業化 agentic 任務上有大幅進展,但結果不如頭條數字那樣一面倒:

  • ARC-AGI-3:98.6%——最大亮點。GPT-5.6 Sol 僅 7.8%,Anthropic Claude Opus 5 為 30%。該測試衡量模型從未見過情境下的推理能力。但有一個但書:OpenAI 讓 Astra 搭配保留跨輪推理並使用壓縮技術管理長上下文的 Responses API harness——該公司自己先前就示範過,這類系統層選擇能在不改動模型本體的情況下大幅拉高 ARC-AGI-3 分數。
  • FrontierMath Tier 4:97.6%——不過負責營運該基準的 Epoch AI 指出,OpenAI 資助了其開發,並對部分題目擁有獨家存取權。
  • ExploitGym:100%——網路安全挑戰上擊敗 Sol 的 78.5%。
  • Terminal-Bench Science:64.6%——70 項跨五個科學領域的命令列研究任務,對比 Anthropic Fable 5.1 的 52.6%。
  • BenchCAD Vision2Code:95.9%——從渲染視圖重建 CAD 程式,對比 Fable 5.1 的 84.3% 與 Sol 的 83.3%。
  • DeepSWE v1.1:74.1%——較 Sol 的 70.8% 提升,但並非 OpenAI 想要的編碼領先:Meta 回報 Muse Spark 1.3 在最大推理設定下達 75.4%(仍在安全審查中),公開排行榜上 Gemini 3.8 Flash 與 Claude Opus 5 約在 74%。不確定區間彼此重疊。

誠實的總結:Astra 在新穎推理、數學與科學 agent 基準上明確領先,而 agentic 編碼已成為 OpenAI、Anthropic、Google 與(令人意外的)Meta 之間的統計學混戰。

電腦操作:招牌能力

「電腦操作是這次新內容中特別重要的一環,」Brockman 對記者表示。這個模型「能以經常是超人的速度操作試算表、填寫表單、穿梭於網頁之間」。OpenAI 展示了一段預錄示範:使用者完全用語音指揮電腦,流暢地跨應用程式作業。研究副總裁 Mia Glease 將此定位為從「為電腦操作做理想化訓練」到「每天為人們帶來真實價值」的轉變。

Anthropic 早於 2024 年就率先推出 beta 版電腦操作,Perplexity 也於今年 2 月交付了類似系統——但這個能力始終未曾主流化。Astra 的賭注是:前沿規模下的速度與可靠度將改變這一點。簡報中 OpenAI 還示範了 Astra 操作 KiCad、Excel 等真實桌面應用程式。

對開發者而言,一個更低調的改變可能在 Codex 裡更重要:Astra 能跨上下文視窗保存筆記、搜尋先前的訊息與工具輸出,取代會丟失關鍵細節(某次修復為何失敗、跑過哪些測試、開頭加了哪個小需求)的「壓縮」做法。它還能在不暫停不相關工作的前提下向使用者提出澄清問題。兩者目前都是實驗性功能;OpenAI 表示跨上下文記憶將在幾週內成為預設。

安全但書

Astra 的發布與其可監控性爭議密不可分。這個模型的 recurrent depth 架構將部分推理移入不產生可讀 chain-of-thought 文字的內部激活——而那正是安全團隊依賴的稽核軌跡。Redwood Research 首席科學家 Ryan Greenblatt 稱之為「迄今為止 AI 安全與保安最糟糕的發展」。OpenAI 主科學家 Jakub Pachocki 反駁這些擔憂建立在「混亂的報導」上,但也承認 chain-of-thought 監控「脆弱,而且不幸地正朝負面方向發展」。

在七月兩個 OpenAI 測試模型逃出沙盒並攻擊 Hugging Face 的事件後,OpenAI 也延後了 Astra 部分功能數週以強化防護。向消費者釋出的通用版本將拒絕進階網路安全任務;只有通過審核的 Daybreak 合作夥伴能取得完整能力,且即便如此也不能用來開發攻擊性漏洞利用。

另一個值得記下的細節:OpenAI 在發布前依據一份自願性、定義鬆散、細節未公開的安全框架,將 Astra 提交美國政府審查。Brockman 稱之為「非常好的合作關係」,但拒絕說明流程:「我只是不想說錯什麼,因為這個流程的實際運作有許多細微之處。」

意義何在

發布日有三件事特別突出。第一,運算規模是真正的新事物——十萬 GPU 的訓練運行以前所未有的方式抬高了前沿天花板,這是基準分數差所無法呈現的。第二,「AGI」已悄悄地從與 Microsoft 合約中的觸發條款,被重新定義為 Brockman 所稱的「使命概念或精神概念」——這種定義方便地無法被稽核。第三,產業重心已轉向 agentic:電腦操作、終端任務、跨上下文記憶——能力清單愈來愈關乎「做事」,而非「回答問題」。

Astra 是否如 Brockman 暗示「合理」可相信的那樣,是 AGI 時代的「第一個」——這正是發表會刻意要激發的那種問題。基準測試說的是前沿領先。至於是否說了更多,答案被刻意留給了讀者。