← All posts / Research

比人類更少的步數:ARC Prize 對 GPT-6 Astra 的獨立分析,以及被它提前的 AGI 時間表

ARC Prize 以中立框架重測 GPT-6 Astra,在 ARC-AGI-3 拿下 62.7%,卻在 96% 的關卡中用少於人類中位數的動作數過關,自創代數符號、翻轉思考與成本曲線,讓 François Chollet 把 AGI 預測時程提前。

比人類更少的步數:ARC Prize 對 GPT-6 Astra 的獨立分析,以及被它提前的 AGI 時間表

當 OpenAI 在 9 月 3 日發布 GPT-6 Astra 時,頭條數字是 ARC-AGI-3 上的 99.9%——在 François Chollet 的 ARC Prize 用來衡量 AI 與通用智慧之間「剩餘差距」的互動推理基準上,近乎滿分。但那個數字來自 OpenAI 自建的評測框架。9 月 3 日,ARC Prize 發布了自己的獨立分析,其中真正重要的兩個數字,反而不是那個頭條分數。

第一個:在 ARC Prize 的供應商中立 Standard 框架下,Astra 拿到 62.7%,花費約 26,000 美元——仍是全場最佳,但離 99.9% 有一大段距離。第二個、也是真正寫進歷史的那個:在使用 OpenAI 框架的測試中,Astra 在 96.0% 的關卡裡用的動作數少於人類中位數玩家,平均每關少了 51.7%。用這個基準對「動作效率」的定義——一個解題者需要多少環境經驗才能掌握它——前沿模型首次追平並超越了人類水準。

兩種框架,兩個差距極大的分數

62.7% 與 99.9% 之間的落差,其實是兩種評測哲學的故事。ARC Prize 的 Standard 框架給每個模型同樣極簡的介面:解開每一關所需的所有資訊都在,但回合之間要保留什麼到可見筆記裡,完全由模型自己決定。這是排行榜賴以成立的公平比較基礎。

相對地,Provider Adapter 框架讓 Astra 使用 OpenAI 自家的上下文管理機制——在請求之間保留不透明的推理狀態、對長對話進行壓縮。在這些條件下,Astra(high)以約 19,000 美元拿到 99.9%,而且就兩種框架都解出的 167 個遊戲—推理組合而言,總耗時快了約 3.66 倍、總 token 數少了 49%。

ARC Prize 對其中的張力毫不掩飾:今天只有 Standard 框架的分數能支撐跨供應商的公平比較,不過組織也宣布未來會在排行榜上另外公布廠商框架的數字,並明確標示為不同的評測條件。順帶一提這個領域移動得多快:GPT-5.6 Sol 在同一套 setup 下只有 7.78%,Anthropic 的 Claude Opus 5 是 30.16%。

沒有人預測到的那個結果

在 ARC-AGI-3 上線之前,ARC Prize 測試了約 500 位一般民眾來建立人類基準:每一關的基準,是解開該關的玩家動作數中位數。主辦方的工作假設是,「動作效率」會是人類與 AI 之間一條持久的分界線——就算模型解開了關卡,也需要比人類多得多的盲目探索。

這個假設現在死了,至少對前沿模型而言。ARC Prize 觀察到的模式近乎二元:一旦 Astra「理解」了遊戲機制,它的執行就落進人類效率區間之內,而且通常低於這個區間。蠻力方法依然浪費動作,但 Astra 不用蠻力。它先建立世界的模型,然後照著模型行動。

越思考,越便宜

資料裡最反直覺的發現之一,是成本曲線的倒掛。一般來說,把推理強度調高會讓基準測試更貴——想得越多、token 越多。但在 Standard 框架下的 Astra 恰好相反:成本從完全不推理的 49,791 美元降到最大推理的 26,098 美元,分數同時從 35.2% 升到 62.7%。

原因一想就通:推理強度越高,Astra 用越少的步數解開遊戲,步數少意味著模型呼叫少、token 也少。算力從探索轉移到了深思,而深思結果是比較便宜的那種資源。(有個異常值:「low」設定只有 17.5%,比完全不推理還差——可能是因為 Astra 的新架構能在輸出第一個 token 前於內部循環處理,「一點點」外顯推理反而兩頭落空。)

會自己寫代數的模型

重播紀錄才是 Astra 行為最驚人的地方。在 Standard 框架下,沒存進可見筆記的東西回合之間就會消失——於是 Astra 發展出一套即席的、領域專屬的速記法,Chollet 稱之為「本質上是一套遊戲專用的代數符號」。日誌裡的例子:L8: hub q2 (8↓). Lengths: 14=1… 記錄關卡、旋轉索引與機構長度;extend8 to3; retract10 to2; shorten8 to1 是一份有序的多步計畫;Turn 5: P=(24,20), empty, facing west 則攜帶完整狀態與朝向。

Chollet 在 X 上的解讀,是整份報告裡最值得引用的一句話:Astra 展現了「我們過去只在精密框架上看過的符號建模行為,所以框架能力正在移入模型本身」。鷹架正在遷移進權重裡。

在加上程式沙盒的第三方 PRO-LONG 框架中,Astra 走得更遠——為每個遊戲寫出小型軟體庫。在一個有守衛與巡邏的迷宮遊戲裡,它依序產出 maze_solver.py、combat_solver.py、patrol_solver.py,外加一個持續把預測與觀察對照的 sync_state.py。(ARC Prize 提醒,這些測試衡量的是「模型加工具」的綜合表現,因為人類受試者沒有直譯器可用。團隊也沒有觀察到任何逃出沙盒的嘗試。)

Chollet 提前了他的預測

ARC Prize 反覆強調,刷爆 ARC-AGI-3 不等於證明 AGI:環境是確定性的、目標封閉,時間尺度比真實任務短了好幾個數量級。「到目前為止我們對這個系統所知的一切,就是它的基準分數,」Chollet 寫道。

但時間表變了。ARC-AGI-3 約半年前上線時,Chollet 對「多久飽和」的估計是「大概一年」。Astra 大約只用了一半的時間就到了。被問到 2030 年的 AGI 預測是否還成立時,他的回答是:「會更早,因為進展比我預期的快。」自 ARC-AGI-3 發布以來就在開發的 ARC-AGI-4 訂於 2027 年第一季推出,將探討遞迴自我改進與開放式創新。

脈絡:基準版圖其實很亂

這份獨立分析發布之際,其他評測的結論互相矛盾。Epoch AI 的綜合指數(50+ 項基準)把 Astra 明顯排在第一,169 分;Artificial Analysis 給它 61 分——與前代 Sol 持平,落後 66 分的 Claude Fable 5.1。Astra 每 token 價格是 Sol 的 2.5 倍,但每個任務只需 Sol 約三分之一的運算步數。它的 AA-Omniscience 幻覺率從 92% 降到 51%,在 GDPval-AA v2 上掉了約 80 Elo,而在 FrontierMath Erdős 上,它是唯一以每次 300 美元的預算、用 Lean 驗證證明解出 68 題開放 Erdős 問題中兩題的模型。

不過從 ARC Prize 的資料看,主線難以反駁:讓框架變得有價值的那些東西——持久狀態、緊湊符號、審慎規劃——正在變成模型自身的性質。比起任何單一分數,這才是讓一位 AGI 預測者改口的原因。