← All posts / Industry

發布後還能改分數:GPT-6 Astra 發表頁面上悄悄變動的六個基準數字

Fortune 透過網頁存檔快照比對發現,OpenAI 在 GPT-6 Astra 發布文章上線後仍持續修改至少六個評測數字——幻覺率一度砍半、對手 Anthropic 的數學分數被下修近 10 分,而文章本身在人人可讀之前曾兩度上下架。

發布後還能改分數:GPT-6 Astra 發表頁面上悄悄變動的六個基準數字

2026 年 9 月 3 日,OpenAI 發布了 GPT-6 Astra 的官方部落格文章——這是動用十萬張 GPU 訓練的旗艦模型,CEO Sam Altman 更宣稱它開啟了「AGI 時代」。但根據 Fortune 於 9 月 4 日刊出、9 月 5 日更新的調查報導,大眾最終讀到的版本,並不是 OpenAI 最初發布的版本。記者 Emily Forlini 利用 Internet Archive 的網頁快照逐格比對,發現 OpenAI 在文章上線之後又修改了至少六個評測指標——而且在每一個具爭議的案例中,修改方向都讓 Astra 看起來更強、讓最接近的競爭對手看起來更弱。

這是迄今為止關於「benchmaxxing」(透過不斷變換條件重跑評測、把分數磨到最好看)最詳盡的公開個案研究。它出現的時機尤其敏感:基準分數已經成為前線實驗室之間競爭的主要貨幣。

一篇不肯好好上架的發布文章

發布流程本身就很不尋常。OpenAI 原定美東時間下午 2 點刊出 Astra 發布文。文章確實在 2 點過後短暫上線——隨即被撤下。下午 3 點 32 分,OpenAI 的 X 帳號貼出連結,點開卻是錯誤頁面。3 點 50 分,Sam Altman 親自轉貼,寫道:「我們部署部落格文章時遇到一點小狀況,但它真的很棒。」許多讀者依然打不開。大約一小時後,頁面才終於穩定地對外可見。

OpenAI 對 Fortune 表示,撤文原因無法透露,但強調與基準分數無關。(官方先說是內容管理系統的 bug,後來又說是網路斷線。)但存檔紀錄清楚顯示,下午 2 點的版本與數小時後穩定下來的版本之間,改變的正是那些評測數字。

到底改了什麼

Fortune 逐張快照比對出的變動包括:

幻覺率。 在下午 2 點 23 分的第一份存檔快照中,Astra 的幻覺率是 4.2%,之後連續五張快照都維持不變。到了下午 5 點 20 分的第六張快照——也就是頁面廣泛可讀之後——數字被砍半成 2%。同時,OpenAI 自家上一代模型 GPT-5.6 Sol 的幻覺率反而「惡化」,從 12.2% 降到 9.4%(幻覺率越低越好,所以 Astra 的進步與 Sol 的退步都在替新模型抬轎)。截至 Fortune 發稿時,兩個數字又都改回了原始值:4.2% 與 12.2%。

FrontierMath Tier 4(v2)。 Astra 自己的數學分數 97.6% 從頭到尾沒變。變的是比較對象。Anthropic 的 Claude Fable 5.1 從 2 點 23 分快照中的 87.8%,到下午 5 點 17 分掉到 78%——將近 10 個百分點——之後又回到 83%。GPT-5.6 Sol 則從 83% 掉到 80.5%,再回到 83%。在那幾個小時裡,官方頁面呈現的 Astra 數學領先幅度,遠比今天看到的大得多。

ExploitBench。 在 OpenAI 內部的資安評測上,GPT-5.6 Sol 的分數從 5.5% 跳到 11.5%。OpenAI 告訴 Fortune 正在調查是否要把數字改回 5.5%,理由是 11.5% 的結果對應到 Sol 並未對外商用的一種推理等級。

程式能力。 Astra 的 coding 分數從 57.7% 微調到 57.9%——差距微乎其微,但 OpenAI 顯然在意到願意換上更好看的數字。

ARC-AGI-3。 連 Fortune 拿到的發布前 embargo 草稿,Astra 的 ARC-AGI-3 分數都是 98.6%;正式頁面如今寫的是 99.99%。Arc Prize Foundation 自家的獨立評測給了 99.9%——但前提是配上「特別強大的 harness」(模型完成任務時可用的工具組合)。若使用該基準的標準 harness,分數是 63%。

並非每次修改都對 OpenAI 有利。在醫療評測 HealthBench Professional 上,兩個 Anthropic 模型的分數反而提高了:Fable 5.1 從 56.6% 升到 58.1%,Opus 5 從 54.5% 升到 56.4%。

OpenAI 的說法

公司發言人對 Fortune 表示:「我們非常在乎把評測做對。大多數評測會因為使用的 checkpoint、scaffold 與評測執行方式不同,而出現幾個百分點內的雜訊。針對發布文章,我們做了修正,確保數字代表模型效能的最佳估計,讓使用者能做有意義的比較。」至於草稿到正式版的差異,發言人說評測在發布前都會驗證,「調整是正常的」。

這些說法有其技術上的真實性。OpenAI 內部由不同研究團隊各自負責不同指標,再回報給中央團隊統一發布;分數確實會隨 checkpoint、推理等級、harness 與評分設定而浮動;競爭對手的分數通常取自公開排行榜,而非 OpenAI 自行重測。發布頁上也載明免責聲明:「評測分數為任何努力程度下的最大值。」

但這正是事件暴露的核心問題:如果在不同條件下、多個數字都能被辯護為「準確」,那麼「選擇發布哪一個準確的數字」——以及何時修改、往哪個方向修改——就不再是一個中立的技術決定。

Benchmaxxing 之問

史丹佛智能系統實驗室與可信賴 AI 實驗室的研究者 Anka Reuel 與 Mike Hardy 告訴 Fortune,這種模式符合業界已知的操作:用不同條件反覆重跑評測、把分數極大化。「這可以在非常短的時間內完成,而且對他們的行銷有利。」他們並指出,理應詳述評測方法的 GPT-6 Astra 系統卡,對內部幻覺基準「幾乎沒有提供任何細節」,甚至連測試題數都沒有。

Snorkel AI 負責基準與評測研究的工程師 Vincent Sunn Chen 對 OpenAI 相對友善,他指出分數在發布前最後時刻浮動很常見,因為 checkpoint、設定、harness 與評分配置「在發布前幾天通常還在變動」。但他主張產業需要建立規範:當公司修改已發布的基準分數時,應該說明改了什麼,讓研究者能夠正確解讀結果。

更糟的前例其實存在。2025 年,Meta 否認曾以未公開的內部版本(而非實際釋出的版本)跑 Llama 4 的基準分數——直到前首席 AI 科學家 Yann LeCun 承認公司確實「動過手腳」。

為什麼重要

在這個市場裡,基準分數不是裝飾品。它們決定企業採購、影響人才招募敘事,也是 OpenAI 可能於 2027 年 IPO 之前估值故事的重要支柱。當一間實驗室可以把幻覺率砍半、把對手的數學分數下修 10 分、再悄悄改回來——而且全部發生在一個上線中的發布頁面上——排行榜就成了多幾個步驟的行銷素材。

這不代表 GPT-6 Astra 不是真正強悍的模型。Artificial Analysis 的 coding agent 指數、CodeRabbit 的 code review 研究等獨立評測都顯示它是。真正的意義在於:AI 產業的「測量層」比行銷話術所暗示的更可編輯——而唯一持續記分的存檔單位,是 Internet Archive。

最便宜的解方,就是 Sunn Chen 提議的那個:給基準分數一份 changelog。在各大實驗室採用之前,每一個發布日的分數,都應該以「發布後仍被悄悄修改的數字」的態度來解讀——把它視為一個還在談判中的主張。