← All posts / Research

14 個月後,高牆倒塌:GPT-6 Astra 解開 FrontierMath Tier 4 最後一題,Epoch 正式宣告基準飽和

Epoch AI 正式宣告 FrontierMath Tier 4 完全飽和——GPT-6 Astra 解開了組合數學家 Jay Pantone 所出的最後一道難題。這個原本設計要抵擋 AI「數年」的研究級數學基準,在 14 個月內從 5% 衝到 98%,而評測的前線已轉向以 Lean 形式化的 Erdős 開放問題。

14 個月後,高牆倒塌:GPT-6 Astra 解開 FrontierMath Tier 4 最後一題,Epoch 正式宣告基準飽和

基準測試理應緩慢地死去。FrontierMath Tier 4——由七十多位數學家共同命題、專門設計來抵擋 AI 系統「數年」之久的研究級數學基準——卻只撐了十四個月。2026 年 9 月 10 日,Epoch AI 宣布 Tier 4 的每一道題目都已被 AI 模型解開,由 OpenAI 的 GPT-6 Astra 攻下最後一道倖存者。這道最終難題出自組合數學家 Jay Pantone 之手,而排行榜上的最高分如今定格在 98%。

這項宣告為當代基準測試史上最快速的飽和曲線之一畫下句點。Tier 4 於 2025 年 7 月 11 日上線時,當時最強的模型只能解出約 5%。十四個月後,天花板實質上已不復存在,Epoch 正式將該套件標記為「飽和」(saturated)——這是它對「基準已無法有效區分前沿系統」所加上的標籤。

FrontierMath Tier 4 究竟是什麼

FrontierMath 不是一堆文字應用題。Epoch AI 蒐集了數百道未發表過、極其困難的數學問題,命題方式刻意確保題目不會外洩進訓練資料,並按難度分層。Tier 4 是頂點:觸及真正數學研究領域的問題,且答案為可用程式驗證的數值。這種可驗證性正是 FrontierMath 作為基準如此好用的原因——不需要人工批改、沒有部分給分、也沒有跟閱卷者爭執的空間。

這些題目的難度抗拒蠻力。Tier 4 的設計目標,是要求那種專業數學家處理真正研究問題時所動用的、長達數小時的多步推理。在 2025 年初、推理模型時代尚未全面到來之前,整套題看起來還能撐很久。2024 年 12 月 o3 在完整 FrontierMath 上拿下 25% 曾被視為震撼彈;而 Tier 4 本身當時接近零分。

崩塌的三部曲

這場潰敗分階段發生,而每一階段都重置了人們的預期。第一道裂縫出現在 2025 年底,配備大規模測試時運算的推理模型——GPT-5 Pro、Gemini 2.5 Deep Think、Grok 4 Heavy——開始啃食 Tier 4。GPT-5 Pro 以 13% 創下紀錄,僅以一道題的差距險勝 Gemini 的 Deep Think,Epoch 特別指出這在統計上與雜訊無異。「大亂鬥」時代就此展開。

第二幕是捷徑爭議。Epoch 記錄到,若干早期的 Tier 4 解題——包括 Pantone 的一對題目——是透過命題者未曾預期的數值捷徑達成的。模型實際上是從題目結構反推出答案,而非真正做數學。Epoch 的回應是審計整個資料集:2026 年 6 月釋出的 FrontierMath v2 修正了 Tiers 1–3 的 123 道題與 Tier 4 的 12 道題,並直接移除了有瑕疵的題目。Tier 4 變得更嚴謹,分數也隨之回落。

第三幕就是飽和。GPT-6 Astra 於 2026 年 9 月 3 日發表,在 Tier 4 v2 拿下 97.6%——距離全壘打只差一題。本週,那最後一題也倒了。Epoch 的宣告中有一個對數學家而言重要的細節:與許多早期解題不同,沒有人回報 Astra 在 Pantone 的最後一題上利用了非預期的捷徑。這道牆不是碎裂的;最後一塊石頭是被完整取下的。

讓這件事保持誠實的但書

飽和的頭條需要星號,而這一則有好幾個。

資助關係。 Epoch 自己揭露,OpenAI 資助了 FrontierMath 開發的一部分,並對部分資料集擁有獨家存取權——這層關係自 2024 年 11 月基準上線以來便爭議不斷,Epoch 也持續努力提高透明度。分數是 Epoch 的,但觀感無可迴避:資助這個基準的實驗室,正是讓它飽和的實驗室。

追趕者就在身後。 目前的排行榜上,GPT-5.6 Sol 為 83.0%,GPT-5.6 Terra 為 68.3%。Astra 完成了臨門一腳,但趨勢線——而非任何單一模型——才是故事本身。無論誰揮出最後一錘,Tier 4 都會在幾個月內倒下。

飽和不等於全知。 在 Humanity’s Last Exam 上,Astra 的 57.2% 其實落後前代 GPT-5.6 的 65.0%。在 Epoch 的新基準 FrontierMath Erdős——68 道以 Lean 形式化的 Erdős 問題,模型必須產出完整、可機器驗證的證明而非最終答案——Astra 官方成績僅解出 68 分之 2。重複的高強度嘗試將其推到 5 題,據報導耗費超過 22 萬美元的運算成本。單一答案的研究級數學實質上已經關閉;針對開放問題的證明構造仍然大門敞開。

評測前線的下一站

Epoch 早就預見了這一天。它的 Open Problems 計畫蒐集具有可計算驗證答案的重大未解研究問題,而 FrontierMath Erdős 是旗艦級接班者:這些問題困難到沒有人——無論人類或機器——知道答案,且經過形式化,任何宣稱的解法都可以被機器查驗。Astra 在那份排行榜上也居冠,但偏低的絕對分數,才是研究數學相對於今日 AI 系統所在位置更誠實的指標。

這個模式超越了 Epoch。整個評測領域在 2026 年都在轉向停留在個位數百分比區間的基準:長時程代理任務、多小時的編碼工作、Lean 形式化證明構造,以及不存在標準答案的真正開放問題。Tier 4 十四個月的弧線帶來的教訓是:任何封閉式、單一答案的測試——無論設計得多聰明——如今都是折舊資產。抗拒驗證的評測設計,而非題目難度,才是新的設計約束。

為什麼重要

對模型開發者而言,實際後果立竿見影:FrontierMath 分數再也無法區分前沿系統,在發表資料中引用它們,正逐漸淪為行銷表演。對其他人而言,這個里程碑為「數學推理究竟進展多快」的辯論提供了一個乾淨的數據點。十四個月,就是數十位專業數學家專門設計來抵擋這一切的基準,從「最強系統勉強留下紀錄」走到「正式完成」所需要的時間。

它也是喧囂一週背後的安靜背景。OpenAI 宣稱 Astra 解決了千禧年大獎難題 Navier–Stokes 存在性與平滑性問題的聲明仍具爭議,優先權之爭與不當行為指控仍在延燒。Tier 4 的飽和提醒世人:支撐那些宣稱的能力是真實且經獨立驗證的——即便圍繞著發表數學結果的規範,仍是兵家必爭之地。

高牆在十四個月內倒塌。下一道牆由 Lean 檔案與開放問題築成,而以目前所有測量來看,它仍在屹立——至少現在是。