前微軟 AI 搜尋掌門的實測 verdict:Parakhin 盛讚 GPT-6 Max 是史上最強數學模型,GPT-6 Pro 低調現身 ChatGPT
Mikhail Parakhin 實測 GPT-6 與 Claude Fable 5.1 後斷言:GPT-6 Max 是史上最好的數學/ML 模型,但 Fable 5.1 仍稱霸長程 agent 任務——同一時間 GPT-6 Pro 悄悄出現在 ChatGPT 網頁版。
GPT-6 Astra 上市四天後,前線模型的討論焦點已經從發表會的 benchmark 圖表,轉移到一種更罕見、也可以說更有參考價值的東西:一位重量級實務者的誠實對決評測。Mikhail Parakhin——微軟前廣告與網路服務 CEO、曾經掌管 Bing 並打造其 AI 搜尋架構的工程師——在 9 月 6 日貼出了一篇 GPT-6 與 Anthropic Claude Fable 5.1 的詳細比較,至今已吸引超過 9.5 萬次瀏覽。而在同一天之內,還有一個更安靜的訊號:一個名為「GPT-6 Pro」的模型層級,開始出現在某些帳號的 ChatGPT 網頁介面裡,且 OpenAI 尚未發布任何正式公告頁面。
這兩條線索共同描繪出當前 AI 前線的真實樣貌——不在跑分排行榜上,而在一位每天要出貨 AI 產品的人的工作流裡。
Parakhin 究竟說了什麼
這則貼文很短,但判斷密度極高。Parakhin 寫道,在「大量使用」GPT-6 與 Fable 5.1 之後,他的結論是:「GPT-6 Max 是有史以來最好的數學/ML 模型,擊敗了 5.2 Pro」。這個說法本身就很不尋常——他不是說 GPT-6 略勝上一代,而是說新系列的 Max 版本超越了他用過的每一個模型,而且是在數學與機器學習這種硬派工作上。
第二個觀察是任何實務者都會秒懂的痛點:GPT-6「被極小的上下文空間嚴重拖累,就像在跟一個超級聰明的多莉(Finding Nemo 的健忘魚)對話」。這個比喻之所以精準,是因為它点出了問題的本質——一個模型即使每個 token 都很聰明,但若無法把一整段長工作階段留在記憶裡,行為就跟那條健忘的魚一樣:每個對話輪次都得重新建立競爭對手原生就能保留的上下文。
他的第三個判斷:Fable 5.1 仍然是「長程 agent 任務的最佳選擇,在遵循指令、找出優雅的程式解法上依然更好」。然後是那句隨後被 AI 圈大量引用的結論:「角色互換了:我現在用 GPT-6 開發解決方案,再用 5.1 潤飾並執行實驗。」
「角色互換」的深層解讀
最後那句話值得拆解,因為它顛覆了 GPT-4 與 Claude 3 時代維持多年的分工慣例。過去約兩年,圈內的民間智慧恰恰相反:用 Claude 系列的模型起草與設計,再交給 GPT 模型做執行面的收尾。Parakhin——他已離開微軟,在 OpenAI 與 Anthropic 之間沒有明顯利益立場,最有資格保持中立——如今跑的是反向管線:GPT-6 的原始推理生成解法,Fable 5.1 的指令遵循與程式品味負責精修與跑實驗。
他貼文下的回覆強化而非反駁了這個模式。一位開發者指出可以在 Codex 設定中調高 GPT-6 的上下文視窗,但代價是用量會線性消耗。另一位建議開啟實驗性的 context mode,用筆記與上下文搜尋取代壓縮。第三人描述必須「非常明確地規範允許範圍」才能讓 GPT-6 在較長的自動任務中持續運作,呼應了一個廣為流傳的觀察:GPT-6 與 Astra 在長任務上會比使用者期望的更早停手。
這些都不與 OpenAI 對 Astra 的發表數據矛盾——依發表報導,Astra 在 FrontierMath Tier 4 v2 拿下 97.6%,而 Claude Fable 5.1 與其前代層級都是 87.8%。Parakhin 的重點更細微:跑分天花板與日常實用性是兩個不同的軸線,而在第二條軸線上,模型最弱的面向(上下文)可能會壓過它最強的面向(原始數學能力)。
同場加映:「GPT-6 Pro」現蹤野外
故事的第二條線從同一個早晨開始。多起回報與截圖顯示,9 月 6 日至 7 日間 ChatGPT 網頁介面出現了「GPT-6 Pro」標籤——但沒有任何 OpenAI 部落格文章、changelog 條目或定價頁面伴隨出現。Parakhin 本人在貼文裡也提到了:「今天早上 6 Pro 出現在網頁介面了——等不及要測了!」
explainx.ai 在 9 月 7 日發布的事實查核把這則傳聞拉回到可驗證的範圍,而誠實的答案是:目前能確認的不多。沒有官方 OpenAI 來源證實這個層級。目擊來自使用者看到的 UI 元素,這是分階段推出、A/B 測試或功能旗標誤開的典型特徵——任何一種情況都可能讓它在幾天內消失。GPT-6 Astra 自己在 9 月 3 日的發表就以反方向呈現過這種混亂:媒體報導比 OpenAI 公告頁面上線還早,所以一個未經宣布的層級在發表後現身,其實符合這個混亂的模式。
真正有官方文件佐證的是周邊的配額結構,The Decoder 從 OpenAI 定價頁整理如下:200 美元 Pro 方案每週可用 200 則 GPT-6 Pro 訊息、100 美元 Pro 方案每週 50 則、Business Premium 每週 50 則、Business Standard 每月限 15 則。這個層級明確不包含在 ChatGPT Plus 之中。標準版 GPT-6 Astra 在所有方案下,每五小時視窗的可用訊息數大約只有 GPT-5.6 Sol 的一半——Plus 用戶用 Astra 每視窗估計有 5 至 45 則,Sol 則是 10 至 100 則。
「數學最強」的驗證難題
explainx 的事實查核還提出了一個值得記住的觀點,供下一次「某模型是 X 領域最強」的說法流傳時參考。數學領導權之爭目前異常激烈:過去幾週,Claude 產出了費馬最後定理 1,300 萬行的 Lean 4 機器驗證形式化;Anthropic 用 60 個平行 subagent 把 Riemann zeta 下界從 41.6% 推進到 67.2%;OpenAI 的 Astra 預覽宣稱十項數學新進展並附上 Lean 證明書;而「GPT-5.6 Sol 協助創下質數間隔世界紀錄」的病毒式說法在細查後已站不住腳。
在這個背景下,一位實務者的意見——即使有 Parakhin 的工程資歷背書——是關於模型在老手手中表現如何的數據點,而不是 benchmark 結果。該文自己的框架是對的:有名有姓的模型、明確的評測環境、可重現的分數才有分量;一張截圖加一句引言則否。
為什麼這件事重要
有兩件事同時成立。第一,GPT-6 與 Fable 5.1 的競賽已經接近到「誰贏取決於任務形狀」——短而困難的推理 versus 長程 agent 的持久力——而一位頂尖實務者現在公開把兩個模型串在一起用,而不是二選一。這種可組合性可能才是真正的頭條:前線模型正在變成一條管線,而不是一位冠軍。
第二,GPT-6 Pro 的目擊——無論它最終是否走向正式發表——顯示模型發布已經變成滾動式事件,而非一次性的公告。層級名稱透過 UI 旗標洩漏、配額在說明中心頁面先於發表文出現,而社群的驗證工具組(模型選單檢查、API 模型清單、定價文件)必須即時運轉。對任何想在這些模型上蓋產品的人,可用性指南的建議是中肯的:在官方 model ID、公開定價與速率限制出現之前,不要對未宣布的層級寫 production 程式碼。
下一個值得觀察的數據點,是 OpenAI 是否會以 benchmark 與定價正式確認 GPT-6 Pro——以及 Parakhin 在親手測過他說「等不及要測」的那個層級之後,會不會修正「GPT-6 Max 就是天花板」的判決。
Sources
- [1] https://x.com/MParakhin/status/2096606202360926224
- [2] https://explainx.ai/blog/gpt-6-pro-max-chatgpt-sighting-parakhin-math-2026
- [3] https://the-decoder.com/openai-rolls-out-gpt-6-astra-to-top-tier-chatgpt-plans-at-half-the-rate-of-gpt-5-6-sol/
- [4] https://www.atlascloud.ai/blog/tips/gpt-6-availability