← All posts / Research

Erdős 問題淘金熱:一位已故數學家的問題清單,如何變成 AI 最嚴苛的基準測試

自 2025 年 10 月以來,Erdős 的上百道開放問題接連被攻克——解題者包括拿聊天機器人的業餘愛好者、Google DeepMind 的代理,以及 OpenAI 尚未發表的 Astra 模型。Quanta 的深度報導解釋了這份古怪清單為何成為 AI 學會「做真正的數學」的試煉場。

Erdős 問題淘金熱:一位已故數學家的問題清單,如何變成 AI 最嚴苛的基準測試

2023 年,英國數學家 Thomas Bloom 想找個方便的地方,整理數論與組合數學領域的開放問題,於是替自己架了一個網站。他借助 ChatGPT 寫出程式碼——在當時這可是新鮮事——並以兩百多道題目上線了 erdosproblems.com,心想「大概不會有人來用吧」。

三年後,Bloom 的資料庫變成了他從未想像過的東西:全球最強大 AI 系統互相較勁、證明自己做得到「真正的數學」的非官方基準測試。光是 2024 年到 2025 年 8 月之間,清單上就有 111 道問題從「開放」翻轉為「已解決」,此後步調只有更快。Google DeepMind 用 Gemini 系統性評估了資料庫裡的 700 個開放猜想;OpenAI 尚未發表的 Astra 模型在單一公告中一次解決了數學與理論電腦科學領域十道懸置已久的難題。更令人意外的是,相當比例的成果並非來自企業實驗室,而是來自拿著公開聊天機器人的業餘愛好者與大學部學生。

這一切如何發生——Quanta Magazine 在 8 月 3 日由 Konstantin Kakaes 撰寫的深度報導中有完整敘述——是我們目前所能看到、關於 AI 究竟如何改變數學研究(好的與壞的面向)最清晰的一扇窗。

清單背後的男人

Paul Erdős 是史上最多產的數學家之一。這位居無定所的匈牙利人一輩子住在行李箱裡,與數百位合作者發表超過 1,500 篇論文,並不斷拋出新問題——在論文裡、書信中、閒談間——而且經常附上現金懸賞,給第一個解出來的人。他於 1996 年去世,但美國愛荷華的一個非營利基金會延續了他的懸賞承諾。

Erdős 的問題有種特殊的風格:題目通常一句話就能說完,解起來卻極深,而且集中在數論、組合數學與圖論——恰好是大型語言模型在數學推理上表現最強的領域。這些問題的難度與重要性也差異極大,使得這份清單對一項能力同樣參差不齊的新技術來說,成了天然的晉階梯。

正是這種落差,讓 Bloom 的網站變成了基準測試。「這種任何人都能存取的單一資料庫——各實驗室意識到它實質上就是一個 benchmark,」史丹佛大學的 Jared Duker Lichtman 對 Quanta 表示。2026 年 1 月,一個 24 人的 Google DeepMind 團隊發表論文,用 Gemini 跑完資料庫中 700 個標記為「開放」的猜想後,解出四道問題、並找回九個早已被遺忘的舊解。到了 5 月,另一個 21 人的 DeepMind 團隊則報告,其最強代理「以每題幾百美元的成本,自主解決了 353 道開放 Erdős 問題中的 9 道」——用雲端運算的計價方式來替「找證明」定價,這個框架本身就很駭人。

業餘者搶先一步

這個故事最奇特的部分,是在各大實驗室大舉進場之前,先解出題目的究竟是誰。Bloom 對 Quanta 說,令他驚訝的是:儘管 OpenAI、Google DeepMind 和多家新創公司高度關注,早期成果大多來自用公開模型作戰的業餘愛好者與大學部學生。

看看 Wouter van Doorn,他的正職是客服工作,十年前差一點完成數學碩士學位。因為眼見 LLM 進步飛快,他在 2024 年請了六個月的假,想趁還來得及的時候完成自己的研究:「現在的我數學還比 AI 好,但誰知道一年後、兩年後、五年後會怎樣?」他成為 erdosproblems.com 上第四多產的留言者,並在 2025 年 11 月於留言區為一個關於無平方因子整數的證明辯護,對手是另一位用戶——後來發現是 Terence Tao。Van Doorn 如今與 Tao 合著發表論文。「我最近許多論文,大部分功勞應該歸給 AI,」他告訴 Quanta,「那些想法不是我本人想出來的。」

再看看 Kevin Barreto 與 Liam Price,兩人都才二十出頭,2025 年夏天在一個 AI Discord 伺服器上認識,12 月開始把一批批 Erdős 問題丟給 GPT-5.2。他們很快發現,如果告訴 GPT-5.2 某題的答案尚無人知曉,它就不太會認真進攻,所以他們學會了用 Barreto 所說「非常特殊的方式」下提示——「說服它這題比實際上簡單」(gaslighting)。聖誕節早晨,Barreto 貼出了他們認為是 LLM 首次完全自主解決的 Erdős 問題——結果幾小時後就有用戶指出,Erdős 本人在 1977 年的論文裡早已解出問題 333,只是沒人查過文獻。「身為已經踩過兩次這種雷的人,真的很痛,」Barreto 寫道。

他們沒有氣餒,2026 年 1 月 4 日用 GPT-5.2 Pro 攻克了 Erdős 問題 728,接著用新創公司 Harmonic 的 Aristotle 系統正式驗證證明邏輯成立,再由合作者用 ChatGPT 寫出形式化版本。Price 自認缺乏親自驗證解法的數學訓練——他的方法是反覆把前一個聊天機器人的解答餵給一個全新的實例檢查,直到收斂為止。在 Barreto 的協助下,他們找來真正的數學家查核結果,兩人如今與 Tao 和 Lichtman 合著了 2026 年 5 月解決 Erdős 問題 1196(關於整數的原始集)的論文。

前沿實驗室接管戰局

真正的轉折點在 2026 年 5 月 20 日。OpenAI 宣布一個內部模型找到了「單位距離問題」的反例——這是 Erdős 1946 年提出的著名猜想,探討平面上 n 個點之間最多能有多少對等距點。八十年來數學家普遍相信這個猜想是對的。該模型找到了一個構造,引進了代數數論(一個此前無人成功套用到此題的遙遠數學分支)的工具。

學界的反應不是禮貌性的掌聲。「這真的是一份令人印象深刻的成果……絕對是個令人敬畏的構造,」多倫多大學的 Jacob Tsimerman 寫道。菲爾茲獎得主 Tim Gowers 說得更白:「如果這篇論文是人寫的、投到《數學年刊》,而我被請求給個快速意見,我會毫不猶豫建議接受。過去沒有任何 AI 生成的證明接近這個水準。」幾週後,包括 Bloom 在內的數學家利用相關技術,推翻了 Erdős「和-積猜想」的一個版本。

8 月 1 日,OpenAI 再接再厲,發表「數學與理論電腦科學的十項進展」——全部出自其下一個主力模型 Astra 的內部版本,其中包括再多三道 Erdős 問題的解。該公司隨證明釋出了 Lean 形式驗證憑證與每題的思維鏈逐步解說,而論文的作者欄上只寫著「OpenAI」。The Verge 六天後的標題下得很直白:「AI 對數學的接管已經開始。」

這一切意味著什麼

對當事人的影響已經浮現,而且和許多人預測的不一樣。普林斯頓的 Noga Alon 職業生涯中解過幾十道 Erdős 問題,如今他選擇停手:「一旦 AI 開始解這些題目,再做就沒有意義了。」Tao 也已淡出 Erdős 問題社群,專注於其他工作。2026 年 7 月,Tsimerman 拿到數學界最高榮譽菲爾茲獎的當天,宣布離開學界、加入 OpenAI——他是眾多轉戰 AI 實驗室的一流數學家之一,用 Alon 的話說,「也許精彩之處現在在那裡」。

但局勢並非一片大好。Bloom 向 Quanta 警告了那些 100 到 200 頁的 AI 生成論文洪流——沒有任何 人 讀過證明:「我讓 AI 生成證明、檢查證明、寫出論文。但沒有人讀過它,也不會有人去讀。這現在是個巨大的挑戰。」資料庫本身也反映了這種劇變:截至 Quanta 報導時,565 題已解、652 題仍開放。

然而,那些認真查核的合作者,正以整個領域來不及消化的速度產出真正的數學,而局外人的參與規模更是前所未見。Van Doorn 的說法大概是最好引的一段平衡觀點:「如果你想彈鋼琴,你不會去雇一台彈得比你好的鋼琴機器。你會去彈鋼琴,因為你就是喜歡彈鋼琴。」

Erdős 生前提著現金懸賞他的問題,還把上帝戲稱為把最好證明藏私的「最高法西斯」——他大概會欣賞這個諷刺:他那份隨興的懸賞清單,由一位數學家和志工社群維護至今,如今成了這個年代最關鍵能力競賽的計分板——而機器正以每題幾百美元的價格,一題一題清空它。