722 篇論文、一個模型、零位人類作者:OpenAI 史上最大數學發布,考驗的是「驗證」本身
OpenAI 公開發布 722 篇由內部未發表前沿模型生成的數學研究手稿,分屬 372 個研究系列——多數成果附帶 Lean 形式化證明,卻也讓整個數學界面臨前所未有的驗證瓶頸。
10 月 6 日,OpenAI 低調做了一件兩年前聽起來還像科幻小說的事:一次公開發布 722 篇數學研究手稿——而且每一篇都出自同一個內部未發表的前沿模型。這批成果以公開 GitHub 儲存庫的形式釋出,整理為 372 個「研究系列」(research families),橫跨純數學、理論計算機科學與數學物理。以數量級計,這是人類史上最大規模的單次機器生成數學成果發布,而它砸向的,是一個連上一批成果都還沒吵完該怎麼驗證的學術圈。
這次到底發布了什麼
光看數字就夠驚人。背後的模型在研究過程中嘗試了約 4,000 個開放研究問題,每個被採納的成果平均耗費相當於 ChatGPT Pro 約三小時的推理運算。最終存活下來的 722 篇手稿,涵蓋了通常需要人類專家投入多年心血的領域:數論、複雜度理論、幾何與數學物理。
其中點名的課題讀起來像一份地獄難度的資格考大綱:有一個系列處理圓周率 π 的無理性指數(irrationality exponent)——即有理數能多精確地逼近這個最著名的常數;另一個系列深入計算複雜度理論中的 NP 困難問題。集合中還包括 Mahler 猜想、等差數列、自由群因子、量子海森堡鐵磁體,以及相對論性 Vlasov-Maxwell 方程的手稿。無論如何評價,這都不是同一個把戲重複 722 次——跨領域的廣度本身就是重點。
OpenAI 將手稿歸入研究系列以呈現個別成果之間的關聯,並在其中十個系列附上模型自身推理過程的摘要——一扇窺探系統如何思考特定問題的窗,且刻意與形式化證明分開呈現。
Lean 形式化層扛起了最重的擔子
這次發布最重要、卻最低調的特徵是:多數證明已用 Lean 形式化。Lean 是一種證明助理,能將數學論證轉譯為程式碼,讓電腦逐步驗證每個邏輯環節。凡是有 Lean 形式化的部分,推理鏈的正確性不依賴任何人的直覺——也不依賴 OpenAI 的誠實。
但 Lean 覆蓋率是局部的,OpenAI 對此並不諱言。許多手稿仍缺形式化版本,該公司表示會隨研究人員完成驗證而持續補上。儲存庫還追蹤論文修訂並提供引用指引,讓數學社群在成果被更正或延伸時有清楚的紀錄——等於承認這些文件將以「活文件」的形態存在於公眾視野中。
發布流程本身是在「數學與人工智慧諮詢委員會」(Advisory Group on Mathematics and Artificial Intelligence,設於普林斯頓高等研究院 IAS)的建議下設計的。這個獨立委員會是 OpenAI 在 9 月底成立的——起因是自家內部模型先前的成果宣稱(包括 9 月 8 日對千禧年大獎難題 Navier-Stokes 方程的解答)引發激烈爭議:有數學家批評該證明利用外加力項,繞過了問題原本的精神。外界普遍將新諮詢委員會視為對那場風波的結構性回應,而這次發布正是新流程能否承載公眾信任的第一場大考。
驗證危機不再是假設
真正令人不安的數學在需求端。一篇困難的研究論文,可能要讓領域專家花上數月才能確實審查。OpenAI 一個下午就往全球的盤子裡添了 722 篇——而且暗示這是一條生產線,不是終點。Reddit 數學版上的反應與其說是「哇」,不如說是「誰要來讀完這一切?」一則高讚討論串直接警告:「驗證危機」已經開始。擔憂不只是對錯,而是分診(triage):在沒有形式化證明、也沒有作者聲譽可以參考的情況下,數學家必須決定哪 40 頁的機器生成論證值得專家投入數週時間。
背景脈絡讓這次發布更像趨勢線上的新的一點,而非孤例。根據近期一篇針對 arXiv 投稿的分析,數學預印本數量急升——2026 年 2 月到 7 月,月投稿量成長約 49%;承認使用 AI 協助的數學論文占比,從 4 月的約 4% 升到 8 月的 25%。AI 生成的數學早已透過人機協作流入文獻。10 月 6 日改變的,是來自單一工業級源頭、純粹未經稀釋的「量」正式到場。
為什麼 Lean 是唯一真正的答案
這次發布更深層的意義,或許是它迫使整個領域翻轉流程。歷史上大部分時間,出版是信任流程的終點:同儕審查在印刷之前。在 OpenAI 示範的新模式裡,出版是驗證的起點,而形式化方法是唯一能與供給量同步擴張的機制。Lean 證明檢查器不在乎論證是 Fields 獎得主寫的還是 GPU 叢集算出來的——要嘛通過型別檢查,要嘛不通過。OpenAI 以形式化證明領銜、將推理摘要分開發布、並在儲存庫中追蹤修訂,實質上等於承認傳統審查制度無法消化這個量——也是一場豪賭:賭機器可驗證證明將成為數學界預設的信任標準。
這場賭注有其極限。形式化本身就耗工(即使有 AI 幫忙);一個「形式上正確地證明了錯誤命題」的證明依然是形式正確的;而挑選哪 4,000 個問題來攻,本身嵌入了一種沒有任何檢查器會審計的判斷。但方向已定:OpenAI 表示將支持以理解重大 AI 生成成果為主題的工作坊、研討會與特別計畫,數學家的回饋也會影響未來的披露方式。
結語
一種解讀是把 10 月 6 日看作炫技:722 篇手稿、數十個領域、一個 OpenAI 外無人能查詢的模型。更好的解讀是:數學界剛跑完史上最大規模的「後置驗證」對照實驗。那個 GitHub 儲存庫現在才是前線——不是「AI 能證明什麼」的前線,而是「人類社群能消化什麼」的前線。如果 Lean 形式化跟得上、諮詢流程守得住,未來回望,這可能被視為同儕審查改變形態的那一週;如果跟不上,它會被記成洪水開閘的那一天。
最耐人尋味的是:那個模型沒有名字,也沒有發布日期。這或許透露了一切——OpenAI 認為這些數學重要到必須立刻公開,而生產它們的模型寶貴到必須繼續藏在簾幕之後。
Sources
- [1] https://www.theinformation.com/briefings/openai-publishes-700-new-math-papers-ai-made-solutions
- [2] https://interestingengineering.com/ai-robotics/openai-largest-math-release-lean-proofs
- [3] https://openai.com/index/ten-advances-in-mathematics/
- [4] https://openai.com/index/advisory-group-on-mathematics-and-ai/
- [5] https://www.reddit.com/r/Physics/comments/1wzgqwn/openai_drops_722_math_papers_written_by_internal/
- [6] https://www.scientificamerican.com/article/did-openai-solve-the-wrong-navier-stokes-problem/
- [7] https://arxiv.org/html/2608.24961v1