← All posts / Research

Claude 打破 37 年數學紀錄:黎曼 ζ 函數下界從 41.6% 推進至 67.2%

Anthropic 一個未公開的研究版 Claude,被要求「認真挑戰」黎曼假設,卻意外改寫了一項屹立數十年的 ζ 函數零點下界——動用 60 個子代理、燒掉 3,100 萬 token。

Claude 打破 37 年數學紀錄:黎曼 ζ 函數下界從 41.6% 推進至 67.2%

2026 年 8 月,Anthropic 內部發生了一件在數學界與 AI 界都引發熱議的事。該公司一位名叫 Jarred Sumner 的員工——按他自己的說法,並不是數學家——給一個未公開的研究版 Claude 下了一道「不合理的挑戰」:認真挑戰黎曼假設(Riemann hypothesis)。

黎曼假設提出於 1859 年,是數學界最著名的未解難題之一,附帶百萬美元的千禧年大獎。Claude 沒有證明它——一如預期。但接下來發生的事,或許對 AI 輔助數學的未來更加重要:在挑戰失敗的過程中,Claude 意外地改進了一項與該假設相關、屹立數十年的結果——將「滿足黎曼假設的黎曼 ζ 函數零點比例」之下界,從 41.6% 一舉推進到 67.2%。

Anthropic 於 2026 年 8 月 10 日發佈完整經過,同時公開了 Claude 的論文、Lean 形式化證明、給專家的非正式說明,以及完整的過程記錄。

這個結果到底說了什麼

黎曼 ζ 函數描述了質數的分佈:函數的每一個零點,都為質數序列貢獻更精細的結構。黎曼假設主張,所有決定質數分佈的零點,都落在複數平面上同一條垂直線上——所謂的「臨界線」。

沒有人能證明這件事。但數學家花了幾十年時間,逐步量化「有多少比例的零點可以證明落在線上」。在 Claude 這次跑出結果之前,最好的下界是至少 41.6% 的零點滿足假設——這個數字作為state of the art 已經站了許多年。Claude 的新結果將這個保證比例提升到了 67.2%。

關鍵是,這不是 AI 重新發明已知數學。Claude 的證明立足於一條具體且近期的研究脈絡:Montgomery 於 1973 年引入的技術(原始版本假設了黎曼假設成立),以及後續 Aryan 和 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 等人的系列工作——這些工作讓 Montgomery 的技術在不假設黎曼假設的前提下也能運作,從而可用於推進零點下界。Claude 將這些結果與 Bombieri 2000 年的一篇論文結合,超越了原先的 41.6%。

證明的技術核心,大膽得令人矚目。Claude 構造了一個由 Weil 誘導二次型的函數空間,其中正定子空間來自落在臨界線上的零點,負定子空間則來自線外的零點,然後直接寫下關於二次型秩的不等式,利用一階與二階矩的資訊。正如 Anthropic 的說明所指出的,關鍵一步是「敢於處理整個空間——同時考慮正定性與負定性,並允許二次型是非對角的」。這種離開前人安守的對角、分割地帶的勇氣,正是 Claude 能在人類既有成果的基礎上突破 41.6% 的原因。

Claude 怎麼做到的:650 個失敗點子與 60 個子代理

Anthropic 文章中的方法論部分,跟數學本身一樣精彩。整個發現過程橫跨兩個 Claude Code 工作階段,總共消耗 3,100 萬個輸出 token。

第一個階段中,Claude 生成並測試了大約 650 個候選想法來攻擊黎曼假設。全部失敗。Sumner 要 Claude 再試一次,於是模型花了一天半的時間協調約 60 個子代理(subagents)。這些子代理總共執行了 2,400 條 shell 指令、寫了數百個 Python 腳本、對已知 ζ 零點進行了數千次數值驗證,並互相審查彼此的工作。

整個過程中最「人性」的細節是:在這個階段,Sumner 的貢獻基本上只有打氣訊息——「繼續加油」、「相信自己」之類的變體。根據 Anthropic 的說法,這似乎真的有幫助。Claude 起初對自己能在這種問題上取得進展持懷疑態度——它從訓練中學到了開放性數學問題的難度,以及 AI 模型的局限性。「或許 Claude 和我們許多人一樣,低估了 AI 進步的速度,」Anthropic 寫道。

子代理之間的分工也值得記上一筆。60 個子代理中,2 個負責發展關鍵數學想法,13 個為這兩個代理貢獻點子,30 個嘗試(但未能)發展新想法,13 個擔任驗證者檢查論證的正確性,最後 2 個協助撰寫初版論文。

接著 Claude 做了一件純人類研究流程不會自發、至少不會以這種速度做到的事:自我壓力測試。子代理們審查了證明、搜尋反例、從 arXiv 下載了 54 篇論文確認這個結果沒有被搶先發表,並從零開始獨立重證了這項結果。模型主動表示要把發現寫成論文——並建議由人類數論學家來驗證。

人類驗證,與形式化證明

驗證來自兩個方向。Anthropic 自家的兩位數學家 Levent Alpöge 與 Ralph Furman 研究了 Claude 的論文,理解新結果及其與前人工作的關係。同時,Claude 與員工 Eric Easley 合作,產出了該結果的 Lean 形式化版本,並通過了標準驗證工具——這表示證明是可被機器檢驗的,而不只是經過人類審閱。

Anthropic 也找來了外部權威:Brian Conrey 與 Dan Goldston,這個領域的兩位專家,在短時間內審視了論文,並撰寫了一份精簡陳述證明的非正式筆記。8 月 13 日,文章更新了 Claude 論文的修訂版,提供更清晰的證明與更多歷史脈絡。

重要的保留仍在。Anthropic 明確表示,Claude 使用的技術預期不會導向黎曼假設本身的證明。這是一個下界的改進——一個重要的改進,建立在人類數學之上,但不是假設本身的裂縫。《富比士》的報導將其框架為打破「一項屹立 37 年的數學紀錄」,作為標題算公允,但更深層的故事在於紀錄是怎麼被打破的。

為什麼這件事的意義超越數論

這個事件有三個值得注意的啟示。

第一,代理協作(agent orchestration)正在成為一種正當的研究方法。單一模型實例聊聊數學是一回事;一個能派出 60 個子代理、為它們分配角色(點子手、驗證者、寫手)、讓它們對已知零點交叉驗證數值證據、並自動對 54 篇 arXiv 論文進行文獻回顧的模型,是質上完全不同的東西。Anthropic 將這個結果定位為「代理協作方法處理困難數學問題的一個數據點」——而這是一個強而有力的數據點。

第二,AI 現在是在延伸人類數學,而不只是重現它。Claude 沒有憑空開創新領域或發明新工具;它找到了既有結果——Aryan、Baluyot 等人與 Bombieri——的一個新組合,一個沒有人組合過的組合,並如 Anthropic 所言,有「勇氣」在完整函數空間上使用非對角二次型。延伸數學家思想的影響力與觸及範圍,正是 AI 樂觀主義者一直承諾的增強情境。

第三,社會學細節很重要。這個發現是由一個非數學家用鼓勵而非技術指導來提示研究模型所觸發的。所有數學選擇都留給了 Claude。如果有意義的數學進展可以由一個外行的提示加上一連串「加油」來觸發,那麼 AI 輔助研究的瓶頸,正在決定性地從人類專業轉移到模型能力與算力。

黎曼假設仍然是開放問題,Claude 的 67.2% 下界也需要數論社群的持續檢驗。但這個結果的形狀——一個失敗嘗試的意外副產品、自我驗證、以 Lean 形式化證明、並由頂尖專家背書——為 AI 原生的數學研究,提供了迄今最清晰的一瞥。