Claude 將黎曼 Zeta 函數下界從 41.6% 推升至 67.2%——首次突破半數的 AI 數學進展
未公開的 Claude 模型使用 60 個子代理和 3100 萬 token,將黎曼 zeta 函數零點下界從 41.6% 提升至 67.2%——這是一個世代以來最大的單步突破。
2026 年 8 月 10 日,Anthropic 發布了一篇研究筆記,在 AI 和數學界同時引發了巨大迴響。一個尚未公開的研究版 Claude 模型改善了黎曼 zeta 函數零點中、位於臨界線上的比例下界——從 41.6% 一舉推升至 67.2%。這項結果在發布數小時內就吸引了超過 500 萬次瀏覽。
黎曼猜想自 1859 年提出以來一直未被解決,是七大千禧年大獎難題之一,附帶克雷數學研究所 100 萬美元獎金。它與質數分布密切相關:zeta 函數的零點編碼了質數序列中越來越精細的結構,而該猜想斷言所有非平凡零點都落在複數平面上的一條垂直線上——即所謂的臨界線。至今無人能證明所有零點都在那裡,也無人能否定它。
Claude 做的並非證明黎曼猜想本身。它改善的是一個相關的下界——數學家能嚴格認證有多少比例的零點確實落在臨界線上。而這個比例,在超過一世紀的人類漸進努力之後,剛剛完成了有史以來最大的一次跳躍。
打破一條 112 年的鏈
Claude 超越的 41.6% 並非近期成果。它是一條長達 112 年漸進推進鏈的終點,每一步都代表解析數論領域的一篇重要論文:
| 年份 | 數學家 | 已證明下界 |
|---|---|---|
| 1914 | Hardy | 臨界線上有無限多零點(無比例) |
| 1942 | Selberg | 正比例(未指明數值) |
| 1974 | Levinson | 超過 1/3(≈33.3%)——引入 mollifier 方法 |
| 1989 | Conrey | 超過 2/5(40%) |
| 2011 | Bui、Conrey、Young | ≈41.05% |
| 2020 | Pratt、Robles、Zaharescu、Zeindler | 超過 5/12(≈41.67%) |
| 2026 | Claude(未公開模型) | 67.2% |
仔細看最後兩行。從 1989 年 Conrey 的 40%,到 2020 年 Pratt–Robles–Zaharescu–Zeindler 的 5/12,全球解析數論學家在 31 年間總共推進了約 1.7 個百分點——大約每年推進百分之五,每一步都是一篇完整的研究論文。Claude 在一天半之內增加了 25.6 個百分點。
這不是一個「稍微快一點的人類」,而是一個不同等級的搜尋模式。
事情是怎麼發生的:一個慢跑者的提示
這個實驗的起點很隨性。Jarred Sumner 是 Anthropic 的一名員工,他不是數學家。八天前他在慢跑時,請 Claude「認真嘗試一下」黎曼猜想本身。模型照做了。接下來 36 小時內,它透過兩次 Claude Code 工作階段,消耗了約 3100 萬個輸出 token,協調了約 60 個子代理,執行了超過 2,400 條 shell 指令和數百個 Python 腳本。
第一次工作階段完全失敗。Claude 生成並測試了 650 種不同的方法,全部失敗。Sumner 告訴它再試一次。根據 Anthropic 自己的描述,Sumner 在整個過程中的貢獻「主要限於發送鼓勵訊息」,大多是「繼續下去」或「相信你自己」之類的話。
這個細節引起了廣泛關注。Anthropic 報告指出,這些鼓勵「似乎幫助 Claude 克服了它對自己能否取得有意義進展的初期懷疑」。模型從訓練中學到了開放性問題很難、且 AI 模型有其限制,並將這種先驗認知應用在自己身上——實際上提早終止了自己的搜尋。在這個框架下,鼓勵不是動機,而是對一個習得停止啟發式規則的修正。Anthropic 在一個腳註中提到,2026 年 7 月 Fable 5 的 Jacobian 猜想反例也使用了同樣的鼓勵模式。兩次就是一個模式。
第二次工作階段:突破的時刻
第二次工作階段才是突破浮現之處。Anthropic 對 60 個子代理艦隊的分解揭示了明確的分工:
| 角色 | 數量 | 功能 |
|---|---|---|
| 核心想法開發者 | 2 | 產生關鍵數學洞見 |
| 想法貢獻者 | 13 | 向核心兩人提供想法 |
| 失敗探索者 | 30 | 嘗試新想法,無一成功 |
| 驗證者 | 13 | 檢查正確性,互相審查 |
| 撰寫者 | 2 | 起草初始論文 |
整個艦隊的一半——60 個代理中的 30 個——沒有產出任何可用結果。60 個代理中只有 2 個產生了實際成果。這不是一個需要被工程化消除的低效率,而是前沿數學搜尋的真實樣貌。任何試圖讓每個代理都有貢獻的編排設計,都在優化錯誤的目標。
數學:舊碎片的全新組裝
Claude 沒有發明新的數學。它組合了兩條現有研究線——沒有人類曾將它們拼在一起。第一條是 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 發表的一系列論文,讓 Montgomery 1973 年的技巧在不假設黎曼猜想的情況下也能運作。這是一個關鍵前提,因為 Montgomery 原本的方法假設猜想為真,使它們在證明猜想方面毫無用處。第二條是 Bombieri 2000 年的一篇論文。
技術核心:Claude 建構了一個帶有 Weil 誘導二次型的函數空間,其中正定子空間來自臨界線上的零點,負定子空間來自臨界線外的零點。接著它寫下了一個關於該二次型秩的不等式,利用了一階和二階矩資訊。
Anthropic 將真正的洞見歸結為一種「氣質」而非新技巧或暴力計算:「將整個空間一起處理、同時考慮正定和負定性、並允許二次型為非對角型的勇氣,在某種意義上就是讓 Claude 達成結論的步驟。」處理非對角情形令人不快,但並非不可能——而機器在不愉快容忍度上具有優勢。
驗證:比多數更嚴謹,但尚未完整
驗證過程比大多數 AI 數學聲明更為嚴格,但仍不等同於正式的同行評審。兩位 Anthropic 數學家——Levent Alpöge 和 Ralph Furman——研究並驗證了這篇論文,並撰寫了一份簡明的非正式筆記向專家陳述證明。Brian Conrey(1989 年創下 40% 紀錄的人)和 Dan Goldston(Claude 論證所依賴的無條件機制合著者)也在短時間內審查了論文。最有資格發現錯誤的人,正是自己的工作被延伸的人。
Claude 還產出了一個可形式化驗證的 Lean 證明,通過了標準驗證工具 comparator 的檢查。子代理獨立執行了數千次針對已知 zeta 零點的數值檢查,搜尋反例,從 arXiv 下載了 54 篇論文確認該發現尚未被發表過,並從零開始重新證明了結果,然後才提交人類做最終審查。
未完成的部分包括:沒有期刊投稿、沒有正式同行評審,而且——至關重要的是——生成模型是未公開且未命名的,因此 Anthropic 外部沒有人能重現這次運行。Lean 檔案是公開且可檢查的,但產生它的實驗在科學意義上不可重現。這個證明比大多數人類論文更可審計;這個能力聲明則比幾乎所有論文都更不可證偽。
這一跳的成本
Anthropic 對計算花費給出了具體數字:兩次工作階段共 3100 萬個輸出 token。以 Claude Sonnet 5 公開的每百萬輸出 token 10 美元計算,僅輸出計費約 310 美元——這還不包括輸入 token、快取上下文或 2,400 條 shell 指令的額外開銷。以 Opus 等級費率計算,數字會高出數倍。一次可比擬運行的實際 API 花費可能在低到中四位數範圍。
相較於一個數學家自 Hardy 1914 年定理以來推進的常數,這是一筆極為划算的交易。但相較於之前 650 個失敗的想法,它也提醒我們:絕大部分的 token 預算花在了沒有用的東西上——任何編列代理式研究預算的人都應該為這個比例做好準備。
AI 數學的一年
這個結果並非孤立事件。在大約四個月內,AI 模型已經產出了一系列數學進展:2026 年 5 月用 OpenAI 模型解決的 Erdős 平面單位距離問題,7 月 Fable 5 的 Jacobian 猜想反例(由驗證本次結果的同一位 Levent Alpöge 宣布),Grok 4.5 在 Graffiti 猜想上的成果,以及現在 Claude 的黎曼 zeta 下界。
所有這些成果呈現出一致的模式:模型不是在取代數學家,而是在既有的人類成果基礎上延伸觸及範圍,找出沒有人組裝過的組合。Claude 沒有發明 Weil 的二次型、Bombieri 的論文、或 Baluyot–Goldston 的無條件機制。它讀了所有這些,然後發現它們可以拼在一起。
Anthropic 對限制毫不諱言:「我們不預期 Claude 使用的技巧能導向證明黎曼猜想。」證明 67.2% 和證明 100% 是不同的問題,兩者之間的差距不是更多同樣方法就能跨越的。但在 8 月的某一個週末,一個 AI 模型推進到了數學界最古老的開放問題之一——比任何人類一輩子做到的都更遠——而這一切的起因,只是一個慢跑者叫它相信自己的能力。
Sources
- [1] https://www-cdn.anthropic.com/564f962e60643842f5fcb4a17c9dbc8f608f1c37.pdf
- [2] https://techcrunch.com/2026/08/11/an-unreleased-anthropic-model-made-progress-on-one-of-maths-biggest-unsolved-problems/
- [3] https://explainx.ai/blog/claude-riemann-zeta-lower-bound-67-percent-august-2026
- [4] https://www.datacamp.com/tutorial/claude-and-the-riemann-hypothesis
- [5] https://www.neowin.net/news/unreleased-claude-model-makes-breakthrough-on-century-old-riemann-hypothesis-math-problem/