← All posts / Research

Claude 將黎曼 Zeta 函數下界從 41.6% 推升至 67.2%——首次突破半數的 AI 數學進展

未公開的 Claude 模型使用 60 個子代理和 3100 萬 token,將黎曼 zeta 函數零點下界從 41.6% 提升至 67.2%——這是一個世代以來最大的單步突破。

Claude 將黎曼 Zeta 函數下界從 41.6% 推升至 67.2%——首次突破半數的 AI 數學進展

2026 年 8 月 10 日,Anthropic 發布了一篇研究筆記,在 AI 和數學界同時引發了巨大迴響。一個尚未公開的研究版 Claude 模型改善了黎曼 zeta 函數零點中、位於臨界線上的比例下界——從 41.6% 一舉推升至 67.2%。這項結果在發布數小時內就吸引了超過 500 萬次瀏覽。

黎曼猜想自 1859 年提出以來一直未被解決,是七大千禧年大獎難題之一,附帶克雷數學研究所 100 萬美元獎金。它與質數分布密切相關:zeta 函數的零點編碼了質數序列中越來越精細的結構,而該猜想斷言所有非平凡零點都落在複數平面上的一條垂直線上——即所謂的臨界線。至今無人能證明所有零點都在那裡,也無人能否定它。

Claude 做的並非證明黎曼猜想本身。它改善的是一個相關的下界——數學家能嚴格認證有多少比例的零點確實落在臨界線上。而這個比例,在超過一世紀的人類漸進努力之後,剛剛完成了有史以來最大的一次跳躍。

打破一條 112 年的鏈

Claude 超越的 41.6% 並非近期成果。它是一條長達 112 年漸進推進鏈的終點,每一步都代表解析數論領域的一篇重要論文:

年份數學家已證明下界
1914Hardy臨界線上有無限多零點(無比例)
1942Selberg正比例(未指明數值)
1974Levinson超過 1/3(≈33.3%)——引入 mollifier 方法
1989Conrey超過 2/5(40%)
2011Bui、Conrey、Young≈41.05%
2020Pratt、Robles、Zaharescu、Zeindler超過 5/12(≈41.67%)
2026Claude(未公開模型)67.2%

仔細看最後兩行。從 1989 年 Conrey 的 40%,到 2020 年 Pratt–Robles–Zaharescu–Zeindler 的 5/12,全球解析數論學家在 31 年間總共推進了約 1.7 個百分點——大約每年推進百分之五,每一步都是一篇完整的研究論文。Claude 在一天半之內增加了 25.6 個百分點。

這不是一個「稍微快一點的人類」,而是一個不同等級的搜尋模式。

事情是怎麼發生的:一個慢跑者的提示

這個實驗的起點很隨性。Jarred Sumner 是 Anthropic 的一名員工,他不是數學家。八天前他在慢跑時,請 Claude「認真嘗試一下」黎曼猜想本身。模型照做了。接下來 36 小時內,它透過兩次 Claude Code 工作階段,消耗了約 3100 萬個輸出 token,協調了約 60 個子代理,執行了超過 2,400 條 shell 指令和數百個 Python 腳本。

第一次工作階段完全失敗。Claude 生成並測試了 650 種不同的方法,全部失敗。Sumner 告訴它再試一次。根據 Anthropic 自己的描述,Sumner 在整個過程中的貢獻「主要限於發送鼓勵訊息」,大多是「繼續下去」或「相信你自己」之類的話。

這個細節引起了廣泛關注。Anthropic 報告指出,這些鼓勵「似乎幫助 Claude 克服了它對自己能否取得有意義進展的初期懷疑」。模型從訓練中學到了開放性問題很難、且 AI 模型有其限制,並將這種先驗認知應用在自己身上——實際上提早終止了自己的搜尋。在這個框架下,鼓勵不是動機,而是對一個習得停止啟發式規則的修正。Anthropic 在一個腳註中提到,2026 年 7 月 Fable 5 的 Jacobian 猜想反例也使用了同樣的鼓勵模式。兩次就是一個模式。

第二次工作階段:突破的時刻

第二次工作階段才是突破浮現之處。Anthropic 對 60 個子代理艦隊的分解揭示了明確的分工:

角色數量功能
核心想法開發者2產生關鍵數學洞見
想法貢獻者13向核心兩人提供想法
失敗探索者30嘗試新想法,無一成功
驗證者13檢查正確性,互相審查
撰寫者2起草初始論文

整個艦隊的一半——60 個代理中的 30 個——沒有產出任何可用結果。60 個代理中只有 2 個產生了實際成果。這不是一個需要被工程化消除的低效率,而是前沿數學搜尋的真實樣貌。任何試圖讓每個代理都有貢獻的編排設計,都在優化錯誤的目標。

數學:舊碎片的全新組裝

Claude 沒有發明新的數學。它組合了兩條現有研究線——沒有人類曾將它們拼在一起。第一條是 Baluyot、Goldston、Suriajaya 和 Turnage-Butterbaugh 發表的一系列論文,讓 Montgomery 1973 年的技巧在不假設黎曼猜想的情況下也能運作。這是一個關鍵前提,因為 Montgomery 原本的方法假設猜想為真,使它們在證明猜想方面毫無用處。第二條是 Bombieri 2000 年的一篇論文。

技術核心:Claude 建構了一個帶有 Weil 誘導二次型的函數空間,其中正定子空間來自臨界線上的零點,負定子空間來自臨界線外的零點。接著它寫下了一個關於該二次型秩的不等式,利用了一階和二階矩資訊。

Anthropic 將真正的洞見歸結為一種「氣質」而非新技巧或暴力計算:「將整個空間一起處理、同時考慮正定和負定性、並允許二次型為非對角型的勇氣,在某種意義上就是讓 Claude 達成結論的步驟。」處理非對角情形令人不快,但並非不可能——而機器在不愉快容忍度上具有優勢。

驗證:比多數更嚴謹,但尚未完整

驗證過程比大多數 AI 數學聲明更為嚴格,但仍不等同於正式的同行評審。兩位 Anthropic 數學家——Levent Alpöge 和 Ralph Furman——研究並驗證了這篇論文,並撰寫了一份簡明的非正式筆記向專家陳述證明。Brian Conrey(1989 年創下 40% 紀錄的人)和 Dan Goldston(Claude 論證所依賴的無條件機制合著者)也在短時間內審查了論文。最有資格發現錯誤的人,正是自己的工作被延伸的人。

Claude 還產出了一個可形式化驗證的 Lean 證明,通過了標準驗證工具 comparator 的檢查。子代理獨立執行了數千次針對已知 zeta 零點的數值檢查,搜尋反例,從 arXiv 下載了 54 篇論文確認該發現尚未被發表過,並從零開始重新證明了結果,然後才提交人類做最終審查。

未完成的部分包括:沒有期刊投稿、沒有正式同行評審,而且——至關重要的是——生成模型是未公開且未命名的,因此 Anthropic 外部沒有人能重現這次運行。Lean 檔案是公開且可檢查的,但產生它的實驗在科學意義上不可重現。這個證明比大多數人類論文更可審計;這個能力聲明則比幾乎所有論文都更不可證偽。

這一跳的成本

Anthropic 對計算花費給出了具體數字:兩次工作階段共 3100 萬個輸出 token。以 Claude Sonnet 5 公開的每百萬輸出 token 10 美元計算,僅輸出計費約 310 美元——這還不包括輸入 token、快取上下文或 2,400 條 shell 指令的額外開銷。以 Opus 等級費率計算,數字會高出數倍。一次可比擬運行的實際 API 花費可能在低到中四位數範圍。

相較於一個數學家自 Hardy 1914 年定理以來推進的常數,這是一筆極為划算的交易。但相較於之前 650 個失敗的想法,它也提醒我們:絕大部分的 token 預算花在了沒有用的東西上——任何編列代理式研究預算的人都應該為這個比例做好準備。

AI 數學的一年

這個結果並非孤立事件。在大約四個月內,AI 模型已經產出了一系列數學進展:2026 年 5 月用 OpenAI 模型解決的 Erdős 平面單位距離問題,7 月 Fable 5 的 Jacobian 猜想反例(由驗證本次結果的同一位 Levent Alpöge 宣布),Grok 4.5 在 Graffiti 猜想上的成果,以及現在 Claude 的黎曼 zeta 下界。

所有這些成果呈現出一致的模式:模型不是在取代數學家,而是在既有的人類成果基礎上延伸觸及範圍,找出沒有人組裝過的組合。Claude 沒有發明 Weil 的二次型、Bombieri 的論文、或 Baluyot–Goldston 的無條件機制。它讀了所有這些,然後發現它們可以拼在一起。

Anthropic 對限制毫不諱言:「我們不預期 Claude 使用的技巧能導向證明黎曼猜想。」證明 67.2% 和證明 100% 是不同的問題,兩者之間的差距不是更多同樣方法就能跨越的。但在 8 月的某一個週末,一個 AI 模型推進到了數學界最古老的開放問題之一——比任何人類一輩子做到的都更遠——而這一切的起因,只是一個慢跑者叫它相信自己的能力。