神經外科醫師 + GPT-5.6 攻克困擾數學界 22 年的 Crouzeix 猜想
北京一位神經外科住院醫師,在沒有正式數學訓練的背景下,靠 GPT-5.6 Sol 自主運行 16 小時證明了 2004 年提出的 Crouzeix 猜想;八天後 arXiv 上又出現獨立證明。
今年數學界最不可思議、也最具深遠影響的故事,在過去三週逐漸展開:北京協和醫學院醫院(Peking Union Medical College Hospital)的博士後研究員兼神經外科住院醫師金善沐(Shanmu Jin)醫師,在 ChatGPT(GPT-5.6 Sol 模型)自主運行約 16 小時的關鍵助力下,證明了矩陣分析領域自 2004 年以來懸而未決的 Crouzeix 猜想。
這個故事最早由 Alex Townsend 與 Anne Greenbaum 在 8 月 14 日的 SIAM News 文章中詳細披露,隨即廣泛流傳。它顛覆了兩個長久以來的假設:誰有能力對前沿數學做出貢獻,以及大型語言模型在數學研究中究竟能扮演什麼角色——不是潤飾既有結果,而是產出真正全新的證明。
Crouzeix 猜想是什麼
對一個方陣 $A$,數值域(numerical range)$W(A)$ 定義為所有單位向量 $x$ 所對應 $x^*Ax$ 值的集合——它是複平面上的一個緊緻凸區域,且必定包含所有特徵值。對於非正規矩陣(nonnormal matrix),光看特徵值往往會得到不完整、甚至誤導的資訊;數值域則能捕捉矩陣行為中更多的面向。
Crouzeix 猜想由法國數學家 Michel Crouzeix 於 2004 年提出:對任意多項式 $p$,
$$|p(A)|2 \le 2 \max{z \in W(A)} |p(z)|$$
白話來說:數值域是一個「2-譜集」(2-spectral set)——在這個區域上,純量函數值能控制多項式作用於矩陣後的範數,且常數 2 是普適的。這個界是最優的,常數 2 無法再改進。
這條不等式的意義遠不止於純粹的好奇心。Townsend 與 Greenbaum 指出,若某多項式或有理函數在 $W(A)$ 上一致逼近某函數 $f$,則 Crouzeix 型的界能把純量逼近誤差轉換成矩陣函數 $f(A) - r(A)$ 的範數上界。這是從複平面逼近通往矩陣函數分析、GMRES 收斂性、以及多項式與有理 Krylov 方法分析的標準路徑——而這些正是科學計算底層的數值線性代數核心工具。
二十年來的局部進展
這個問題累積了可觀的文獻。Crouzeix 本人在 2007 年證明:把常數 2 換成 11.08 永遠成立。2017 年,Crouzeix 與 Palencia 把普適常數降到 $1 + \sqrt{2} \approx 2.414$——距離目標的 2 近在咫尺,卻始終跨不過去。同年,美國數學研究所(American Institute of Mathematics)在聖荷西舉辦了為期一週的專題工作坊,由 Mark Embree、Michael Overton 與 Anne Greenbaum 組織,從理論、數值證據、矩陣膨脹(dilation)、逆數值域問題等多個角度圍攻這個猜想。儘管數值證據極具說服力、二十年間無數人投入,沒有人能補上最後一哩路。
意外的證明者
金醫師踏入矩陣分析的路徑,說來奇妙,竟源於他對穿顱超音波(transcranial ultrasound)的研究。他在自學過程中接觸到 Crouzeix 猜想,被它異常簡潔的敘述和數值域的視覺幾何所吸引。他的正式數學教育只有理工科系學生普遍修習的課程——大學部念的是地質學,之後取得醫學博士(M.D.)。「除此之外的一切都是自學的,」他在 email 中告訴 Townsend 與 Greenbaum。
在突破發生前的一年左右,金醫師經常性地請 ChatGPT 去解這個猜想。模型總是 Either 給出假證明,Either 在缺少某個引理之處卡住。直到 2026 年 7 月 30 日,ChatGPT 引用了一篇 7 月 27 日發布的預印本《The Numerical Range Is a 2-Spectral Set》,宣稱猜想已被解決。Townsend 與 Greenbaum 起初帶著懷疑閱讀——但幾個小時後便意識到「這個論證是來真的」。他們兩人加上 Michel Crouzeix 本人都已徹底檢查過證明,並相信金醫師的手稿是正確的。
16 小時的自主運行
關鍵定理誕生於 GPT-5.6 Sol 在 ChatGPT Work 模式下約 16 小時的自主運行。整個設定與結果同樣耐人尋味。金醫師改編了 OpenAI 先前用來解決 Cycle Double Cover 猜想的提示詞(prompt)。這個 prompt 明確禁止系統存取公開網路與任何外部資源。金醫師啟動運行後便不再介入。
這個 prompt 要求模型維持一個「分支組合」——多條真正不同的進攻路線。它指示 ChatGPT 啟動大量子代理(subagents),各自獨立思考證明策略,並明確約束它們不得過早收斂到同一個「看起來很誘人」的想法。候選證明會反覆接受對抗式審計(adversarial audits),唯有找到反例才能排除某條策略。最後,prompt 要求模型在完整證明通過檢查之前絕不放棄。
那個決定性的定理令驗證者震驚:它不需要眾人預期中更強的估計式,而是透過細緻的取樣策略,把問題化約成一個出奇簡單的正性條件(positivity condition)。金醫師的公開儲存庫包含完整的 prompt、各版手稿、Lean 形式化驗證與公理審計(axiom audit)——讓這項工作接受檢驗的開放程度罕見地高。他本人則極為謙遜,強調找到關鍵想法「確實有運氣的成分」——而這一切,都是在他聽來相當操勞的臨床神經外科工作之餘完成的。
八天後的獨立證明
8 月 4 日——金醫師第一版預印本發布僅八天後——Emiel Lorist 與 Felix Schwenninger 在 arXiv 上發表了獨立的五頁證明(arXiv:2608.03841)。他們的論證路徑不同且極為精簡:結合古典的雙層位勢(double-layer potential)表示法與一個針對 2-dilation 的微擾引理,對過去嘗試過這個猜想的人來說,或許是更平易近人的路線。值得注意的是,Lorist 與 Schwenninger 也揭露他們在探索證明策略時使用了 ChatGPT 5.6。
據 Townsend 與 Greenbaum 轉述,金醫師對這份獨立證明的反應是純然的欣喜:他形容那是對自己方法的有趣補充,並樂見兩個真正不同的證明幾乎同時問世。
為什麼這件事的意義遠超過一個猜想
數學界自己的定調,才是這個故事的核心。Townsend 與 Greenbaum——數值線性代數的頂尖專家——寫道:一個懸置多年的猜想,首先由一位沒有受過數學專業訓練的人、借助語言模型解決,這件事本身就很不平凡。僅僅幾年前,還難以想像 AI 系統能在重大猜想的證明中貢獻決定性的想法。現在,它發生了。
他們預期這類事件——圈外人借助 AI 做出重大貢獻——將日益普遍,即使驗證的重擔仍大部分落在專家肩上。他們在文末提出的問題,正是學術界如今被迫面對的:體系是否有能力消化可能即將湧現的大量成果?用他們的話說,這「肯定是應用數學黃金時代的開端」——但「應用數學家」這個身分的意義,可能即將徹底改變。
有兩點但書值得記住。第一,驗證仍然是由人類專家執行、緩慢進行;一個證明要等到 Crouzeix、Townsend、Greenbaum 這樣的專家檢查過後才算數。第二,這個成果驗證的是一種特定的模型使用方式——長時間自主運行、對抗式自我審計、禁用網路、強制探索異質策略——而不是隨手敲個 prompt。真正的功夫在於任務編排(orchestration),而金醫師這位沒有數學學位的醫師,或許剛寫下了這門技藝的奠基文獻之一。
Sources
- [1] https://alextownsend.net/essays/SIAMNews_CrouzeixConjecture.pdf
- [2] https://arxiv.org/abs/2608.03841
- [3] https://www.scmp.com/tech/tech-trends/article/3363966/chinese-doctor-stuns-maths-world-cracking-decades-old-problem-using-chatgpt
- [4] https://interestingengineering.com/ai-robotics/china-doctor-cracks-math-problem-with-chatgpt
- [5] https://github.com/jinshanmu/CrouzeixConjecture