← All posts / Research

沒有數學學位的神經外科醫師,用 16 小時的 ChatGPT 自主運算攻克 22 年懸案 Crouzeix 猜想

北京協和醫院神經外科住院醫師金杉木讓 GPT-5.6 在 ChatGPT 工作模式中自主運算約 16 小時,證明了自 2004 年以來懸而未決的 Crouzeix 猜想,且已獲提出者 Michel Crouzeix 本人的初步驗證。

沒有數學學位的神經外科醫師,用 16 小時的 ChatGPT 自主運算攻克 22 年懸案 Crouzeix 猜想

2026 年 7 月 30 日,華盛頓大學應用數學系教授 Alex Townsend 如常打開 arXiv。過去一年來,他養成了一個近乎執念的習慣:每隔一陣子,就把 Crouzeix 猜想餵給 GPT-5.6,看看模型能不能在這個數值線性代數領域最頑強的懸案上有所推進。數百次嘗試的結果,AI 給出的答案不是佈滿邏輯漏洞,就是卡死在同一個關鍵引理上。

這一天不一樣。猜想被證明了,而作者不是數學家——是北京協和醫院神經外科的博士後研究員兼住院醫師金杉木(Shanmu Jin),沒有任何高階數學的正規訓練。他唯一的合作者是 GPT-5.6:在 ChatGPT 的工作模式中,模型全程無人干預,自主運算了約 16 個小時。

到八月中旬,這個故事已經從中國科技媒體傳到《南華早報》,再傳到數學家們的社群動態。Townsend 與 Anne Greenbaum——這個領域的兩位頂尖專家——讀完證明後給出的形容只有兩個字:「震驚」。而最引人注目的是:審閱手稿並確認證明正確的人之中,包括 22 年前提出這個猜想的法國數學家 Michel Crouzeix 本人。

一個門外漢闖入矩陣分析

金杉木的履歷與數學毫無關係:大學部念地質學,之後轉攻醫學、取得醫學博士,落腳神經外科。他在寫給 Townsend 與 Greenbaum 的信裡雲淡風輕地說:「其餘的數學知識全靠自學。」

他接觸到這個猜想的起點更不可思議——經顱超音波研究。為了模擬超音波如何穿透人類複雜的顱骨結構,金杉木一頭栽進「矩陣分析」的天地,然後撞上了 Crouzeix 猜想:一個陳述極度簡潔、證明卻讓頂尖學者苦熬二十年的問題。這種「題目簡單到優美、難度深到絕望」的反差,恰恰勾住了這位跨域的門外漢。

為什麼 Crouzeix 猜想重要

要理解數學界的震動,得先知道猜想說了什麼。矩陣是應用數學的通用語言——從量子態的演化、Google 的 PageRank 演算法,到今日訓練大型語言模型時超大規模的參數迭代,本質上都是巨大矩陣在複數平面上的投影與演化。但「非正規矩陣」的行為極其詭異,馴服它們是應用數學的長期難題。

2004 年,Michel Crouzeix 提出一個極具幾何直覺的猜想:對複數平面上任何多項式 p 與任何矩陣 A,p(A) 的譜範數可以被 p 在 A 的數值範圍 W(A) 上的最大值乘以 2 所界定:

‖p(A)‖ ≤ 2 · maxz ∈ W(A) |p(z)|

而且 2 就是最佳常數。這條不等式若成立,就能把複數平面上的純量逼近誤差,直接轉換成矩陣函數的範數上界——對矩陣函數分析、GMRES 迭代法與 Krylov 子空間方法等,都具有決定性的意義。

進展卻無比緩慢。2007 年,Crouzeix 本人竭盡全力,只證出常數為 11.08 的版本。2017 年,美國數學研究院(AIM)在聖荷西舉辦為期一週的專題研討會,集結全球頂尖專家,Crouzeix 與合作者 Palencia 最終把通用常數降到 2.414(即 1 + √2)。此後人類的工具箱彷彿用盡了潛力,通往常數「2」的大門又緊閉了十年——直到這個夏天。

證明背後的提示詞工程

整個故事裡最具實務價值的部分,是金杉木如何把 GPT-5.6 推過終點線。他不是把模型當問答機,而是把它改造成一座虛擬數學研究院——借鑑並改造 OpenAI 當年進攻 Cycle Double Cover 猜想時的著名提示詞。布局有四大戰略支柱:

  1. 切斷網路。 提示詞明確隔離公開網路與外部脈絡。金杉木不要模型去「抄」人類史上那些失敗的舊思路,而是逼它從公理出發,進行純粹的原創思考。
  2. 多分支發散思維。 他要求 ChatGPT 啟動大量平行的「子代理」,沿完全不同的路徑探索,並明確警告:不得過早收斂到同一個看似誘人的點子上!
  3. 殘酷的對抗審計。 候選證明策略必須反覆接受其他分支的對抗性審查;唯有當別的代理成功找到反例,一條路線才被徹底淘汰。
  4. 堅持到底的決心。 提示詞下了死命令:在得到一個能承受極端邏輯檢驗的完整證明之前,絕不放棄。

設定完成後,金杉木按下 Enter,轉身回去處理臨床工作,全程未再介入。GPT-5.6 在數學的深海裡連續運算了約 16 個小時,帶回了一份證明。Crouzeix 審閱手稿後確認證明正確——不過必須強調,這項工作尚未通過正式的期刊同儕審查。

同一週出現的第二份獨立證明

故事還有個轉折。就在金杉木的結果流傳的同時,arXiv 上也出現了 E. Lorist 的論文《A solution to Crouzeix’s conjecture》(arXiv:2608.03841),將先前為較弱估計所發展的工具與一個新的擾動引理結合。一個 22 年的懸案,短短几天內出現兩份獨立的證明主張——一份來自職業數學家,一份來自一位拿著 LLM 的醫師——這種巧合讓人不禁想問:還有多少問題正悄悄變得可以攻堅?

兩份證明都仍需等待同儕審查的慢速機制檢驗,保持懷疑是健康的:歷史上不乏宣稱證明著名猜想、最後在檢視下崩塌的案例。但猜想提出者本人的初步背書,份量非同小可。

對 AI 輔助數學的啟示

把主角的特殊性拿掉,真正重要的是這個模式。致勝方程式不是單純的模型能力,而是:

  • 一位有動力的領域專家:他對問題的理解足以判斷什麼才是一次認真的嘗試
  • 精心設計的編排:隔離過時的先前工作、強制探索多條證明路徑、對抗式自我審查、以及持久力
  • 長時間的自主運算——連續 16 小時不間斷的算力投入,是任何人類數學家都無法匹敵的「努力」規模

這已是今年第二次有前線模型攻克具名的公開難題——上一次是 OpenAI 在五月推翻了一個 80 年歷史的離散幾何猜想。軌跡很清楚:模型正從「證明助理」與「假說產生器」,晉升為數學發現的主力引擎——前提是有人懂得如何瞄準它們。

金杉木的結果也重新定義了「誰有資格做數學」。前沿研究的門檻,正從學歷認證與多年專業訓練,轉移到問題品味、編排技巧與驗證結果的判斷力。一位地質系畢業、拿著手術刀的神經外科醫師,靠一份結構嚴謹的提示詞,打敗了十年的專家研討會投入。工具是最大的平等化力量;知道該這樣使用工具的洞察力,才是真正的差異所在。

Crouzeix 猜想是否真正塵埃落定,將由未來數月的同儕審查決定。但後設結果——一個自學成才的門外漢,憑一把手術刀和一個訂閱帳號,就能認真攻打一個領域最困難的問題——已經成立。