← All posts / Research

被機器搶先一步:Claude 用約 2,000 美元算出九圈 N=4 超對稱楊-米爾斯振幅

Anthropic 兩位物理學家只給 Claude 一句提示和一週的 96 顆 CPU,它就超越平面 N=4 超對稱楊-米爾斯理論的人類八圈紀錄,並由紀錄保持人 Lance Dixon 驗證——北京團隊用 GPT-6 也在幾天內抵達同一目標。

被機器搶先一步:Claude 用約 2,000 美元算出九圈 N=4 超對稱楊-米爾斯振幅

9 月 25 日,Anthropic 在其科學部落格發表了一篇署名與語氣都很不尋常的客座文章。作者 Matt von Hippel 是理論粒子物理學家出身的科普作家,每週在 4gravitons.com 寫物理部落格。七週前的 8 月 7 日,他向各家 AI 實驗室公開下戰帖:「證明一個所有人都以為是瓶頸的計算極限,其實根本不是問題。給我們七圈的 N=8 超重力,或九圈的 N=4 超對稱楊-米爾斯。」而他宣布答案的文章標題簡單明瞭:「Yes, Claude can do Nine Loops」。

接下戰帖的是 Anthropic 內部的兩位物理學家 Liam Fitzpatrick 與 Siddharth Mishra-Sharma。他們在付費科學平台 Claude Science(一種用結構化規則與提示驅動 Claude 的 harness)中運行 Fable 5.1,只給了一句乾淨俐落的提示:「問題是計算平面 N=4 超對稱楊-米爾斯理論中,九圈的三條六邊形(six-particle/hexagon)振幅。」然後他們就去睡了。留下的常設指令是:「我要去睡覺,接下來幾個小時不會在。持續做下去,直到我叫你停。每 4 到 6 小時給我一次進度更新。」

Claude 工作了大約一週,以 Python 搭配 SymPy 跑相當於 96 顆 CPU 的運算,交付了平面 N=4 超對稱楊-米爾斯理論的六粒子散射振幅九圈結果——比 SLAC 的 Lance Dixon 在 2023 年創下的人類八圈紀錄再推進一圈。而且它用兩種獨立方法各算了一次:直接 bootstrap,以及經由 form factor 的間接路徑,任一條路徑對終端使用者的成本都約在一到兩千美元之間,其中 bootstrap 本身只花掉約 100 美元。

為什麼九圈重要

散射振幅是物理學家用次原子粒子動量與能量,預測粒子如何反應的公式。它難到幾乎所有實務計算都必須用「圈數」截斷的近似:圈數越多越精確,計算開銷也呈斷崖式上升。文獻中大多數振幅停在兩圈,少數到三圈;整個粒子物理中最精確的預測,大約是五圈。

N=4 超對稱楊-米爾斯是個「玩具模型」——它是描述電磁力、強核力、弱核力這三種基本力的楊-米爾斯理論之極端超對稱親戚。沒有人相信它描述真實世界;振幅學家(amplitudeologist)用它,是因為它的對稱性抵銷掉大量複雜度,成為新方法的完美測試賽道:方法若撐不過這裡的九圈,就更別想在真實的 QCD 上活下來。

Dixon 與 Andy Liu 在 2023 年抵達八圈,而且是間接抵達的——透過一個較容易的相關物件 form factor,以及一個稱為 antipodal duality 的奇特對稱性。整個領域的共識是:直接在九圈跑 bootstrap 太重了。如果標準配方再跑一圈是可行的,早就有人做了。Dixon 本人預期下一圈要靠另一種更間接的 AI 輔助方法才會出現。

機器跑完了配方,配方的作者負責驗收

實際發生的事是:Claude 從零開始、在無人監督下直接執行了 Dixon 的 bootstrap 配方。在標題為「被機器搶先是什麼感覺?」的附錄中,花了兩週驗證結果(主要透過從 Claude 的振幅反推九圈 form factor)的 Dixon 形容整套架構「非常脆弱:計算配方裡只要有任何一個錯,整個東西就會像烤失敗的舒芙蕾一樣塌掉」。他指出,許多建構細節「無聊到論文裡根本不會完整記錄」,所以 Claude 等於必須自己把那些遺失的膠水程式碼全部重建出來。

Dixon 的結論介於風度與不安之間。他寫道,Claude 是「另一種 transformer 模型,大概比我們自家客製的大一百萬倍以上」——他自己的團隊多年來也在用客製 transformer 預測更高圈數,口號正是「我們有工具可以驗證機器給的任何候選解答」。他斷言 Claude「對我們 2019 與 2023 年論文的理解,超越除了共同作者之外的任何人類」,並把這次結果定位成相互驗證:Dixon 驗證 Claude 的輸出,而 Claude 忠實使用他們的方法學,等於驗證了他團隊十年的工作。真正令人深思的時刻,他說,會是「大型語言模型開始在人類之前提出新的物理原理與洞見」的時候。

兩週內被搶先兩次

最離奇的轉折是:收斂到九圈的不只 Anthropic。在 Fitzpatrick 與 Mishra-Sharma 通知 von Hippel 之後幾天,北京中國科學院的何頌(Song He)也連絡了他——其團隊(與合作者 Jirong Jing、Xiang Li)已經算出九圈結果中稱為 symbol 的部分,並於 9 月 17 日發表。何頌團隊用 GPT-6 協助計算部分約束條件,但整體框架仍由人類搭建,不是 Anthropic 那種近乎放手的形式。Dixon 對他九月的總結是:「兩週內,我先被一台機器搶先,又被人類加一台機器搶先。」

這種「同時抵達」才是真正的訊號。兩個獨立團隊、使用不同實驗室的模型、在同一個月命中同一目標——一個全自主、一個 AI 輔助。正如 von Hippel 所說,重點不在 AI 發明了新方法;Claude「用的是已知方法,只是用了比以前的人更多的算力」。它可能受惠於選擇 Python 而非 Maple 或 Mathematica,以及比一般人類博士後更好的軟體工程紀律。真正的啟示是「世上垂手可得的果實比你想像的多」,而且那道感知中的算力高牆,有一部分是離問題最近的專家們共同持有的錯覺。

可靠性才是產品故事

對於還把 LLM 視為「錯誤太多、不能認真用」的人,von Hippel 給出了全文最鋒利的數據點。這是一次 one-shot 的運行:「沒有任何比『繼續做』更高明的科學監督」。他估計,如果他自己訂了 96 顆 CPU 一週的機器時間,「幾乎保證第一次會搞砸某個環節」,得用上兩週。他不知道 Claude 過程中犯了多少又自己修正了多少錯——但 harness 在沒有外部合作者介入的情況下跑到了終點。他提醒:三月時,AI 做物理還像個學生——小任務、需要手把手、錯誤百出。六個月後,它一次命中了「通常由振幅領域頂尖專家才會去碰的前沿計算」。

他同樣謹慎地指出這沒有回答什麼。他原本希望看到 AI 發明奇異的新方法、藉此一窺超級智慧辯論的全貌;結果他學到的「只是我對極限位置的想法太天真」。他懷疑真實世界的振幅計算——範圍更廣、競爭更烈、垂手果實更少——仍可能藏著更硬的牆,「但我不會赌這個」,而且他認為那些團隊現在就該測試 AI harness 能否 one-shot 自己的前沿題目,並備好驗證計畫。

對振幅社群,下一個問題很具體:新的前沿在哪裡,距離真正的目標——精確到能與即將到來的對撞機實驗相比較的預測——又近了多少?對其他人,頭條是經濟學:一個曾經佔據頂尖專家數年、取決於經費、博士後時數與脆弱的手工程式碼的計算,如今以一台筆電的價格、一週的雲端 CPU 就能重現。Dixon 團隊早就備好驗證工具,因為他們對自己承諾過能查核「機器提供的任何候選解答」。其他所有計算科學領域現在都面對同樣的準備題——而兩週內的雙重搶先已經說明,機器不會等答案出來才行動。