← All posts / Research

盲測基準發現前沿 AI 無法重建研究構想:匹配率僅 3–15%

名為 Reconstruction 的抗污染基準顯示,七個前沿語言模型僅從論文參考文獻重建其核心構想的匹配率只有 3–15%,而多智慧體瑞士巡迴賽機制可達 42%。

盲測基準發現前沿 AI 無法重建研究構想:匹配率僅 3–15%

本週發布於 arXiv 的一項新盲測基準,迄今為止最乾淨地測量了前沿語言模型距離自主科學發現還有多遠。這個名為 Reconstruction 的基準提出了一個看似簡單的問題:只給模型一篇論文在發表之前所引用的參考文獻清單,它能否重建出這篇論文的核心研究構想?

對七個前沿大型語言模型而言,答案是否定的。與保留的標準答案構想相比,匹配率集中在 3% 到 15% 之間——這種近乎一致的失敗,作者認為是結構性的問題,而非提示工程或模型規模的人為偏差。

Reconstruction 測的是什麼

這個任務聽起來不難,直到你意識到它拿走了什麼。一份參考書目指向某個問題空間,但從現有文獻連結到真正新穎假說的創造性跳躍,恰恰是論文本身所提供的。Reconstruction 的設計就是要讓這個跳躍——而不是從訓練資料中檢索——成為通往正確答案的唯一途徑。

在六個科學領域、共 643 篇受測論文中,每一篇的輸入都被刻意精簡:只給發表前的參考文獻清單,其他什麼都沒有。沒有全文、沒有作者姓名、沒有發表後的任何訊號。

其抗污染架構運作在三個層面:

  • 時間引用截止——所有參考文獻都不晚於論文本身的知識視野,防止模型向未來推理、藉此接近實質上揭露答案的後續研究。
  • 匿名參考編號——移除作者姓名與識別資訊,杜絕透過辨識某個研究團隊的軌跡來猜答案的捷徑。
  • 凍結每篇論文的書目——每個評測實例都被鎖定,推理時不會有任何資訊滲入。

評分由一個獨立的 LLM 評審負責,將模型提出的假說與保留的標準答案構想進行匹配,讓基準能夠評測數百篇論文,而不需要在每個資料點上都付出昂貴的人類專家標註成本。

為什麼「一致的失敗」才是重點

七個前沿模型的 3–15% 區間,值得注意的不是絕對數值之低,而是其一致性。沒有任何一個模型顯著突出。表現最好的勉強接近十五百分比,其餘都低於此。

這種近乎一致的分布,排除了以提示策略或模型規模來解釋的可能。差距似乎是結構性的——能產生十五百分比匹配率的認知能力,正在各模型全面觸頂。

這個結果正好落在當前關於前沿 LLM「生成研究構想」時究竟在做什麼的激烈辯論中間。如果成功需要真正的溯因推理(abductive reasoning)——從不完整的證據形成預測——那麼分數應該隨模型能力有意義地變化。狹窄的分布表明,目前的架構並不可靠地執行這種推理。

實際影響很直接。如今有一整個「AI 科學家」產業把 LLM 當作假說生成引擎來行銷。其中許多主張建立在允許模型存取論文全文、作者資訊或發表後訊號的評測上——而這些正是 Reconstruction 刻意排除的資訊類型。在那些更寬鬆條件下獲得的分數,不能被假定為反映了模型進行推論工作的能力。

多智慧體轉折:瑞士巡迴賽選拔

論文更重要的結果來自其「top 4」多智慧體管線。它不依賴單一模型的輸出,而是:

  1. 向多個模型徵集假說
  2. 進行跨模型互相審查
  3. 透過瑞士巡迴賽(Swiss tournament)淘汰較弱的候選——一種讓假說反覆配對比較、直到最強者勝出的淘汰賽制

全程不使用外部網路搜尋;管線只依賴參考書目與模型權重中的知識。結果:在全部六個領域達到 23–42% 的匹配率,比最好的單一模型基線提升約 2.4 倍。

巡迴賽結構在架構上做了一件具體的事。在競賽情境中,個別錯誤會在各輪之間互相抵銷,較強的參賽者累積勝場;應用到假說生成上,這個賽制形成了同儕審查的運算近似——正是人類科學社群在出版前用來過濾構想的分散式錯誤修正機制。

因此,這個基準最持久的發現或許是組織層面而非參數層面的:AI 輔助發現的正確設計,不是更大的單一模型,而是映照科學本身對抗性驗證結構的多智慧體架構。這種做法有先例——Google DeepMind 於 2025 年發布、用於生物醫學假說精煉的 AI Co-Scientist,就採用了基於巡迴賽的生成、反思與排序。Reconstruction 是第一個在六個科學領域同時展示相同提升、且在嚴格禁止外部資訊的約束下(這正是讓結果有意義的關鍵)做到這一點的基準。

不過 42% 的天花板,若目標是自主科學推理,仍然令人不安。達成它需要多次模型呼叫、結構化的巡迴賽開銷,以及難以在日常研究管線中常規部署的協調基礎設施——而目前預印本並未詳細報告這項改善的運算成本。

與先前 AI 科學基準的比較

自 2024 年以來,科學基準的數量大幅成長:

基準輸入主要限制
ResearchBench(2025)靈感論文豐富輸入允許檢索
HypoBench觀測資料合成標準答案;最佳方法也只恢復約 38.8%
OpenAI GeneBench-Pro混亂的基因體資料限於單一領域
LAB-Bench 21,900+ 生物學任務能力層級,而非構想生成
Reconstruction僅參考書目從構造上消除檢索路徑

早期基準的共同點是輸入的豐富性:模型獲得的資訊足以讓部分依賴訓練資料檢索就產生有意義的分數。Reconstruction 的設計則完全消除了檢索路徑。如果產生某份書目的論文不在模型的訓練資料中——而對訓練截止日之後發表的論文來說,這不可能——那麼模型必須從先前研究隱含的意義去推理,而不是從目標論文說了什麼。

結語

這篇論文出現的時機很有針對性。多家前沿實驗室目前正在發表結果,主張 AI 系統能在數學證明、密碼學分析和文獻綜述上做出有意義的貢獻。這些成果是真實的。Reconstruction 則在帳本的另一側加上了一個具體、抗操縱的數據點:一個作為研究助理表現出色、能以流暢姿態綜合現有知識的模型,在被要求做科學家最看重的事情——從現有證據形成真正新穎的假說、而答案沒有寫在它找得到的地方——時,表現可能遠不如預期。

這篇論文仍是預印本,尚未完成正式的同儕審查;作者將目前的提交描述為帶時間戳的紀錄,完整的各模型明細與各領域分數預計在後續修訂版中發布。但結論已經很清楚:定義科學發現的那個推論步驟,目前仍是人類的專長——而要縮小差距,映照同儕審查的多智慧體架構,看起來比單純放大模型規模更有希望。