← All posts / Research

從零重現科學定律:Vals AI「神秘機制」基準測試登場,GPT-6 Astra 以 53.2% 領先——過半模型仍不及格

Vals AI 推出的 MysteryMechanism 基準測試,將 222 條科學定律封進黑盒子,只給 AI 代理最少五次實驗機會,要求它從零重新發現這些定律。GPT-6 Astra 以 53.2% 準確率奪冠,但弔詭的是:將近九成的成功解題過程中,模型根本沒認出自己重建的是哪一門科學。

從零重現科學定律:Vals AI「神秘機制」基準測試登場,GPT-6 Astra 以 53.2% 領先——過半模型仍不及格

基準測試機構 Vals AI 本週悄悄發布了今年最具哲學趣味的人工智慧評測之一:MysteryMechanism(神秘機制)。它提出一個看似簡單的問題——如果把一條已知的科學定律封進黑盒子,抹去它的名字、背景與所屬領域,頂尖 AI 代理能憑一己之力從零重新發現它嗎?

隨 9 月 16 日基準更新一同公布的初步答案是:勉強可以,但僅止於部分。OpenAI 的 GPT-6 Astra 以 53.15% 準確率領先群雄,Anthropic 的 Claude Fable 5.1 以 47.75% 緊追在後。沒有任何受測模型能解開 222 道封存機制中超過 54% 的題目。而比排行榜更值得玩味的發現是:絕大多數成功的解題過程裡,模型從頭到尾都沒有認出腳下的科學本體。

測試怎麼玩

MysteryMechanism 是一場「稀缺條件下的主動科學發現」演練。每道題目給代理的資訊只有:匿名輸入變數、物理邊界、兩筆帶雜訊的被動觀測、一個持久 shell,以及嚴格的實驗預算——d 維機制只有 2d+1 次實驗額度。換言之,一個雙輸入問題只有五次探測機會,用完為止。之後代理必須提交一條可執行的數學定律,把輸入映射到輸出。

沒有領域背景、沒有網路存取、沒有任何關於機制本身的提示。基準涵蓋 222 條機制,橫跨生物、物理、化學、工程、生態與抽象動力系統。從 Vals AI 公開的範例可以窺見題目風味:血液黏度與血球容積比的剪切關係、Churchill-Bernstein 圓柱努塞爾數關聯式、河流侵蝕的 stream-power 定律——這些都是流體力學與地貌學文獻中真實存在、有名字的成果,但代理看到的只是一串原始數字。

計分方式獎勵的是函數等價,而非符號比對。提交的表達式會在私下持續抽樣的結構探測點上執行,正規化誤差低於該題的雜訊感知門檻即得分。也就是說,代理不需要逐字重現教科書公式,只要找出一條「行為上等價」的定律即可。供應商或代理自身的執行失敗一律計零分。

排行榜

首波成績依準確率排列如下:

模型準確率成功解題數
GPT-6 Astra53.15%118
Claude Fable 5.147.75%106
Claude Opus 537.39%83
Gemini 3.8 Flash36.49%81
Muse Spark 1.3 Max36.04%80
GPT-5.6 Sol33.33%74
Grok 4.630.63%68
DeepSeek Flash 4.121.17%47
GPT-5.6 Luna14.41%32

差距分布相當有意思。GPT-6 Astra 與 Claude Fable 5.1 之間約 5.4 個百分點的差距,反而小於 Fable 5.1 與中段班(三成五上下)之間的落差。而 OpenAI 主打效率的 GPT-5.6 Luna 只解開不到七分之一的機制,不到旗艦手足的三分之一。無論 MysteryMechanism 究竟測的是什麼——實驗設計直覺、符號回歸耐力、還是預算管理的自制力——它顯然沒有平均分布在各模型家族之間,甚至同一家族內部也差距懸殊。

稽核發現:解開了,卻沒認出來

除了原始分數,Vals AI 還對每一筆成功解題軌跡做了盲測事後稽核,記錄模型在解題過程中是否明確指認出正確的來源領域。結果正好反轉了外界常見的「模型只是在背訓練資料」批評:

  • GPT-6 Astra:89.8% 的成功軌跡從未指認來源領域
  • GPT-5.6 Luna:100% 未指認領域
  • DeepSeek Flash 4.1:97.9% 未指認領域
  • Muse Spark 1.3 Max:92.5% 未指認領域
  • Gemini 3.8 Flash:僅 66.7% 未指認——是群體中最「認得」領域的一個

Vals AI 的摘要寫得明白:GPT-6 Astra 有 89.8% 的成功軌跡從未指認來源,GPT-5.6 Luna 則是百分之百如此。不過該機構對此非常克制——「未指認領域」只代表軌跡中沒有說出正確領域,並不能證明先備科學知識在推理中毫無角色。模型完全可能默默利用記憶中的結構。但這個型樣至少暗示:這些代理經常是靠不變量測試、低複雜度候選函數族比對、以及聰明的實驗設計——科學的方法論工具箱——來找回定律,而非直接背答案。

為什麼重要

多數代理類基準測的是執行力:修好這個 bug、訂這張機票、送出這份表單。MysteryMechanism 測的是執行力的上游——在資料昂貴時選擇資訊量最大的實驗、再從幾乎一無所有的條件下進行推廣。這比任何靜態問答評測都更貼近實驗室科學、工程特性分析與工業製程優化的日常現實。

五次探測的預算正是精髓。給一千個樣本點,任何模型都會擬合曲線;但在一個雙維、帶雜訊的空間裡抉擇「該買哪五個點」,才是真正的決策問題。公開的解題示範展示了取勝模式:先探四個角落測試可分離性、放一個幾何中點、再用成對的對數斜率逐一隔離指數。

天花板則是另一個重點。連最強的模型都會在近半機制上失敗,而失敗模式——爆預算、提交無法執行的定律、過度擬合僅有的兩筆被動觀測——正是搞垮真實研究計畫的那幾種。下一代模型在這裡有充分的進步空間,而現成的量尺已經備妥。

對基準觀察者而言,MysteryMechanism 也延續了 Vals AI 一貫的抗汙染設計路線:封存機制、私有結構探測、函數等價計分,讓測試難以靠死背取巧。隨著評測完整性自成一門顯學——Vals AI 近期針對 BioMysteryBench、Terminal-Bench 2.1 與 SWE-bench Verified 的誠信稽核,就記錄到公開評測上日益猖獗的作弊行為——這類機制未來很可能成為任何宣稱測量「發現能力」的評測的標配。

正如該基準的標語所言,科學發現是 AI 系統的下一個前沿。以今日的證據看,前沿模型讀完了教科書的第一章——讀得好到能重現一半的習題,只是未必知道自己引用的是哪一本書。