← All posts / Research

倫敦 27B「AI 科學家」Faraday 擊敗 GPT-5.5 與 Claude 的論文重現能力

DeepMind 校友新創 Inherent 發布 Faraday——一個 27B 參數、以 rubric 式強化學習後訓練的 Agent,靠指揮前沿編碼 Agent 而非與之競爭,在重現科學論文結果上超越 Claude Opus 4.8 與 GPT-5.5。

倫敦 27B「AI 科學家」Faraday 擊敗 GPT-5.5 與 Claude 的論文重現能力

在所有由 Google DeepMind 校友創立的新創公司中,位於倫敦的 Inherent 一直沒有得到太多關注。這個情況在 2026 年 8 月 22 日改變了:這個剛以 5,000 萬美元種子輪資金走出隱身期的實驗室,發布了最新 AI Agent「Faraday」的成果——在獨立重現已發表科學論文研究結果這項任務上,超越了 Anthropic 與 OpenAI 體量大得多的前沿模型。

這個結果引人注目的不只是排行榜,更在於其背後的架構。Faraday 是一個 270 億參數的模型——以前沿標準而言非常小——基於 Qwen 3.6。它的優勢來自 Inherent 對它的後訓練(post-training):扮演「科學總監」的角色,把 OpenAI 的 Codex GPT-5.5 當作工具來使用,就像人類研究者依賴現成軟體、而不是事事自己動手寫一樣。

Replica 基準:310 個任務、100 篇論文、橫跨 36 年的科學

這項工作發表於論文《Training AI Scientists to Replicate Research》(arXiv:2608.13331,2026 年 8 月 13 日提交),作者團隊共 11 人,包括 Inherent 共同創辦人暨首席科學家 Edward Hughes。為了訓練與評測 Faraday,團隊打造了 Replica——一個自動生成的任務空間,包含從 100 篇機器學習與 AI-for-science 論文(1990 至 2026 年)中提取的 310 個圖表重現任務。

每個任務給 Agent 一篇將目標圖表遮蔽的論文、一個預裝研究函式庫的工作環境、網路存取權,以及有限的時間與算力預算。Agent 必須重現那張圖——而且從頭到尾看不到原圖。若實驗無法在預算內完成,Agent 需交付最忠實的縮小版實驗。資料切分為:242 個 ML 任務用於訓練,68 個保留的 AI-for-science 任務(2012–2026 年論文)用於測試。

這個設計精準瞄準了重現工作的難點。論文本質上是研究過程的「有損壓縮」——細節必然未被完整規範,補上這些缺口需要假設驅動的探索,而非模式匹配。而現有 Agent 因為高度針對規格明確、封閉式問題優化,恰恰在這裡卡關。

Rubric 式強化學習:用評審機制教會「研究品味」

第二個技術貢獻解決的是獎勵訊號問題:重現品質沒有單元測試可言。Inherent 的答案是自動生成的逐任務 rubric 評審(rubric-based judge)——一個編碼 Agent 依據從論文本身生成的評分標準,對每次重現嘗試打分,並透過多次取樣聚合來降低雜訊。團隊用專家人類排名驗證了這個評審(19 位參與者、76 組排名),確認它與人類評估一致且雜訊低——這正是把它當作強化學習獎勵訊號的前提。

有了獎勵訊號,Faraday 在 242 個訓練任務上以 GRPO 進行後訓練,並針對長視野(long-horizon)穩定性設計了完整的訓練配方。論文給出的成績單如下:

  • 在訓練分布內的 ML 任務上,Faraday 在 73% 的任務勝過 Claude Opus 4.8;在保留的 AI-for-science 測試任務上,勝率為 60%。
  • 測試集平均而言,比 Claude Opus 4.8 提升 6%、比 Codex GPT-5.5 提升 8%。
  • 對 Codex 做提示詞優化只能「些微縮小」差距——優勢來自後訓練,不是提示工程。
  • 在 rubric 評審認定 Faraday 佔優的那些執行紀錄上,人類專家獨立評分也認為 Faraday 是更強的科學家。

尤其關鍵的是公平比較的設定:Faraday 與未訓練的 Qwen3.6-27B 在同一個簡單 harness 中運行,兩者都能呼叫 Codex GPT-5.5 作為編碼工具。兩者唯一的差異就是 Replica 後訓練——精確隔離出強化學習到底買到了什麼。

是指揮官,不是碼農

最重大的發現可能是質性的。Faraday 並不試圖在底層超越前沿編碼 Agent;它學會的是指揮它們——判斷哪些實驗值得跑、如何規劃實驗的縮小版、以及什麼結果在科學上有意義。論文的執行紀錄分析結論是:Faraday「採取了更有科學原則的方法」。

這就是「編碼 Agent 即工具」(coding agent as a tool, CAT)模式:一個較小的模型,訓練來坐在前沿編碼 Agent 之上,提供後者缺乏的科學判斷層。Inherent 明確將此定位為對 harness 複雜度的反面押注——論文將成果定位為「邁向無需複雜 harness、即可進行長視野科學創新之 AI Agent 的墊腳石」。

公司進一步用兩種方式檢驗泛化能力。在全尺寸重現研究中——預先篩選 8 篇論文,確保每張圖可在 8 小時、8 張 B300 GPU 內重現——Faraday 在 8 個任務中贏了 5 個,勝過 Claude Opus 4.8。而在「想像中的重現」(由 Claude 生成真實論文的變體:同樣的論點、不同的資料集)上,Faraday 的優勢依然存在,暗示訓練成果可以遷移到背過的任務結構之外。

為什麼重要

三個層面的意義值得注意。

第一,前沿可能是一層編排(orchestration),而不是一個模型。一個 27B 模型,靠著正確的後訓練,透過委派執行工作,在一項高認知需求的任務上擊敗了體量大它許多倍的系統。如果這個模式能夠泛化——而 Inherent 的消融實驗顯示它無法靠提示工程達成——競爭護城河就會從原始模型規模,轉移到訓練配方與任務空間的設計。

第二,論文重現是切入 AI 科學的聰明楔子。正如 Inherent 所言,許多博士生就是從重現論文開始研究生涯的;這是科學界的標準學徒制。一個能自主完成這件事的 Agent——成本遠低於一名博士生——既立即有用(重現是長期瓶頸,也是可重現性危機的解方),又是通往原創發現的天然課程階梯。

第三,倫敦生態系持續複利成長。Inherent 的十幾名員工全部在 King’s Cross 的辦公室實體上班——這個街區因 DeepMind 進駐而蛻變為全球頂級 AI 重鎮。公司的 5,000 萬美元種子輪由 Index Ventures 與 Radical Ventures 領投,Hughes 斬釘截鐵地說:「我們相信倫敦就是該待的地方。」

限制與但書

論文的坦率令人耳目一新。人類研究的樣本很小(19 位參與者),而且雖然參與者在 63% 的爭議排名上站在 rubric 評審這邊,這個比例高於隨機、但未達統計顯著(p = 0.109)。評審本身是一個 LLM,因此仍存在某種循環論證的風險。此外,Faraday 的範圍是刻意受限的:僅限 in silico 任務、有限的時間與算力、不能碰實體實驗室設備——不過它可以上網,這是團隊在安全性討論中明確標記的選擇。

從新創角度也需要保留:一家剛走出隱身期的實驗室拿出一個強勁的基準結果,證明的是技術實力,還不是商業模式。但作為 AI-for-science 走向的訊號——受過品味訓練的小型指揮官,調度巨型執行者——Faraday 是迄今最乾淨的數據點之一。

Hughes 說,Inherent 的北極星是「打造 AI 科學家 Agent,並讓我們的 Agent 具備品味」。那種隊友會回來跟你說:「我對這件事很好奇,就去做了這些實驗。你覺得這些結果怎麼樣?」

從本週起,這種隊友確實存在了——而且它裝得進 270 億個參數。