會指揮 GPT-5.5 的 270 億參數「AI 科學家」:Inherent 的 Faraday 與 Replica 基準深度解析
倫敦新創 Inherent 證明:用長程強化學習後訓練的 270 億參數代理,能在論文重現任務上擊敗 Claude Opus 4.8 與 GPT-5.5——靠的不是自己寫程式,而是學會指揮那些比自己大上幾個數量級的前沿模型。
1821 年,Richard Phillips 請他的朋友邁克爾・法拉第(Michael Faraday)撰寫一篇關於新興電磁學領域的綜述。法拉第是個奇怪的選擇——他幾乎沒受過正規教育,在該領域經驗有限,但他是出了名的實驗高手。為了寫這篇綜述,法拉第決定親手重現過去的實驗結果。在皇家研究院燭光搖曳的地下室裡,他發現通電的導線會繞著磁鐵轉動。「非常令人滿意,」他在日記裡寫道。電動機就這樣誕生了。
兩個世紀後,一家名為 Inherent 的倫敦 AI 實驗室同時借用了這個名字和方法。8 月 14 日,該公司發表研究,介紹了 Faraday——一個 270 億參數的「AI 科學家」代理。在重現已發表研究這項任務上,它擊敗了 Anthropic 的 Claude Opus 4.8 和 OpenAI 的 GPT-5.5,而這兩個模型的規模比它大上幾個數量級。一週後,TechCrunch 對這家公司做了深度報導,主流輿論才跟上。但這些結果值得比頭條更深入的審視。
Faraday 究竟做什麼
任務定義很明確:給定一篇研究論文,重現其中一張圖表——在有限的時間與運算預算內,而且看不到原始圖形。沒有答案可以對照。代理必須讀懂方法章節、設計實驗、撰寫程式、執行程式,最後產出一張忠實重現論文結果的圖。
為了讓這件事可以大規模訓練,Inherent 推出了 Replica 基準:從 100 篇機器學習與 AI-for-science 論文中提取的 310 項任務,橫跨自然語言處理、材料科學、結構生物學、天氣預測與元學習(meta-learning)。這是一個刻意設計成「規格不完備」的長程挑戰——恰恰是前沿代理歷來最容易失手的問題類型。
數字相當驚人:在 Replica 的分布內任務上,Faraday 在 73% 的任務中勝過 Claude Opus 4.8,並且在保留的(held-out)AI-for-science 論文上維持領先——這些是基礎模型在預訓練時從未見過的研究。優勢在元學習、結構生物學與材料科學領域最為明顯。更值得注意的是,面對最新的研究,Faraday 比前沿基線模型退化得更少——這暗示它學到的是可遷移的科學能力,而不是把文獻背進了權重裡。
反直覺的架構
真正值得重新思考代理設計的是這一點:Faraday 把 GPT-5.5 Codex 當工具用。
這個 270 億參數的「科學家」自己並不寫太多程式。就像依賴編碼代理的人類博士後一樣,Faraday 負責拆解問題、決定哪些實驗值得跑,然後把實作工作委派給 OpenAI 的前沿編碼模型。更不可思議的是,Inherent 展示了 Faraday 能在測試時泛化到指揮一個更強的代理——它訓練時只搭配過 GPT-5.4-mini,卻能無縫適配 GPT-5.5 Codex。
換句話說,小模型不是在跟前沿模型競爭,而是在管理前沿模型——而且這個組合打得贏單獨作業的前沿模型。Inherent 的論點是:隨著編碼代理持續進步,坐在其上的那一層——科學判斷力——價值只會越來越高。這是今年夏天整個代理生態系裡悄然成形的「編排勝過規模」論點中,一個早期而具體的數據點。
用評分細則教「品味」,而不是教答案
最深層的技術貢獻,在於 Inherent 如何處理 AI 科學的核心難題:開放式研究無法自動驗證。 一張像素級完美的重現圖仍然可能是糟糕的科學——實驗設計不良、對論文主張的詮釋失真、運算資源浪費。好的重現需要研究者所說的「研究品味」(research taste)。
Inherent 的解法是設計一個 LLM 評審,依據自動生成的逐任務評分細則(rubric)打分,並用一項專家人類研究驗證這個評審確實捕捉了專家偏好。原始的 LLM 評審出了名地不穩定——評審模型本身的隨機性會讓獎勵訊號抖動,進而破壞長程強化學習的穩定性。逐任務細則降低了這種雜訊。另外兩項訓練期修改——多次取樣聚合(multi-sample aggregation)與回合級功勞分配(turn-level credit assignment)——則馴服了通常會讓數週長的訓練失控的不穩定性。
最終成果是一個透過長程強化學習內化了科學嚴謹性的代理:不需要人工編寫的演化式框架(evolutionary harness),也沒有測試時獎勵。早期那些「AI Scientist」系統(Sakana 那一脈)依賴外部程式化的搜尋迴圈;用 Inherent 的說法,Faraday 的發現行為是內在的——是學出來的,不是寫死的。
從重現到創新
重現看起來像墊腳石,而 Inherent 也明說它就是。論文只描述有效的做法,從不寫出作者一路走來的負面結果。要重現論文,代理必須找回那「從不出現在紙面上的 99% 汗水」——而這需要的假設驅動探索,正是產生真正新科學的同一種能力。
Replica 的任務空間就是為了層層升級而設計的:從給代理的論文裡移除更多特徵、收緊或放寬資源限制,最終甚至給代理想像出來的論文——該公司說,這會讓同一個 Faraday 模型「在不知情的狀態下創新」。
背後的公司
Inherent 於 2026 年 5 月走出隱身狀態,完成由 Index Ventures 領投、Radical Ventures 跟投的 5,000 萬美元種子輪。這家位於倫敦國王十字車站附近的實驗室由四位 DeepMind 前研究員創立——首席科學家 Edward Hughes、Louis Kirsch、Kaloyan Aleksiev,以及曾在拜登白宮參與 AI 政策的 Tantum Collins。公司以公共利益企業(public benefit corporation)形式運作,目前約十來人,計劃年底前擴編至 20–25 人——在 DeepMind 重組後的人才動盪中,這裡成了頗具吸引力的落腳處。
Hughes 這樣定位目標:不是做一個只會說好聽話的 AI,而是做一個會回來對你說「我對這件事起了好奇心,自己去跑了這些實驗,你覺得這些結果如何?」的隊友。
不能忽略的但書
Replica 是 Inherent 自家的基準,由 Inherent 自己執行、自己評分。Claude Opus 4.8 與 GPT-5.5 的比較至今沒有獨立第三方重跑過,而那 47 頁方法論的前提是「該公司的評審確實捕捉了專家品味」。最顯而易見的質疑——Replica 那 100 篇來源論文有多少可能早已存在 Qwen 3.6 基礎模型的預訓練資料裡——雖然在某種程度上被保留集結果回應了,但若能在 MLE-Bench 這類公開基準上看到第三方重跑,說服力會大得多。
不過方向是對的,而且架構本身就是故事:一個小型的開放權重模型,後訓練出判斷力,去編排那些單獨作業時會被它擊敗的前沿編碼器。如果這個模式成立,AI 輔助科學裡的稀缺資源將不再是寫程式的能力,而是知道什麼值得嘗試——而 2026 年這批 AI 科學家,已經開始學的正是這件事。
Sources
- [1] https://inherentlabs.ai/research/training-to-replicate
- [2] https://arxiv.org/html/2608.13331
- [3] https://techcrunch.com/2026/08/22/inherent-founded-by-deepmind-alumni-says-its-ai-teammate-just-outperformed-anthropic-and-openai-at-replicating-research/
- [4] https://aiweekly.co/alerts/inherent-says-faraday-tops-claude-gpt-55-at-paper-replication