AlphaGo 推手回歸:Thore Graepel 創辦 Metis Reasoning,募資千萬美元押注「會思考的機器」
AlphaGo 共同創造者 Thore Graepel 離開 Google DeepMind,創辦 Metis Reasoning——他押注的不是更大的語言模型,而是 AlphaGo 式的搜尋與規劃,要讓機器在真實世界中權衡、計畫並行動。
當整個產業的預設答案是「更多參數、更多 token」時,有一位 AlphaGo 背後的推手決定押注另一條路。
Bloomberg 於 9 月 24 日報導,AlphaGo 共同創造者、今年夏天離開 Google DeepMind 的研究主管 Thore Graepel,正在為新創公司 Metis Reasoning 募集數千萬美元。這家公司的目標是:打造能夠面對陌生問題並選擇行動的人工智慧,應用領域鎖定機器人、科學與工程。據悉後續還計劃以更高估值再募一輪數億美元——不過知情人士也提醒,融資的結構與規模都仍可能變動。
公司的名字本身就是一份宣言。在希臘神話中,Metis(墨提斯)是掌管智慧與深思的泰坦女神——那種能將聰明才智落地為實際行動的智慧。這正是 Graepel 想傳承的譜系。
讓機器學會推理的人
Graepel 的職業生涯,幾乎就是這一波 AI 浪潮的前傳。他在漢堡、倫敦帝國學院與柏林接受物理學訓練,2001 年取得機器學習博士學位。2003 年起在微軟研究院任職,共同創立了 Online Services and Advertising 研究群,他的機率推理系統在超大規模場景中落地:TrueSkill 是 Xbox Live 背後的配對評分系統,AdPredictor 則是 Bing 的點擊率預測模型。兩者都以因子圖上的訊息傳遞為基礎——道地的貝氏推理在做工業級的重活。
之後他加入 DeepMind,成為打造 AlphaGo 團隊的一員——那個在 2016 年成為第一個在全尺寸圍棋盤上擊敗職業棋手的程式。要知道,在它成真之前,多數研究人員認為這一天還要再等十年。他隨後參與了 AlphaGo 的後繼者們:完全從自我對弈中學習、不需任何人類棋譜的 AlphaGo Zero;將方法泛化到西洋棋與將棋的 AlphaZero;以及連規則都不用被告知就能精通遊戲的 MuZero。
他的個人網站(已為新創業更新)如此描述這條主線:把「AlphaGo 式的推理帶進前沿 AI,讓機器能在不確定下規劃並行動」。離開 DeepMind 後,他曾主持 Altos Labs 的細胞回春機器學習團隊,也在 Google DeepMind 的 Post-AGI 團隊待過一段時間,同時擔任倫敦大學學院(UCL)機器學習講座教授。如今,這些線索——搜尋、習得的判斷力、多智能體系統、生物學——在 Metis 匯流。
技術賭注:搜尋勝過規模
為什麼這不只是「又一間獲得巨額融資的實驗室」?因為 Metis Reasoning 在此刻做出了一個旗幟鮮明的架構押注——而當下產業對各種能力缺口的標準答案,向來都是「再大一點的模型」。
大型語言模型的核心,是從人類撰寫的文字中預測下一個詞。Graepel 的專案則主張:「搜尋與習得的判斷力,並不在乎不確定性從何而來——是棋賽的搜尋樹、一個細胞,還是一個正在決定下一步的智能體。」AlphaGo 的配方從來不是一個巨大的神經網路,而是三件事的組合:一個提出候選的 policy、一個衡量局勢的 value function、一棵向前看的搜尋樹。正是這個組合——習得的直覺融合刻意搜尋——催生了對李世乭第二局的第 37 手:那記五路肩衝,人類講評起初稱之為失誤,隨後才驚覺是傑作,一手沒有人類會下的棋。
Metis Reasoning 的主張是:這個配方可以遷移——遷移到必須在物理不確定性下規劃的機器人、到「搜尋樹」其實是實驗空間的科學問題、到必須在承諾之前權衡選項的工程系統。這實質上是一套「後 LLM 論」:系統從自身的行動中學習、在行動之前深思熟慮,而不是從人類文字中插值。
正被資本投資的 DeepMind 出走潮
Graepel 的離開並非孤立事件,投資人早就注意到了。在他之前,曾領導 DeepMind 強化學習團隊的 David Silver 已於今年 4 月為 Ineffible Intelligence 募得 11 億美元(估值 51 億),由紅杉與光速共同領投,NVIDIA 與 Google 均有參與。Yann LeCun 的 AMI Labs 今年 3 月以 35 億美元投前估值募得 10.3 億美元,打造能預測環境如何回應行動的「世界模型」。而由三位 DeepMind 老將於 8 月創立的 Emulate,正洽談以 37 億美元估值募資至多 7 億美元——這已是今年從 DeepMind 倫敦辦公室 spin out 的第三間獲得九位數融資的實驗室。
融資結構本身就是時代的註腳。「分批募資」(tranched rounds)正在 AI 新創圈蔓延:新實驗室想要高估值來宣示信心、吸引人才,而早期投資人則想趁後續投資人進場拉高價格前,先用低價卡位。Metis Reasoning 計劃中「先數千萬、後數億」的兩段式募資,正是這套劇本的標準演出。
後續觀察指標
Metis Reasoning 尚未推出任何產品,融資洽談也被描述為初步階段。但對於任何想描繪前沿 AI 下一章的人,以下訊號值得持續追蹤:
- 領域選擇。 機器人、科學與工程,是純粹的下一詞預測最吃力、而規劃真正有回報的領域——而且物理與實驗的反饋迴路,恰好提供強化學習最需要的試錯訊號。
- 運算效率。 如果 AlphaGo 式搜尋真能與前沿規模的模型組合,就有機會以遠低於暴力訓練的成本換取能力——隨著純規模路線的經濟學日趨緊繃,這個命題的吸引力逐季上升。
- 人才磁吸。 一位手握 AlphaGo、AlphaZero、MuZero 戰績、外加 UCL 講席的創辦人,會吸引那些想研究「能動手的智慧」而非聊天機器人的研究者。在這個市場,這本身就是護城河。
- 可驗證性。 原則上,以規劃為基礎的系統比不透明的龐然大物更容易檢視——你可以攤開那棵搜尋樹。若安全監管機關日益要求可解釋的決策過程,這將不只是倫理優勢,更是商業優勢。
結語
十年來,AlphaGo 這個譜系——搜尋加上習得的判斷力——多半活在棋類引擎與研究 demo 裡,而產業資金狂湧向語言模型。Graepel 的 Metis Reasoning 是迄今最清晰的訊號之一:嚴肅的資本與嚴肅的血統,正在匯聚到一個想法上——下一次能力躍升,來自教會前沿模型「深思熟慮」:在不確定下規劃、權衡、行動,而不只是預測。
Metis 會成為下一個 DeepMind,還是只是一則腳註,取決於尚無人能看見的執行力。但這個賭注本身,已標記了 AI 地板板塊的移動:從聊天視窗,走向真實世界。
本文根據 Bloomberg(2026 年 9 月 24 日)、PYMNTS 及 AI Weekly 的報導撰寫;生平細節來自 Thore Graepel 個人網站。
Sources
- [1] https://www.bloomberg.com/news/articles/2026-09-24/ex-deepmind-researcher-thore-graepel-raising-funds-for-ai-reasoning-startup
- [2] https://thoregraepel.github.io/
- [3] https://www.pymnts.com/news/artificial-intelligence/2026/deepmind-alumni-draw-investors-beyond-large-language-models/
- [4] https://aiweekly.co/alerts/alphago-co-creator-thore-graepel-raises-tens-of-millions-for-ai-reasoning