← All posts / Research

細胞的語言:Biohub 18 億美元「虛擬生物學」計畫,把 Google、Meta 與美國政府拉進同一張桌

Meta、Google DeepMind、Isomorphic Labs、美國能源部與 NIH 共同投入 18 億美元,擴大 Biohub 的虛擬生物學倡議,打造訓練細胞預測 AI 模型所需的開放資料集。

細胞的語言:Biohub 18 億美元「虛擬生物學」計畫,把 Google、Meta 與美國政府拉進同一張桌

現代科學史上最奇特的聯盟之一在本週成軍:馬克・祖克柏支持的非營利研究機構 Biohub 宣布,Google DeepMind、Meta、AI 藥物研發新創 Isomorphic Labs、美國能源部(DOE)與國家衛生研究院(NIH)將共同投入 18 億美元,目標只有一個——產生足以訓練「能預測活細胞行為」的 AI 系統所需的生物資料。

這個名為「虛擬生物學倡議」(Virtual Biology Initiative)的計畫,瞄準的是 AI 領域最困難的開放問題之一:打造能夠精細模擬細胞的模型,讓研究人員可以在投入數年實驗室工作與數百萬美元實體實驗之前,先在數位世界裡驗證想法。Biohub 將這項承諾形容為迄今最大規模、針對「AI-ready 生物資料」的協調性投入。

18 億美元從哪裡來

這筆資金從好幾個方向同時湧入:

  • Biohub 本身早在今年 4 月就由祖克柏與 Priscilla Chan 出資,承諾投入 5 億美元。
  • Google DeepMind、Isomorphic Labs 與 Meta 合計出資 3 億美元。
  • 美國能源部計畫在五年內投入超過 5 億美元,用於實驗室量測、建模、運算與細胞研究。
  • 國家衛生研究院則帶來過去透過超過 5 億美元聯邦經費所建立的資料集與儲存庫。

加總起來,約 18 億美元的承諾橫跨新資金、既有資料集、運算資源與新型量測技術。NVIDIA 也提供運算基礎設施與技術支援,不過並未列入出資者名單。

為什麼 AI 生物學在鬧「資料饑荒」

這項押注反映了計算生物學一個不舒服的事實。AI 已經徹底改寫了蛋白質結構預測——AlphaFold 系列與 Meta 的 ESM 模型能以驚人準確度摺疊蛋白質——但要預測一整個活細胞,是完全不同量級的問題。

現有的資料集涵蓋數億顆細胞的資訊。Biohub 的研究人員認為,真正有用的預測模型,可能需要涵蓋數十億、最終甚至數兆顆細胞與細胞狀態的資料。這項倡議將收集細胞在環境變化、基因修飾、藥物與其他干預下的反應資料,採用的技術包括空間轉錄體學(spatial transcriptomics)、先進顯微鏡、冷凍電子斷層掃描(cryo-electron tomography)與大規模細胞篩選。

「我們需要捕捉生物學的語言;我們需要捕捉細胞的語言。而這個語言今天根本不存在。」Biohub 科學負責人 Alex Rives 向路透社表示。

這個願景把生物學研究變成某種更接近「模擬」的科學。研究人員可以先問模型:某個細胞對某個候選藥物或基因編輯會有什麼反應?再根據答案決定哪些實驗真正值得送上實驗檯。「一個準確的生物預測模型,能讓科學家以數位方式進行實驗,大幅加速科學發現。」Rives 說,「由此而來的洞見,將讓我們更深入理解疾病,並開啟全新的治癒路徑。」

時程與開放資料條款

Biohub 預期計畫的第一批資料集約一年內問世,並表示準確的預測模型可能在五年內出現——對一個「快了」通常意味著「十年後」的領域來說,這是非常激進的時程。

資料治理採取務實的折衷:資料集預期將公開,但出資的部分私人企業,會在資料廣泛釋出前獲得一段有限的提前使用期。相對地,政府出資產生的資料不會有這類限制。對於深陷專有訓練資料競賽的 AI 實驗室而言,搶先幾個月拿到數十億筆細胞量測數據是相當有吸引力的胡蘿蔔;而對研究社群來說,最終的開放釋出意味著這些資料終將為所有人疊加複利。

罕見的廣泛聯盟

合作夥伴名單簡直是生物學與 AI 界的夢幻隊伍。除了出資者,參與的研究機構還包括 Broad Institute、Allen Institute、Human Cell Atlas、Human Protein Atlas、Gladstone Institutes 與 Wellcome Sanger Institute。

這項倡議也落在 AI 投入生物學的更大浪潮之中。Anthropic 已建立濕實驗室(wet-lab)能力,OpenAI 基金會則推出了總額超過 1.25 億美元、瞄準生物與醫療資料集的補助計畫。換句話說,Biohub 的計畫追逐的瓶頸,正是好幾家前沿實驗室各自獨立發現的同一件事:科學家從未量測過的生物行為,AI 無從學起。

真正的瓶頸不是算力

這正是整場發布最有趣的地方。過去三年,AI 的限制因子多半是算力——GPU、電力與資本。生物學把這個等式反了過來:如果沒有人以足夠的解析度與規模量測過肝細胞對某個新化合物的反應,再多的參數規模化也教不會模型這件事。

如果虛擬生物學倡議成功,下一個重大的 AI 突破,可能不是來自打造更大的模型,而是來自給現有模型一幅遠比今天豐富的生命圖像。這是一場豪賭:下一世代重要的「世界模型」,訓練素材不是實體世界的影片,而是一絲不苟量測出來的細胞內部——而出資支持「量測」而不只是「訓練」的組織,將能形塑接下來的一切。

當然,風險依然存在。協調型巨型科學計畫的歷史成績好壞參半,生物學領域的五年時程向來容易延宕,而相對於真正繪製數兆個細胞狀態的成本,18 億美元只是零頭。但作為一個訊號——前沿實驗室認為下一堵牆在哪裡:是資料,不是算力——本週的這場發布,已經再清楚不過。