← All posts / Industry

把演化變成訓練資料:Basecamp Research 募得 1.4 億美元,押注可程式化的生物學

倫敦的 Basecamp Research 完成 8 億美元估值、1.4 億美元的 C 輪融資,S32 領投,NVIDIA 與 Anthropic 的 Anthology Fund 均參與。其 EDEN 生物基礎模型以來自 30 多國、15 兆 DNA token 的資料訓練,設計出的抗生素已在小鼠實驗中比擬最後一線藥物。

把演化變成訓練資料:Basecamp Research 募得 1.4 億美元,押注可程式化的生物學

週三,Basecamp Research 宣布完成 1.4 億美元的 C 輪融資,使這家位於倫敦的 AI 藥物開發公司估值達到 8 億美元。根據路透社、《GEN News》與《The Decoder》的報導,本輪由 S32 領投,NVIDIA、Anthropic 旗下的 Anthology Fund、北約創新基金(NATO Innovation Fund)與 Redalpine 等機構參投。

這份投資人名單,簡直是 2026 年 AI 權力版圖的縮影——一家晶片巨頭、一家前沿實驗室、一個國防導向的主權基金,再加上一家歐洲深科技創投——全都押注在一家核心資產並非語言模型、而是「自然資料庫」的公司上:從雨林土壤、火山地熱區、溫泉到南極外海深海採集的遺傳物質,而且每一個採樣點的化學與生態環境條件都一併記錄在案。

這筆錢要買什麼

成立於 2020 年的 Basecamp,將把資金投入兩件事:訓練新一代 EDEN 生物基礎模型,以及將自家的治療候選藥物推向臨床開發。第一個目標是「體內」(in vivo)細胞療法——直接在患者身體內部改造細胞的基因治療,而不是在工廠裡。

這個定位精準打在一個痛點上。CAR-T 細胞療法需要先抽出患者的免疫細胞、在體外基因改造、擴增培養、再輸回體內對抗癌症,每位患者的成本可高達數十萬美元,主因就是這個「體外製造」環節。如果 EDEN 設計的基因插入工具能直接在患者體內完成改造,整個領域的經濟學都會改寫。

資料論點:生物學的高牆,是資料的高牆

技術長 Philip Lorenz 用一個數字框架化公司的策略。語言模型的訓練語料,據 Epoch AI 估計上限約為 5 千兆(quadrillion)token——所有人類寫過的文字總量。而 Basecamp 估計地球上的核苷酸數量是 10 的 37 次方。「如果你拿 10^37 張撲克牌疊起來,那疊牌可以繞可觀測宇宙一百萬圈,」Lorenz 告訴《The Decoder》。沒有人需要那種規模的資料集——但它說明了生物 AI 還有多早。

公開基因體資料庫也撐不起這個重任。Basecamp 自家的 BaseData 論文發現,美國 NIH Sequence Read Archive 中約 68% 的序列資料來自區區五個物種;人類就佔了 54%。「如果你只拿 1975 年的報紙文章來訓練 LLM,那會是一個非常、非常糟的模型,」Lorenz 在 Microsoft 的案例研究中說。「這就是我們在生物學的處境。」

所以 Basecamp 自己採集資料。這個網路如今橫跨 30 多個國家、七大洲——Microsoft 的統計是 31 國 208 個參與組織——而資料集目前約有 15 兆 token,這裡的一個 token 是一個 DNA 鹼基。這已經和前沿聊天機器人的文字訓練集同一個數量級。未來一年半,計畫是在「兆級基因圖譜」(Trillion Gene Atlas)計畫下擴張約百倍、突破一千兆(quadrillion)token——這個計畫是今年 3 月與 Anthropic、NVIDIA、PacBio 和 Ultima Genomics 共同宣布的。

里程碑:一款抗生素,與一套基因插入工具箱

有兩項成果,支撐「這些資料能轉化為醫療價值」的主張。

第一是抗生素。研究人員把病原體餵給 EDEN,模型直接設計出能殺死它的抗菌胜肽。在該公司尚未經同儕審查的 EDEN 論文中,一組精心挑選的候選分子有 97% 在實驗室中顯示活性。更驚人的是:一款名為 EDEN-7 的候選藥物,由模型直接生成、未經任何反覆調整,在感染多重抗藥性細菌的小鼠身上,效果約莫比擬「最後一線」抗生素。這項工作是與賓州大學 Cesar de la Fuente 實驗室合作完成。

第二是基因插入。Basecamp 用 EDEN 設計「大絲胺酸重組酶」(large serine recombinases)——這種酵素源自噬菌體與細菌的軍備競賽,能在選定位點重新接合 DNA。將它們程式化,使其無論患者帶有哪種突變都能插入健康的基因副本,正對準遺傳疾病基因治療的核心難題。在 EDEN 論文中,生成的重組酶有一半在人類細胞中具有活性;更早的公告則報告,以此方式改造的初代人類 T 細胞在實驗室中清除超過 90% 的腫瘤細胞。公司網站公布的研發管線列出四個進入「先導物優化」(lead optimization)階段的項目:針對血癌的體內 CAR-T、針對一種自體免疫疾病的體內 CAR-T、針對苯酮尿症(PKU)的肝臟基因療法,以及對抗抗藥性病原的抗菌胜肽。

Scaling 曲線,以及但書

Lorenz 關於資料品質的說法,是整個故事技術上最有趣的部分。過去六個月,Basecamp 在相同條件下、用相同架構分別以自家資料與公開資料訓練模型——自家資料畫出了更陡的 scaling 曲線,而且模型越大、差距越大。據稱要達到 2 的 perplexity,Basecamp 的資料可省下數十萬到數百萬 GPU 小時;若目標是 1.5,外推的差距達數十億 GPU 小時。後者是外推估計,不是實測結果。

他對「基準分數不等於更好的分子」也同樣坦白。團隊比較過 StripedHyena 架構(Arc Institute 的 Evo 模型骨幹)與 Meta 的 Llama:StripedHyena 有時 perplexity 更低,但 Llama 在下游生物任務上表現更好。Basecamp 選了 Llama。公司目前有三分之一的 GPU 用於強化學習實驗,利用波士頓實驗室的數據——T 細胞實驗產出的是數百到數千個資料點,而非數十億 token——把廣度訓練的模型導向臨床任務。

Anthropic 的角色

部分 EDEN 功能已經可以透過 Claude 與 Claude Science 使用:研究人員用自然語言描述任務——設計抗生素或挑選疫苗靶點——Claude 再呼叫 EDEN 提出候選建議。這層整合某種程度上解釋了 Anthropic 為何出現在這一輪。它也預示了一種分發模式:前沿聊天機器人成為專業科學模型的入口,EDEN 是早期的示範。

未解的問題

誠實的但書,是這個故事的另一半。Basecamp 的六個研發項目沒有一個走出先導物優化階段;迄今一切成果都建立在實驗室數據與小鼠實驗上。遞送(delivery)仍是硬難題——Arc Institute 共同創辦人 Patrick Hsu 曾公開點名遞送、毒性和免疫反應是插入工具的未解挑戰。而利益分享模式——來源國獲得授權金(至 2024 年底共 19 國 52 個受益方;最快從採樣到首筆付款只花九個月)——也招致批評:約 1% 營收的分成,對於那些生物多樣性撐起公司估值的社群而言太小。Basecamp 讓 EDEN 的每一個訓練 token 都能回溯到地理來源與當初取得的知情同意——這不是小成就——但「可回溯」與「公平補償」是兩道不同的門檻。

用 Lorenz 自己的話說,這場豪賭是:「我們的野心是讓生物學可程式化。你對著一個疾病下 prompt,出來的就是一個能處理它的分子。」隨著 1.4 億美元入帳,接下來十八個月——資料集百倍擴張、兆級基因圖譜,以及第一次把項目推向臨床的嘗試——將檢驗「演化」是否真能被當作訓練資料。