資料即新藥:OpenAI 基金會豪擲逾 1.25 億美元啟動 Public Data for Health,4,000 萬美元投向 UNC 癌症疫苗計畫
OpenAI 基金會第二個科學計畫聚焦開放生物資料集——4,000 萬美元補助 UNC Lineberger,將直接實測腫瘤抗原與 T 細胞反應,讓個人化癌症疫苗不再是一場猜測遊戲。
2026 年 9 月 15 日上午,OpenAI 基金會(OpenAI Foundation)宣布啟動第二個科學計畫 Public Data for Health,首批投入超過 1.25 億美元,用於創建與保存開放取用的科學資料集。其中最受矚目的一筆——4,000 萬美元補助給北卡羅來納大學教堂山分校的 UNC Lineberger 綜合癌症中心——劍指一個看似平淡、實則卡住整個領域的問題:個人化癌症疫苗是用電腦從「從未真正被測量過的資料」設計出來的。
官方宣布內容
這項計畫由基金會「生命科學與治癒疾病」(Life Sciences and Curing Diseases)部門的 Abhishaike Mahajan 與 Jacob Trefethen 撰文揭曉,形式與 2026 年 4 月啟動的首個科學計畫「AI for Alzheimer’s」明顯不同。前者鎖定單一疾病,Public Data for Health 則刻意橫向展開:它補助的是全球研究者與 AI 工具都能取用的資料集,一次涵蓋多種疾病。
基金會的論述相當直白:科學資料是發現的基礎輸入。在數學領域,AI 系統最近已能在「不收集新資料」的前提下貢獻新知識;生物學恰恰相反——模型固然能大規模分析生物資訊、甚至從不完整的證據中重建隱藏結構,但它們變不出從未被記錄的觀察。更麻煩的是,某些具有巨大公共價值的資料集可能永遠不會誕生,因為沒有任何一家公司或學術實驗室有足夠的誘因或預算去創建它。
這個「市場失靈」論證正是計畫的核心命題:慈善資金應該資助生命科學的資料層,就像當年資助人類參考基因體與蛋白質結構資料庫一樣。
三筆補助,三種資料假說
首批補助橫跨藥物開發的分子層、流行病學層與法規層,各自體現基金會對「什麼讓資料有價值」的三個起始假說——相連資料(connected data,跨越多個步驟追蹤生物學)、稀缺資料(scarce data,保存無法重製的東西)、以及直接資料(direct data,測量最貼近關鍵的狀態)。
OpenADMET(UCSF 及合作團隊) 將建立開放資料集、基準測試與盲測競賽,檢驗 AI 能否預測小分子藥物在人體內的吸收與分布。公告中把賭注講得一清二楚:約 90% 的候選藥物在臨床試驗中失敗,原因往往是吸收與分布難以預測。團隊援引 AlphaFold2 在 CASP 競賽中依賴蛋白質資料庫(PDB)的先例——高品質公共資料加上公開預測競賽,正是解鎖蛋白質結構預測的組合拳。OpenADMET 打算把同一套打法複製到藥物動力學:為數萬個化合物測量關鍵分子特性、連結轉運蛋白結構,並用人工血腦障壁模型驗證其中一部分。
CTD Commons 由 1Day Sooner 創辦人 Josh Morrison 領軍,將測試能否收購並公開那些失敗或遭擱置藥物計畫的「通用技術文件」(Common Technical Document)——涵蓋動物毒理、製造細節與 FDA 往來信函的完整法規檔案,並趕在公司倒閉、紀錄消失之前保存下來。這些工作只有極小一部分會出現在正式論文裡。若成功,早期開發者等於拿到一張「法規要求地圖」,而機器學習系統則多了一批能從中學習藥物成敗模式的語料。
北卡羅來納大學 拿到最大一筆 4,000 萬美元,將由免疫學家 Benjamin Vincent 醫師與計算生物學家 Alex Rubinsteyn 博士共同建立 生成式免疫療法倡議(Initiative for Generative Immunotherapy)。
UNC 計畫:把紅旗量出來
個人化新抗原(neoantigen)疫苗是少數真正為「每一位病人」用運算方法設計的藥物。流程是:定序病人的腫瘤、預測哪些腫瘤特有蛋白會出現在細胞表面,再打造一支疫苗,訓練免疫系統去攻擊舉著這些「紅旗」的細胞。
問題在於:腫瘤定序只是一種「代理指標」。要直接量測哪些標的真的出現在細胞表面、以及病人的 T 細胞對每一個標的反應多強,既困難又昂貴,因此幾乎沒有人大規模做過。疫苗於是被建立在「預測疊加預測」之上——這正是 Rubinsteyn 所說「許多疫苗因為太過任意而在開發過程中失敗」的原因。
UNC 團隊打算正面突破。他們將分析來自三個生物檢體庫、數百件去識別化的腫瘤組織與免疫細胞樣本,直接測量腫瘤細胞的表面蛋白與病人的 T 細胞反應,而不是從定序結果去推論。這將產出該領域首批真正的訓練與評估資料集之一——讓 AI 模型學會分辨哪些腫瘤抗原是真正的好標的,而非只是「被預測為好」的標的。與此同時,臨床試驗將比較多種疫苗配方在三陰性乳癌(最難治的亞型之一)中引發腫瘤特異性免疫反應的能力。
「個人化癌症疫苗終於開始展現臨床療效的跡象,但以傳統療法開發模式,其中的缺口可能要數十年才能補上,」Rubinsteyn 表示,「高品質資料能幫我們更快縮小這些差距。」
所有資料都將以去識別化的公共資料形式公開。基金會生命科學部門負責人 Jacob Trefethen 講得更明白:UNC 的工作「將產出今天研究者根本拿不到那個規模的資料,並廣泛公開這些發現,讓全世界科學家都能在其上繼續建構」。
為什麼重要
時間點值得玩味。就在兩週前,這個領域才剛出現首個通過第三期臨床試驗的個人化 mRNA 癌症疫苗——其核心正是一套挑選新抗原的演算法——證明計算型的疫苗設計能跨過臨床醫學的最高門檻。但一次成功的試驗設計並不能類推到所有癌症,因為底層的標的選擇模型,是在薄弱而間接的資料上訓練出來的。UNC 資料集想做的,是從根源修復這個領域的資料問題,而不是在壞地基上繼續調模型。
這裡還有一個結構性訊號。OpenAI 基金會——治理營利實體 OpenAI Group PBC 的非營利母組織——把它的科學信譽押在開放公共財上,而非排他性合作。補助對象被鼓勵以預印本發表分析、持續釋出資料而非等到計畫結束才一次交付。如果基金會的判斷正確,AI 時代的慈善家能買到槓桿率最高的東西,不是算力、也不是模型,而是那些模型從來無法學習的「觀察」本身。
對病人而言,從資料集到藥物的路仍然漫長。但若生成式免疫療法倡議兌現承諾,下一代疫苗候選將帶著遠更堅實的標的組合進入人體試驗——用 Vincent 的話說,個人化癌症疫苗的設計,將從猜謎走向測量。
Sources
- [1] https://news.unchealthcare.org/2026/09/unc-lineberger-secures-40m-from-openai-foundation-to-make-cancer-vaccines-more-effective/
- [2] https://www.unite.ai/openai-foundation-launches-public-data-for-health-program/
- [3] https://www.beckershospitalreview.com/quality/public-health/openai-gives-unc-cancer-center-40m-to-fuel-cancer-vaccine-development/
- [4] https://abc7ny.com/post/openai-foundation-gifts-unc-lineberger-comprehensive-cancer-center-40-million-make-vaccines-more-effective-patients/19834554/