St. Jude 的 AdaptiveFlow 以千分之一成本篩選 690 億分子:AI 藥物發現的雲端重寫
St. Jude 開源平台 AdaptiveFlow 以主動學習導引 690 億分子的虛擬篩選、可在 AWS 上擴展至 560 萬顆 CPU,並將篩選成本最高降低 1,000 倍,同時發現經實驗驗證的奈莫耳級 FSP1 與 PARP-1 抑制劑。
新藥開發從一場殘酷的數字遊戲開始:化學家估計類藥分子空間多達約 10^60 個,而地球上沒有任何實驗室能合成並測試其中一小部分。虛擬篩選(virtual screening)是這個領域的反擊方式——在電腦上把候選分子「對接」(docking)到目標蛋白的結合口袋中,再依預測親和力排序。但即使在矽世界裡,數學依然無情。若要窮舉篩選 Enamine 的 REAL Space——全球最大、含 690 億個可合成分子的商業資料庫——所需成本遠超過大多數學術實驗室、甚至多數企業願意為單一靶點投入的水準。
2026 年 9 月 1 日,St. Jude 兒童研究醫院(St. Jude Children’s Research Hospital)發表了 AdaptiveFlow,一個自稱能「重新定義藥物發現大規模雲端運算」的開源平台。它的數字具體而驚人:在 AWS 上近乎線性擴展至 560 萬顆 CPU、支援超過 1,500 種對接協定組合,並將超大規模虛擬篩選(ULVS)的運算成本最高降低 1,000 倍——而且不是靠蠻力,是靠讓搜尋變得「有適應性」。
蠻力的問題
虛擬篩選的規模一向與預算成正比。上一代平台(包括同一團隊的 VirtualFlow 2.0)已證明十億級篩選在雲端技術上可行,問題在經濟學:成本大致隨資料庫大小線性成長,從 10 億分子增加到 690 億,預算就得乘上 69 倍,但命中分子的多樣性只有邊際提升。結果是 ULVS 長期侷限於資金充沛的大型合作計畫,化學空間的廣大中段依然無人探索。
AdaptiveFlow 的答案是論文中稱為 Adaptive Target-Guided Virtual Screening(ATG-VS)的方法。平台不再對 690 億分子逐一對接,而是先把化學空間組織成一個多維分子性質網格,再從每個「切片」(tranche)中篩選少量代表性分子——整個 REAL Space 約需 1,200 萬個代表分子,初始工作量直接縮減約 5,750 倍。接著主動學習(active learning)迴圈以預篩結果為標籤:被歸類為高信心結合的分子才進入完整對接,而不被看好的化學空間區域會在耗費任何昂貴運算之前就被降級。平台採用門檻式分類,以上四分位數(第 75 百分位)的對接分數作為決策邊界,把資源集中在證據顯示命中分子最可能出現的地方。
論文的頭條結果是:ATG-VS 應用於完整 690 億分子的 REAL Space 時,相較窮舉搜尋最多可降低 1,000 倍篩選成本,同時「維持對頂級命中分子的強力富集」。
三大模組、560 萬顆 CPU,還有 GPU
AdaptiveFlow 由三個核心元件構成。AdaptiveFlow Ligand Preparation(AFLP)模組負責海量資料庫的預處理——把 690 億筆目錄資料轉換成可直接對接的 3D 格式,這是最不耀眼卻最具決定性的工作;團隊已完成的免費版 REAL Space 現已透過 AWS Registry of Open Data 公開。AdaptiveFlow for Virtual Screening(AFVS)引擎是執行層,支援超過 1,500 種對接協定組合,混合古典物理對接與深度學習對接。AdaptiveFlow Unity(AFU)則把各元件整合成可在 CPU 叢集與 GPU 架構上執行的統一模組化工作流。
最後一點比表面看來更重要。既有平台大多僅支援 CPU,而整個領域的運算重心正轉向 GPU。AdaptiveFlow 整合了深度學習對接與 GPU 加速,進一步帶來 10 到 100 倍的吞吐量提升,並在 AWS 雲端多達 560 萬個 vCPU 上展示了近乎線性的擴展性——作者稱這為雲端藥物發現平行化的新基準。
它找到了真實分子,還用晶體結構證明
基準測試本身無法驗證篩選平台,濕實驗室結果才行。團隊將 AdaptiveFlow 用於兩個與疾病相關的靶點:鐵死亡抑制蛋白 1(FSP1)——一個保護細胞免於鐵依賴性死亡的新興抗癌靶點,以及聚 ADP 核糖聚合酶 1(PARP-1)——現有一整類腫瘤藥物的靶點。篩選結果為兩者都找到了奈莫耳(nanomolar)級的抑制劑。
更關鍵的是,這些命中分子沒有停留在電腦預測。研究人員利用新解出的 FSP1 與 NAD+、FAD、輔酶 Q1 形成複合物的晶體結構,實驗驗證了所發現的抑制劑,並解析出 FSP1 與這些小分子結合的共晶結構——揭示了先前未知的結合機制。在「命中分子撐不過實驗驗證」幾乎是行業默認笑話的領域裡,對計算發現的化合物做出結構性驗證,是一個平台能提出的最強證據。
為什麼開源是真正的重點
這項研究的幕後陣容橫跨多個機構:工作由 St. Jude 結構生物學系的 Christoph Gorgulla 領銜——他最初是在哈佛醫學院 Haribabu Arthanari 團隊開發 VirtualFlow——並與 Stanford、Dana-Farber、Amazon Web Services、Enamine 及柏林工業大學的合作者共同完成。平台以開源形式發布,備妥的 690 億分子資料庫也在 AWS 上免費開放。
這個選擇才是本次發布的真正意義。1,000 倍的成本降低,不只是幫原本就負擔得起 ULVS 的團隊省錢;它把這項技術推過了一個門檻——學術實驗室、兒科研究醫院或新創公司,如今可以用一筆研究經費務實地執行這種規模的篩選。病患人數少的疾病——正是 St. Jude 主場小兒腫瘤學的核心限制——恰恰是商業藥物開發最薄弱、而更便宜的早期發現能發揮最大槓桿的地方。
當然,誠實的限制依然存在。虛擬篩選產出的是候選分子而非藥物:命中分子還需要藥物化學修飾、ADME 最佳化與多年臨床驗證。主動學習也可能繼承預篩標籤的偏誤,而 1,000 倍這個數字是與 REAL Space 資料庫及特定測試靶點綁定的上限值。但作為「超大規模虛擬篩選的經濟學可以用機器學習而非預算來改寫」的證明,AdaptiveFlow 是今年最具份量的基礎設施論文之一——而且從今天起,任何人都可以下載來試。
Sources
- [1] https://www.stjude.org/media-resources/news-releases/2026-medicine-science-news/ai-informed-adaptiveflow-redefines-large-scale-cloud-computing-for-drug-discovery.html
- [2] https://pmc.ncbi.nlm.nih.gov/articles/PMC13041786/
- [3] https://pubmed.ncbi.nlm.nih.gov/41929058/
- [4] https://www.biorxiv.org/content/10.1101/2023.04.25.537981v2.full-text
- [5] https://registry.opendata.aws/vf-libraries/
- [6] https://www.stjude.org/people/g/christoph-gorgulla.html