Deep Origin 的 DODock 突破虛擬篩選瓶頸:CD73 命中率達 30%,較 AI 基準提升百倍
結合物理與機器學習的對接引擎在全新靶點上維持 80% 位姿準確率——AlphaFold 3 等級的共同摺疊模型在同類測試中跌破 25%,並將 CD73 篩選命中率從 0.3% 推升至 30.6%。
虛擬篩選(virtual screening)在計算藥物發現領域已存在四十年,但絕大多數時間裡表現令人失望。傳統管線在僅約 1% 的藥物發現專案中被視為主要的苗頭化合物(hit)發現策略,原因很簡單:在電腦上看起來完美的候選分子,一進入實體實驗室往往就失效。2026 年 8 月 5 日,總部位於舊金山南郊的 Deep Origin 在 bioRxiv 發布預印本,宣稱找到了突破這個陷阱的實質方法——並以濕實驗室數據佐證。
Deep Origin 發布了什麼
該公司發表了兩個緊密結合的模型:DODock 負責預測小分子如何與蛋白質結合,DOScore 則在超大化學空間中排序結合親和力。最耀眼的成果來自針對 CD73 的前瞻性篩選——這種核苷酸酶調節免疫抑制與腫瘤代謝,是癌症免疫療法中知名但困難的靶點。在約 80 億個虛擬化合物組成的資料庫中,Deep Origin 的管線繳出 30.6% 命中率:183 個受測化合物中有 56 個具活性,其中 54 個在 100 µM 以下即有活性,代表性的非核苷酸苗頭化合物在細胞實驗中達到 570 nM 效價。
對照組非常鮮明。先前一項針對 CD73 的大規模 AI 篩選(AtomNet 的 318 靶點計畫)在 335 個化合物中僅確認一個 176 µM 的弱抑制劑,命中率約 0.3%。Deep Origin 的成果相當於在同一靶點類別上實現約百倍的篩選效率提升。
「記憶陷阱」——以及如何逃脫
這份預印本在智識上最有趣的論點,是解釋現有模型為何失敗。Deep Origin 主張,標準的時間切分基準會讓長相相似的蛋白質與孿生化學骨架滲入訓練集,使 AI 模型光是靠背誦歷史上的配體—蛋白質配對就能得高分。一旦面對真正新穎的生物學與化學,這些記憶毫無用處。
他們提出的證據是過去未曾被清楚區分的觀察:領先的 AI 共同摺疊模型(AlphaFold 3、Boltz-1、Chai-1、Protenix)其實擅長重建蛋白質口袋——它們的準確率是在配體擺放與對接力學這一步崩潰的。在獨立的 Runs N’ Poses 基準上,這些模型在熟悉靶點達到 75–88% 位姿準確率,但面對陌生靶點與新化學空間時跌破 25%;DiffDock 在以新穎靶點生物學為核心的 OpenBind 基準上更跌至 2%,共同摺疊模型也僅有 4–28%。
DODock 在同樣測試下的數字:熟悉複合物 89%、Runs N’ Poses 中最新穎的複合物超過 50%、OpenBind 上 80%。在嚴格的零洩漏切分下——Deep Origin 將序列相似度 ≥30% 的蛋白質、Tanimoto 相似度超過 0.4 的配體全部從訓練集移除——DOScore 在 DUD-E 與 DEKOOS 2.0 的大多數靶點上維持超過 10 倍的早期富集率(EF@1%)。
物理接地才是關鍵差異
它是怎麼運作的?DODock 不純靠資料中學到的模式:先用擴散模型生成廣泛的 3D 位姿候選,再以名為 DOFast 的 80 參數物理能量引擎精修——計算的是基本分子作用力,而非背誦的關聯。最後由一個 AI 模型評估結合界面上原子接觸點,對精修後的位姿排序。在檢驗物理有效性的 PoseBusters 基準上,DODock 從最相似到最不相似靶點維持 84% → 80% 準確率;同區間 Glide SP 從 80% 跌至 47%,AutoDock Vina 從 64% 跌至 50%,DiffDock 從 23% 崩落至 2%。
DOScore 則以更聰明的方式解決親和力建模長期的資料稀缺問題:Deep Origin 用 DODock 本身為數十萬個帶活性標註的化合物生成高品質 3D 結構,為「排序真實結合者 vs. 誘餌」打造了自己的物理接地訓練基底。
一場難以反駁的盲測
論文中單一最具說服力的數據點,或許是一場完全盲測的前瞻實驗。DODock 預測了阿斯特捷利康(AstraZeneca)第三期口服 PCSK9 抑制劑候選藥物 laroprovstat(AZD0780) 的結合位姿——位於一個非典型的 C 端結構域位點,且當時根本不存在任何晶體結構。數個月後,Deep Origin 實驗解出 2.07 Å 晶體結構,證實盲測預測達 1.2 Å 重原子 RMSD。在從未見過的分子上、預測出非典型的結合模式、精確到約一個原子寬度——這是基準測試無法造假的那種驗證。
四項前瞻性篩選也依刻意設計的難度梯度展開:IRAK4(激酶)繳出 15.0% 命中率,包含一個 158 nM 的抑制劑;Factor XIa(蛋白酶)4.3%;IL-17A——小分子向來難以著力的蛋白質—蛋白質交互作用(PPI)靶點——也有 3.1%,且苗頭化合物能以異位方式擾動遠端 PPI 位點。在全部四個靶點上,驗證命中的骨架新穎度都很高(與已知結合者的 ECFP4 Tanimoto 相似度僅 0.22–0.27),代表篩選找到的是真正的新化學物質,而非既有藥物的微調變體。
為什麼重要
真正的重點在經濟學。約 90% 的藥物在臨床開發階段失敗,而約 74% 的新分子實體成本發生在臨床前測試之後——那時發現漏斗早已收縮了一萬倍。如果對接工具能在新穎靶點上維持準確率,值得帶上實驗台的分子數量將大幅增加,為「無藥可用」靶點尋找起點的成本也會下降。
有幾點但書必須講清楚。單一靶點家族的 30% 命中率不保證能推廣到所有生物學;預印本尚未通過同儕審查;Deep Origin 也坦承內部量產模型的表現已超過公開指標——提醒我們這同時也是為其合作業務(40 個名額、已填 2 個、首要對外授權資產 GPR75)所做的商業定位。但該公司做了一件在 AI 藥物發現圈罕見地「科學」的事:公開完整方法——超過 80 頁補充文件涵蓋每個演算法、超參數與資料切分——並明確邀請社群在它沒見過的分子上審計、測試與重現結果。共同創辦人暨執行長 Michael Antonov(Oculus 共同創辦人)將其定位為「以專門設計來讓模型失敗的案例」做測試;科學長 Garegin Papoian(前馬里蘭大學 Monroe Martin 生物化學教授)與 AI 負責人 Garik Petrosyan 共同主持這項研究。
對一個已經習慣低準確率天花板四十年的領域而言,一個在新穎靶點上兌現承諾——並以濕實驗室、盲測與開放方法論證明——的物理接地模型,正是值得密切關注的那種成果。
Sources
- [1] https://deeporigin.com/news/virtual-screening-architecture-100-fold-hit-rate
- [2] https://www.globenewswire.com/news-release/2026/08/05/3339125/0/en/deep-origin-introduces-novel-virtual-screening-architecture-achieves-100-fold-hit-rate-jump-on-challenging-target.html
- [3] https://www.hpcwire.com/aiwire/2026/08/19/deep-origin-claims-breakthrough-in-ai-drug-discovery-platform/
- [4] https://www.synbiobeta.com/read/deep-origin-unveils-breakthrough-in-virtual-screening-with-dodock