九十億個變異、一 PB 資料量:DeepMind AlphaGenome Atlas 預先算好人類基因體每個字母的改變
Google DeepMind 發布 AlphaGenome Atlas,一個 1 PB 的資料集,預測人類基因體中約 90 億個所有可能單字母 DNA 變異的分子效應 — 比 AlphaFold 資料庫大 30 倍以上,學術用途免費開放。
九十億 — 這是人類基因體約 30 億個鹼基對中,所有可能的單字母改變(遺傳學上稱為單核苷酸變異,SNV)的總數。要在實驗室裡逐一測試其中哪怕一小部分,實際上都不可能。2026 年 9 月 8 日,Google DeepMind 讓這件事不再需要嘗試:該公司發布了 AlphaGenome Atlas,一個包含上述每一個變異之分子效應預測的平臺,打包成 1 PB(1,000 TB)的資料集,任何學術研究人員都可以透過免費網站入口查詢。
這次發布是 DeepMind「把前沿 AI 模型變成開放科學基礎設施」策略的又一次升級 — 與當年 AlphaFold 資料庫成為生物學史上最常用資源的打法如出一轍。AlphaGenome Atlas 比 AlphaFold 資料庫大 30 倍以上,DeepMind 明確將它定位為蛋白質結構資源的基因體學對應版本,而後者正是分享 2024 年諾貝爾化學獎的成果。
從模型到地圖
AlphaGenome 這個底層 AI 模型於 2025 年 6 月首度問世,是一個統一的 DNA 序列模型,能預測遺傳變異如何影響數千種分子程序 — 基因表現、RNA 剪接、染色質可及性等 — 橫跨數百種人類與小鼠細胞類型。這個模型在分析個別變異上非常強大,但留下一個實務缺口:多數生物學家並不想在前沿 AI 系統上跑推論,他們想要一本可以翻閱的地圖集。
DeepMind 把 AlphaGenome 的預測在整個基因體上預先算好,創造的正是這樣的東西。如同地形圖集把海拔、位置等地貌特徵連結起來,AlphaGenome Atlas 把 DNA 變異的分子效應繪製在整個基因體的地形上 — 包括那 98% 不編碼蛋白質的區域。大多數與疾病相關的變異其實就藏在這些區域裡,而傳統工具一直難以解讀它們。
伴隨原始預測,團隊還發布了 AlphaGenome Variant Impact(AVI)分數 — 一個把 AlphaGenome 與 AlphaMissense(DeepMind 的蛋白質編碼變異預測模型)的長處濃縮成單一數字的影響排序。AVI 分數同時適用於編碼與非編碼區域,DeepMind 表示它在多項變異致病性與罕病基準測試中表現屬於同類最佳。每個 AVI 分數還會進一步分解成特徵歸因 — 指出哪個分子程序(例如 RNA 剪接或染色質可及性)最受干擾 — 研究者得到的是作用機制,而不只是一個數字。
Atlas 還附帶超過 2,500 個重複出現的 DNA 序列 motif(基因體的「詞彙」)及其位置的完整彙編,讓科學家能把變異直接連結到它們所干擾的功能性序列。
已經驗證的真實成果
這次發布最有說服力的部分不是資料集的規模,而是 DeepMind 的外部合作者已經用它做出來的驗證工作。
在 Broad 研究所,Laura Covill 與 Anne O’Donnell-Luria 與 GREGoR 聯盟合作研究未解罕病案例,用 AVI 分數為過去被忽略的變異排定優先順序。團隊找到了一個影響 DNM1 基因的變異,這個基因與癲癇性腦病變密切相關。關鍵的是,AlphaGenome 的預測精確解釋了這個變異如何致病:它創造了一個錯誤的剪接位點,導致蛋白質異常延長。實驗篩選驗證了這項預測,還找到附近有類似效應的其他變異。
在艾克斯特大學,MRC 研究員 Gareth Hawkes 把 Atlas 應用到超過 54,000 名英國生物銀行(UK Biobank)參與者的全基因體資料上。透過按預測的分子效應將罕見變異分組,他比標準方法多找出了 22% 的非編碼遺傳關聯 — 這些訊號原本會淹沒在數百萬個無害改變的統計雜訊中。這項工作鎖定了驅動血漿蛋白豐度的調節變異,包括 PLA2G7(與老化相關)和 EGLN1(重要的細胞氧氣感測器);另一項針對 BMI 的分析則找出 19 個值得後續深入研究 的基因區域。
在 Stowers 醫學研究所,Julia Zeitlinger 與 Melanie Weilert 利用 motif 彙編,區分哪些轉錄因子只影響 DNA 可及性、哪些還能真正開關基因 — 這個基礎科學問題過去需要多年的專門實驗才能回答。
為什麼重要
當預測被預先算好,遺傳解讀的經濟學就改變了。今天,面對病因不明重症病童的臨床醫師,必須在數千個候選變異中篩選;一份有排序、有機制註解的短清單,可以把數個月的分析壓縮到一個下午。研究常見性狀的族群遺傳學家面對的是同一問題的另一種版本 — 在數百萬個變異的背景中找出少數有功能的那些 — 而艾克斯特的結果顯示,Atlas 確實改善了這個訊噪比。
有幾點但書必須說清楚。這些預測是模型輸出,不是實驗測量值,因此繼承了 AlphaGenome 本身的所有限制。DeepMind 自己也把 Atlas 描述為「一個基線,而非終點」— 隨著底層模型進步,這些地圖將需要重新生成。學術與非商業用途透過網站入口免費,商業授權則即將登上 Google Cloud — 這種雙軌安排與 AlphaFold 相同,也可能再度引發「生命科學公共財究竟該有多少住進單一公司的基礎設施裡」的辯論。
儘管如此,趨勢無可置疑。AlphaFold 把原本預期要花五十年的蛋白質結構測定壓縮成一個可搜尋的資料庫;AlphaGenome Atlas 現在要對調節性基因體做同樣的事 — 那是自從基因體定序完成以來,始終抗拒系統性解讀的那一部分 DNA。DeepMind 也已把 Atlas 定位為更大系統的零組件:這個資源可透過 AlphaGenome API 存取,也成為該公司代理式開發平臺 Google Antigravity 中的一項技能,指向一個 AI 代理能把變異排序、機制歸因與文獻回顧串成單一科學工作流程的未來。
對於花了數十年逐一拼出基因體地圖的研究者而言,一本預先算好每個可能改變的地圖集,是再合適不過的下一章 — 參考基因體告訴了我們由什麼構成;AlphaGenome Atlas 開始告訴我們,其中每個字母究竟做些什麼。
Sources
- [1] https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/
- [2] https://blog.google/innovation-and-ai/models-and-research/google-deepmind/alphagenome-atlas/
- [3] https://spectrum.ieee.org/alphagenome-atlas
- [4] https://aiweekly.co/alerts/google-deepmind-ships-alphagenome-atlas-with-predictions-for-all-9b-single