← All posts / Research

一個模型看穿 146 種疾病:阿里巴巴達摩院 RADAR 讀腹部 CT,勝過 26 位放射科醫師中的 23 位

阿里巴巴達摩院與浙江大學醫學院附屬第一醫院發表於《Science》的開源模型 RADAR,能從顯影劑 CT 一次辨識 18 個腹部器官、146 種疾病——近 3.9 萬例內部驗證 AUC 達 0.913、8 家外部醫院 0.895,並在人機對決中擊敗 26 位放射科醫師中的 23 位。

一個模型看穿 146 種疾病:阿里巴巴達摩院 RADAR 讀腹部 CT,勝過 26 位放射科醫師中的 23 位

過去十年,醫學影像 AI 始終遵循同一套模板:鎖定一種疾病、請放射科醫師標註數千張影像、訓練一個分類器,然後重來。本週《Science》刊登了阿里巴巴達摩院與浙江大學醫學院附屬第一醫院對這套模板的主動告別——名為 RADAR(Rapid Abdominal Diagnosis with AI and Radiology)的通用視覺語言模型,能從顯影劑腹部 CT 中一次辨識 18 個解剖構造、146 種疾病,從肝癌、胰臟癌到脂肪肝與急性闌尾炎全數涵蓋。而在與 14 家醫院、26 位執業放射科醫師的同題對決中,它擊敗了其中 23 位。

更罕見的是,模型的權重、程式碼與框架全部開源,發布在 GitHub、Hugging Face 與 Zenodo 上——對於一個被研究團隊稱為「全球首個專家級通用醫學影像 AI」的系統而言,這是相當激進的開放姿態。

為什麼選腹部,為什麼走向通用

腹部是放射科公認最難的戰場。肝、膽、胰、脾、腎與盤繞的腸道擠在同一個腹腔裡,幾乎全是密度相近的軟組織;一套檢查包含數百張切面,而真正決定診斷的可能只是某個器官上一個微小的病灶。浙大一院放射科主任肖文波直言,年輕醫師最怕被分到腹部影像組——這是唯一幾乎完全依賴肉眼對密度差異的敏感度來吃飯的領域。

達摩院團隊走向「通用」,其實是被單病種路線逼出來的。他們此前已在胰臟癌、胃癌、大腸癌的早期偵測上發表過五篇《Nature Medicine》論文,但資深算法專家張建鵬把帳算得很直白:攻克一種疾病至少要兩三年,而人類疾病成千上萬種,「一輩子也做不完」。更麻煩的是,真實病人從來不是只帶著一種病上門,而專病模型對目標之外的一切視而不見。

RADAR 怎麼學——完全不用人工標註

RADAR 最關鍵的設計,是完全不需要人工標註。它的訓練素材是 40 萬例以上的顯影劑腹部 CT,搭配醫院本來就會產出的診斷報告,構成約 1,500 萬組「解剖感知」的圖文配對。它不是從像素標籤學習,而是從影像與放射科醫師寫下的句子之間的對應關係學習——更像跟著主治醫師查房的醫學生,而不是被餵食試算表的分類器。

兩個技術洞見讓這件事真正可行:

  • 器官級細粒度對齊。 把整個 CT 體積直接對齊整份報告是行不通的——一個小病灶的異常訊號會被數百張正常切面淹沒,模型只能學到粗略的統計特徵。RADAR 先把體積拆解成解剖單元(肝、胰、膽、腎……),再將每個單元與報告中對應的描述句精確對齊。這正是放射科醫師真實的讀片方式:逐一器官檢查,而不是把腹部當成一團。
  • 自適應對比建模。 標準對比學習預設把每個病人的特徵互相推開,但這在醫學上是錯的:兩顆健康的肝臟應該彼此靠近,兩顆帶著同種腫瘤的肝臟也應該。RADAR 依據這層臨床邏輯動態調整樣本間的距離,而不是依病人身分。

值得一提的是,論文中的 Scaling Law 曲線隨資料量持續上升,至今沒有飽和跡象——這是「146 種疾病只是中途站、不是天花板」最有力的論證。

關鍵數字

驗證是分層展開的,而外部世代才是檢驗成色的地方:

世代規模結果
內部連續真實世界檢查約 39,000 例146 項發現平均 AUC 0.913
外部驗證,8 家醫院超過 24,000 例AUC 0.895,單中心 AUC 自 0.874 起
急診案例(訓練時從未見過)27,000 例AUC 0.904
四大癌症對病理金標準(肝、胰、胃、大腸)切片確診 ground truthAUC 0.891–0.984

外部組之所以重要,在於它橫跨不同地區、不同掃描儀與不同造影流程。急診組的意義更大:急診掃描倉促、顯影時機不理想、病人無法配合,而訓練分布明確排除急診案例的 RADAR,AUC 依然守在 0.904——這是真正的泛化訊號,而非對單一醫院掃描儀的曲線擬合。

癌症基準則是最尖銳的測試。面對肝癌、胰臟癌、胃癌與大腸癌,團隊不再以放射科報告為參考答案,改以病理切片結果作為 ground truth——腫瘤科真正的金標準——模型 AUC 仍落在 0.891 至 0.984 之間。

人機對決,以及人機協作

讀片研究讓 RADAR 與來自 14 家醫院的 26 位放射科醫師就同一批病例各自獨立診斷。RADAR 贏了 23 位,僅略遜於三位資深次專科醫師。但營運層面上更有意思的發現是協作實驗:醫師在 RADAR 輔助下讀片,整體敏感度提升約 10 個百分點,平均讀片時間縮短超過 30%——而且「住院醫師 + AI」的組合,敏感度超過了資深醫師單獨讀片。

對照工作流程的現實:即使是資深放射科醫師,寫一份完整的腹部 CT 報告也要 20 分鐘起跳,得逐張檢視數百張影像;肖文波主任率領的三百多人科室每天處理數千張掃描。能把時間壓縮三分之一、又多抓出 10% 真陽性的工具,不是餘興節目,而是精準命中診斷醫學瓶頸的產能放大器。

完全開源,但該說清楚的但書

這次的發布完整度罕見:GitHub 與 Zenodo 上有採用 Apache 2.0 授權的訓練與推論程式碼,Hugging Face 上有檢查點與配套資料,還有針對 MERLIN 等外部資料集的前處理管線與示範推論案例。研究社群可以微調、稽核、擴展它——而「專家級通用放射 AI」這麼大的宣稱,恰恰需要這種可驗證性。不過模型權重採 CC BY-NC-SA 4.0 授權,商業臨床部署需另行授權;而且所有驗證都還不能取代前瞻性的法規試驗。在中國世代上回測出的 AUC,不會自動轉移到美國醫院的掃描儀組合、疾病盛行率與人口結構上——急診世代的穩健性令人振奮,但終究仍在單一醫療體系的世界裡。

不過,真正的故事是軌跡。醫學 AI 花了十年證明自己能在單一窄任務上追平專家;RADAR 則證明了另一條路——以常規臨床資料做視覺語言學習、無需人工標註——就能以專家級水準覆蓋最難影像領域的全部廣度,而且能力還沒頂到天花板。張建鵬當年感嘆「單病種 AI 一輩子做不完」,如今有了具體的替代方案:一個已經會讀 146 種疾病、scaling 曲線仍在爬升、權重任何人今天就能下載的模型。

對全球大多数欠缺資深放射科醫師的醫院而言,這不是漸進式的改良,而是一種全新等級的武器。