← All posts / Research

一次掃描、146 種病症、開放權重:阿里 DAMO RADAR 讀腹部 CT 贏過 26 位放射科醫師中的 23 位

登上《Science》並以 CC BY-NC-SA 開源的阿里 DAMO RADAR 視覺語言模型,以 424,911 次 CT 檢查訓練、無需人工標註,在 146 項腹部病徵上達到平均 AUC 0.913,單張 16GB 顯卡即可推理。

一次掃描、146 種病症、開放權重:阿里 DAMO RADAR 讀腹部 CT 贏過 26 位放射科醫師中的 23 位

過去十年,醫學影像 AI 遵循一條鐵律:一個模型、一種疾病。數百個取得 FDA 許可的工具能找出肺結節、標記中風,但每一個都是狹窄的專科醫生。這個月,一篇發表於《Science》(第 393 卷,eaec6129,DOI 10.1126/science.aec6129,2026 年 9 月 18 日刊出)的論文主張:放射科的「通才時代」已經到來。模型名為 RADAR——Rapid Abdominal Diagnosis with AI and Radiology——由阿里巴巴 DAMO 研究院聯合湖畔實驗室與浙江大學醫學院附屬第一醫院打造。而在一個旗艦級醫療 AI 通常被鎖在醫院合約與按次計費 API 背後的產業裡,這個團隊做了一件不尋常的事:直接公開了模型權重。

RADAR 到底做什麼

顯影劑增強腹部 CT 是醫學影像中最難「通才化」的目標之一。單次檢查涵蓋約 18 個器官,可能出問題的清單長達數百項——腫瘤、囊腫、鈣化、發炎——其中許多在影像上極其細微,且高度依賴解剖脈絡。能讀好它,正是腹部放射科醫師需要多年訓練的原因。

RADAR 是一個視覺語言模型(vision-language model),訓練資料是 424,911 次顯影劑增強腹部 CT 檢查,並配上醫師當時已寫好的放射科報告——150 萬個影像—文字配對,外加超過 1,500 萬個解剖結構特定配對。關鍵的工程抉擇在於:它不把 CT 體積當成一團 voxel,而是先分解成個別解剖結構,再將每個結構連結到報告中對應的語句,以大規模對比學習(contrastive learning)把視覺模式與臨床描述綁在一起。因為報告本身就是標籤,大規模的人工標註完全不需要。

推理時,模型吃兩個輸入:CT 掃描本身,加上器官分割遮罩(segmentation mask)——一份預先算好的輪廓圖,告訴模型肝臟、胰臟、胃在這位病人身上的位置。遮罩把任務從「在整個 3D 體積裡找任何異常」收窄為「針對這些器官區域、評量這些已知病症」。輸出則是一列 CSV,對 146 個器官—病症配對各給一個信心分數,從肝臟病灶到主動脈鈣化。實際上它是一層檢傷分類(triage)——DAMO 團隊稱之為第二雙眼睛——而非自主判讀者。

數字會說話

在約 4 萬次真實世界檢查中,RADAR 於全部 146 項病徵上達到平均 AUC 0.913,而表現最好的對比視覺語言模型只有 0.776——差距懸殊。另外三項結果更值得注意:

  • 沒學過的急診場景。 在超過 27,000 筆急診 CT 病例上,RADAR 拿到平均 AUC 0.904,儘管訓練資料裡沒有任何急診專屬資料。急診判讀正是放射科醫師疲勞與時間壓力最重的場景,能外推到這個設定,比任何跑分管線的基準分數都重要。
  • 跨院域泛化。 在八個外部醫療中心的佇列上,模型維持平均 AUC 0.895——證明它學到的是病徵本身,而不是某一家醫院的掃描儀與流程的癖性。表現在器官、疾病與罕見病徵上都維持穩定。
  • 醫師對決研究。 在面對面判讀中,RADAR 贏過 26 位專家級放射科醫師中的 23 位。臨床上更有意思的是:當放射科醫師把 RADAR 當助手使用時,敏感度提升約 10%——這才是真正重要的部署形態:人加模型,勝過任何一方單獨作業。

為什麼開放權重改變了故事

癌症篩檢 AI 長年活在企業授權與按次計費的圍牆內,這意味著最需要第二判讀者的醫院——地區醫院、偏鄉診所、資源有限地區的機構——反而最後才拿得到。RADAR 把發行模式整個翻轉:程式碼、檢查點與支援檔案全部放在 GitHub(alibaba-damo-academy/damo-radar)、Hugging Face 與 ModelScope 上。

獨立實測發現,它的硬體足跡以前沿模型標準而言相當節制:初始化僅需不到 1GB 顯存,推理時約 16GB VRAM,一張消費級顯卡就能跑,而且 KV cache 與上下文長度等參數可再往下壓。安裝流程就是標準的開源 ML 工作流——clone 儲存庫、執行下載腳本、載入檢查點與用於視覺語言對齊的 BERT 文字編碼器、餵入掃描與器官遮罩,然後讀出評分 CSV。研究團隊連訓練、微調與前處理程式碼都一併附上,所以這是一套研究框架,不只是一個凍結的成品。

但限制也是真的

GitHub README 寫得明白:RADAR 僅供研究用途,臨床部署前仍需前瞻性臨床試驗。授權條款是 CC BY-NC-SA 4.0——非商業授權,醫院不能直接拿去做產品,除非另簽協議。而且輸出格式需要專業才能解讀:主動脈鈣化 0.70 的信心分數,只對手上真有病人、受過訓練的臨床醫師有意義。沒有那個背景就去讀這張試算表,只會誤解模型真正主張的東西。

這次發布也落在證據標準論戰的正中央。就在幾天前,《金融時報》引述臨床醫師警告,醫療 AI 正在缺乏同儕審查證據的情況下被部署到傳統影像領域之外。RADAR 站在這場論戰的對的那一邊——這是附上權重的《Science》論文發布,不是配記者會的產品上市——但「在對決研究中贏過 26 分之 23 的放射科醫師」與「可以安全部署進你家醫院的工作流」之間的距離,正是論文作者自己也說必須跨越的那一段。

更大的圖像

放射科 AI 一直卡在專科陷阱裡:每個窄模型都需要自己的標註資料集、自己的部署、自己的系統整合。RADAR 押注的出路,是用既有臨床報告做視覺語言預訓練——這是每家醫院本來就在產生的資料。一個能一次掃過 146 項病症、跨八個外部中心泛化、在沒見過的急診場景站得住、而且跑在地區醫院買得起的硬體上的通才模型,重新劃定了「可部署」的邊界。

值得盯住的不是單一模型,而是模式:前沿級醫療 AI 以開放研究資產而非上鎖 API 的形式問世。如果「通才加開放權重」的組合在前瞻性試驗中站得住,今天要按次付 API 費的第二意見,可能變成診所下載一次、本地端永久運行的東西——而瓶頸也將從「取得管道」移往「臨床驗證」。這是一個好得多的難題。

資料來源列於本文 frontmatter。