FDA 核可的 1,357 個 AI 醫療器材,只有 3 個驗證過對病人預後的影響
PLOS Digital Health 的一項大型回顧研究發現,在 FDA 核可的 1,357 個 AI 醫療器材中,僅 3 個曾以存活率、住院率、生活品質等病人真正在乎的指標進行評估。
人工智慧已經悄然成為美國醫療體系的一部分。它在 CT 影像上標記疑似中風、估算心血管風險、為放射科醫師排序乳房攝影的優先順序,還能協助外科醫師規劃手術。但本週發表於 PLOS Digital Health 的一項大型回顧研究,提出了一個令人極度不安的問題:這些系統中,究竟有幾個曾被證明能讓病人變得更健康?
由多倫多大學 Rawan Abulibdeh 領銜的研究團隊給出的答案,幾乎是「沒有」。在美國食品藥物管理局(FDA)截至 2025 年 12 月 5 日核可的 1,357 個 AI 醫療器材中,只有 3 個曾以「病人中心預後」(patient-centered outcomes)指標進行評估——也就是存活率、中風、住院或生活品質這類病人真正在乎的結果。其餘器材所依據的證據都薄弱得多:技術性基準、回溯性資料集,或是「與市面上既有工具相似」的展示。
研究發現了什麼
這篇論文題為「1,357 AI medical devices cleared, 3 actually tested on patient outcomes」(PLOS Digital Health, 5(8): e0001597, DOI: 10.1371/journal.pdig.0001597),系統性檢視了 FDA 核可的 AI 器材在進入臨床照護前,曾接受過哪些人體評估。數字相當刺眼:
- 截至 2025 年 12 月 5 日,FDA 共核可 1,357 個 AI/機器學習醫療器材
- 其中僅 34 個(約 2.5%)曾登錄於註冊臨床試驗
- 僅 12 個器材的試驗結果公開可查
- 僅 12 個器材發表過同儕審查論文
- 僅 3 個器材——不到 0.25%——曾以對病人直接有意義的預後指標進行研究
這些器材並非冷門的實驗性產品。它們涵蓋手術規劃輔助、心血管風險估算、乳房攝影與其他醫學影像分析,以及範圍持續擴大的診斷與臨床決策支援工具。多數依賴機器學習模型,在大型資料集中辨識統計模式,再用這些模式分類影像、產生風險分數或建議臨床處置。
作者的核心論點是:技術效能不等於健康改善。一個演算法可以準確偵測異常,卻從未證明它的使用能帶來更早的治療、更少的併發症、更長的存活或更好的生活品質。在策劃過的資料集上的準確度是實驗室性質;在病床邊的效益才是臨床性質——而病人就活在這兩者之間的落差裡。
為什麼會有這種證據缺口
很大一部分原因在於醫療器材進入美國市場的途徑。許多 AI 工具透過「實質等價」(substantial equivalence)路徑取得核可:製造商只需證明新產品在安全性與預期用途上,與某個已獲核可的既有器材足夠相似,即可免做新的臨床試驗。
這套框架對傳統器材是合理的——相似性是物理且直觀的。但對 AI 系統而言就脆弱得多。一個較新的演算法可能輸出更快,或在精選案例上與專家判讀一致,但這既不能證明它在日常執業中減少了診斷錯誤,更不能證明它在真實醫療體系面對的多樣族群中改善了預後。每一代「等價」的軟體都可能離原始證據基礎更遠——這是一場以機器速度進行的法規傳話遊戲。
這項回顧也點出了既有證據中「缺席的人」。研究高度集中於資源充沛的醫療環境,而孕婦、75 歲以上長者與非英語使用者經常被排除在評估之外。這些遺漏事關重大:當病人年齡、語言、疾病嚴重度、影像設備或治療可近性與開發資料集不同時,醫療演算法的表現可能截然不同。一個在專科醫學中心表現優異的系統,到了偏鄉診所或資源不足的醫療體系,可靠度可能明顯下滑。
利害有多深
後果不只是統計上的不確定性。如果一個 AI 系統對某個群體產生較多偽陰性,臨床醫師可能恰恰在預後本來就較差的病人身上錯失重症。如果它產生過多偽陽性,病人就得承受不必要的檢查、處置、焦慮與花費。而當演算法直接嵌入電子病歷與臨床工作流程時,這些效應會被放大——它的建議可能散發著底層證據根本撐不起來的權威感。
這還有國際層面的風險。許多國家——尤其是法規資源有限的國家——在決定採用哪些新醫療技術時,會參考富裕國家主管機關的決定。一個在美國核可、卻從未在不同族群或照護環境下測試過的器材,可能最終部署在中低收入國家,而當地的疾病型態、基礎建設、人力與後續照護條件全都不同。其他地方的病人,可能不知不覺成一場大型不受控實驗的受試者。
作者也點出結構性的誘因問題:開發商面臨儘快上市的商業壓力,而以預後為目標的試驗昂貴、耗時且後勤複雜。要證明一個器材改變了住院率,所需的研究規模與時間遠大於證明它能在影像上偵測某個特徵。在這種環境下,技術驗證自然成為主流基準——即使醫療科技的最終目的,是讓人活得更久、更健康。
研究提出的解方
Abulibdeh 與同事提出以「三階段」方式重新設計評估框架:超越上市前一次性展示相似性或技術效能、要求證明系統在不同病人子群與醫療環境中有效,並將上市前驗證與部署後的持續評估串連起來。他們描述的轉變既是程序面、更是哲學面的——從問「機器能不能重現某個標籤」,轉向問「它的使用是否改變了決策、改善了照護、避免了傷害,並公平地分配效益」。
值得強調的是,這項研究並未主張 AI 醫療器材無效,也不認為演算法在醫療中沒有一席之地。它的論點更窄、卻也更嚴厲:我們大致上不知道這些工具對病人做了什麼,因為幾乎沒有人查證過。隨著 AI 在醫院與診所的能見度越來越高,法規核可能被誤認為效益的證明。研究者堅持這是兩件根本不同的事——一個器材可以因為與既有產品相似而合法取得核可,卻同時拿不出任何它幫助人們活得更久或更好的證據。
對正在衡量如何監管醫療 AI 的主管機關、正在決定採購什麼的醫院,以及在自己療程中遇到演算法建議的病人而言,這項研究無疑是一記當頭棒喝。它留下的問題既簡單又急迫:在智慧系統成為常規醫療的一部分之前,我們該要求什麼樣的證據標準,才能證明它們真的讓照護變得更好?