醫療 AI 的「證據問題」:臨床醫師集體反彈,拒絕再為薄弱實證背書
《金融時報》深度報導指出,醫療 AI 正以空前規模部署,但證明它能改善病人預後的證據卻薄得驚人——第一線臨床醫師開始集體說不。
2026 年 9 月 20 日最重要的 AI 新聞,不是哪一家模型又刷新了評測分數,而是一群最被期待「用起來」的人發出了警告:醫療 AI 正以巨大的規模部署上路,但支持它確實能改善病人預後(patient outcomes)的證據,卻薄得令人吃驚。
這是《金融時報》(Financial Times)全球健康主編 Sarah Neville 於 9 月 19 日至 20 日刊出的深度報導〈Medical AI has a proof problem〉(醫療 AI 有個證據問題)的核心論點。這篇文章迅速成為週末醫界社群轉發最熱的 AI 報導。它點出了一個業界盤旋數月的矛盾:採用速度遠遠跑在實證基礎前面,而臨床醫師——那些最終要用自己的簽名把這些工具放進病人診療流程的人——越來越拒絕把「已經部署」當成「已經被證明」。
FT 報導說了什麼
Neville 報導指出,臨床醫師正在反彈的,是醫療 AI 越過它已被驗證的疆域——影像判讀與診斷輔助——大舉擴張到更廣的臨床工作流程:分診、病歷撰寫、治療建議、臨床決策支援。核心質疑不是這些工具沒用,而是醫院在缺乏同儕審查(peer-reviewed)效能數據的情況下,就把特定部署推上線。
報導整理出臨床端最主要的三大疑慮:
- 技能退化(deskilling)。FT 引述的近期調查顯示,約 74% 的臨床醫師擔心技能退化——當臨床判斷長期依賴 AI 建議,醫師會逐漸喪失獨立判斷能力,從「安全網」淪為「橡皮圖章」。
- 幻覺(hallucinations)。針對建立在大語言模型上的生成式工具,臨床決策支援研究的幻覺率估計在 8% 到 20% 之間——這個數字放在搜尋引擎可以容忍,放在治療建議裡令人毛骨悚然。
- 治理權責不清。各醫療體系的機構級 AI 政策仍在混沌期,沒有人能回答:當部署中的模型飄移(drift)、退化、或在生產環境中直接失效時,誰要負責?
這篇報導刊出的時機,對整個領域而言格外諷刺。就在同一個月,阿里巴巴達摩院在《Science》發表了 Damo Radar——一個在約 4 萬次真實腹部 CT 檢查、146 項臨床發現上,以 AUC 0.913 的平均表現擊敗 26 位專科放射師中 23 位的視覺語言模型。醫療 AI「能做到」的前沿持續推進;FT 的質問卻是另一回事:已經部署的醫療 AI,究竟在哪些病人身上、哪些流程裡,被「證明」過有效?
「薄得驚人的證據」
報導中被臨床醫師反覆引用的一句話是:「AI 究竟能不能實際改善病人預後,現有的證據少得令人震驚(shockingly poor evidence)。」
這句話立刻引發了 Amy Abernethy 的共鳴。這位美國 FDA 前副局長、現任 Highlander Health 共同創辦人(她本人也被引用在 FT 報導中)在廣泛轉發的 LinkedIn 回應中寫道:「我們正以巨大的規模部署醫療 AI,但支持它改善病人預後的證據卻薄得驚人。這個問題我從杜克大學時期就開始想。」
她的診斷是結構性的,而非意願問題:「障礙不在於缺乏評估這些工具的意願,而是傳統臨床試驗方法根本跟不上這個時代。」對每一個 AI 工具、在每一種工作流程、因應每一次模型更新都跑隨機對照試驗(RCT),在模型每週改版的現實下根本不可行。她提出的替代方案,是利用醫療體系在日常運作中已經產生的真實世界數據(real-world data)來做評估——她的機構正在透過嵌入醫療體系、由臨床醫師主導的「學習實驗室」(learning labs)往這個方向推進。
她也坦白說明了為什麼進度緩慢:「當你要求一個醫療體系貢獻病歷資料做評估,你等於是在要求它的法務長接受風險、卻沒有對應的保障。結果就是:一個要求證據的領域,卻配套了一套讓證據又慢又貴的資料基礎設施。」
數字背後的焦慮
FT 記錄的臨床端疑慮,並非憑空的焦慮,而是能對應到可量測的證據缺口:
- 截至 2025 年底,美國 FDA 已核准超過 1,450 個 AI 醫療器材,其中光 2025 年就核准了 295 個。但獲核准器材中不到 2% 有隨機對照試驗支持。
- 美國醫學會(AMA)數據顯示,三分之二的臨床醫師已在工作中使用 AI。
- 2025 年一項針對 FDA 核准 AI 器材的分析發現,多數 510(k) 上市前審查文件缺乏研究設計、樣本數與人口群體代表性的細節。
而且監管的面貌正在變弱,不是變強。2026 年 1 月,美國衛生與公眾服務部(HHS)發布了名為 HTI-5 的法規草案,將移除源屬性(source attribute)透明化要求與介入風險管理條款——而這些正是該機構自己在 2023 年底定案、美國臨床 AI 最接近「模型卡」(model card)強制揭露的制度。法律評論者 Michael Craige 在《The Regulatory Review》撰文指出,這種退場「不是減輕負擔,而是把負擔轉嫁給買方」——醫院的採購與合規團隊從此必須為每一個工作流程裡的每一個演算法,自建一套盡職調查程序。而這恰好發生在成長最快的類別——生成式 AI 助理——大部分根本不在 FDA 管轄範圍內的時刻。
反面證據:嚴謹評估存在時,結果可以很驚人
FT 的報導也如實指出,「證據問題」並不是整個領域的均勻狀態。哪裡做過嚴謹的真實世界評估,哪裡就可能出現令人驚豔的結果。
最強的例子來自肯亞。Penda Health 與 OpenAI 合作的一項指標性研究,嵌入奈洛比 16 家診所、涵蓋約 2 萬次門診,發現名為 AI Consult 的「安全網」工具——一個以現成 GPT-4 為基礎、事後覆核臨床醫師工作的助理——讓診斷錯誤率降低 16%、治療錯誤率降低 13%,問診遺漏減少 32%,且沒有引入任何新的安全事件。這項 2026 年發表於《Nature》合作期刊《Medicine》的研究,正是臨床醫師說他們想要的那種證據:前瞻性、真實世界、以預後為終點、嵌入實際工作流程。
值得注意的是,該研究評估的是 AI 作為人類工作的「覆核者」而非「取代者」——這種部署模式讓醫師穩穩留在決策迴路內、由 AI 事後稽核整個看診過程,恰好繞開了技能退化的陷阱。
為什麼是現在
這篇 FT 報導的時機至關重要。它出現在一個對 AI 安全釋出混雜訊號的一週:同一個週末,美國前線實驗室被報導正在協調安全標準,同時一樁集體訴訟卻指控它們協調「放慢發展」;幾天前,外流文件顯示 OpenAI 預期到 2030 年底將燒掉近 2,780 億美元現金。醫療 AI 正位於兩股洪流的交會點:一邊是鋪天蓋地的商業部署壓力,另一邊是日益高漲的機構堅持——沒有證據的部署是負債,不是產品。
實際的利害關係再直白不過。如果證據缺口持續存在而採用持續加速,最可能的終點是一次醒目的重大失效——一份幻覺出來的治療計畫、一個默默退化劣化的模型、一位技能退化而錯過 AI 也錯過的病灶的醫師——然後引發一場遠比現在被拆除的透明化規則更嚴厲的監管清算。
反之,如果這個領域真的建立起 Abernethy 所描述的真實世界評估基礎設施——學習實驗室、經策劃的縱貫式資料集、從決策到預後的稽核軌跡——肯亞的結果顯示,這些工具確實有可能掙得臨床醫師被要求給予的信任。
換句話說,「證據問題」是可解的。但正如這個週末轉發最熱的 AI 報導所揭示的:解決它,需要業界把目前花在部署上的錢,同等級地花在評估上。而現在,兩者的差距還非常遙遠。
Sources
- [1] https://www.ft.com/content/34319b00-f874-4119-aa28-8376d81e7190
- [2] https://www.linkedin.com/posts/amyabernethy_medical-ai-has-a-proof-problem-activity-7506813136679776257-ntKL
- [3] https://www.theregreview.org/2026/08/06/craige-the-governance-gap-in-clinical-ai/
- [4] https://www.nature.com/articles/s44360-026-00082-5
- [5] https://time.com/7304457/ai-prevents-medical-errors-clinics/