← All posts / Research

一個模型、三個國家、百萬病患:Google ARDA 視網膜 AI 發表規模化部署經驗

Google 與印度、泰國、澳洲臨床夥伴在《Nature Medicine》發表評論,整理糖尿病視網膜病變 AI 十年部署、突破百萬人次篩檢的規模化心得。

一個模型、三個國家、百萬病患:Google ARDA 視網膜 AI 發表規模化部署經驗

一個模型、三個國家、百萬病患:Google ARDA 視網膜 AI 發表規模化部署經驗

大多數臨床 AI 從未離開最初驗證它的那家醫院。2026 年 9 月 23 日,Google 為一個真正做到的系統交出了成績單:《Nature Medicine》刊登的一篇 Comment,記錄同一套糖尿病視網膜病變(diabetic retinopathy)深度學習篩檢系統,已在三個截然不同的醫療體系中累計服務超過一百萬名病患——印度馬杜賴的 Aravind Eye Care System、泰國曼谷的 Rajavithi 醫院,以及澳洲西部的 Lions Outback Vision。

這篇論文由 Google 的 Richa Tiwari、Rajroshan Sawhney 與 Kasumi Widner 領銜,與各合作機構的臨床醫師共同撰寫。它不是一份臨床試驗報告,而是更罕見的東西:一份部署回顧。作者刻意把重點放在「可為全球醫療 AI 擴展提供借鑑的跨領域洞察」——也就是介於演算法與病患之間、決定醫療 AI 能否在真實診所存活的那些不起眼的工作。

疾病與工具

糖尿病視網膜病變是可預防失明的主因之一。將近一半的糖尿病患者會出現某種程度的視網膜病變,而全球糖尿病人口——至少 5 億 3,700 萬成年人,其中亞太地區約 2 億 2,700 萬——遠超過可用的眼科專科醫師數量。在印度與泰國,專科醫師短缺之嚴重,使得許多病患在視力已經開始惡化後才被診斷出來。

論文核心工具是 ARDA(Automated Retinal Disease Assessment,自動視網膜疾病評估)——一個讀取眼底照片、標記需轉診糖尿病視網膜病變與糖尿病黃斑部水腫的深度學習模型。Google 約十年前與 Aravind、Rajithi 等奠基研究夥伴展開這項計畫,早在 2016 年就在《JAMA》發表早期驗證研究,並自 2018–2019 年起投入實際臨床部署。稍早的上市後報告涵蓋印度前 60 萬名篩檢病患;這篇新 Comment 則將三個錨定部署點的紀錄總數推過一百萬。

值得強調的是,Google 已不再單獨營運這些計畫。模型授權給醫療科技夥伴——印度的 Forus Health 與 AuroLab、泰國的 Perceptra——由他們負責當地法規核准、硬體整合與診所營運。既定目標是未來十年在印度與泰國合計提供 600 萬次免費 AI 輔助篩檢,泰國公共衛生部醫療服務司(DMS)也正把模型納入國家篩檢創新計畫。

百萬人次教會了大家什麼

這篇論文的價值,在於它拒絕假裝規模化只是軟體問題。作者歸納的心得圍繞三個主題。

第一,瓶頸在工作流程,不是準確率。 一個在實驗室表現優異的模型,在被嵌入診所的病患動線之前什麼也改變不了:誰拍照、誰諮詢病患、模型回傳結果後九十秒內發生什麼、答案若是「需轉診」時由誰接手。三個錨定站點各自用不同方式解決這件事——Aravind 在高流量眼科專科醫院內、Rajavithi 在連結國家篩檢計畫的公立綜合醫院內、Lions Outback Vision 則透過行動醫療與遠距服務橫跨西澳廣袤的鄉村。同一套演算法在三者都成功,是因為周邊流程每次都被重新設計過。

第二,部署會暴露試驗計畫掩蓋的資料完整性債。 正如細讀這篇 Comment 的臨床營運分析所指出的:局部驗證指標看起來乾淨,但彙總表現底下藏著變異——來自不一致的影像標註、各站點不同的取像協定、病患人口結構的錯配。兩個站點之間相機韌體的差異,對模型不可見,對輸出卻是決定性的。百萬人次的資料集讓這種變異第一次變得可衡量,而任何單站點試驗都做不到。

第三,監測是永久義務,不是上線任務。 稍早的印度上市後報告本身就是在論證「部署後應發表演算法臨床表現」——「與監管機關的建議一致」——新的 Comment 進一步延伸這個立場:表現必須在部署系統的完整人口與營運範圍內持續監看,而不是在研究開始時認證一次就了事。這與監管趨勢一致,從 FDA 對 AI 醫療器材的「全產品生命週期」思維,到 WHO 的健康 AI 六大監管領域。

Comment 格式為何重要——又省略了什麼

必須精確理解這篇論文「不是」什麼。它沒有公布各國準確率數字、沒有相機型號分解、也沒有錯誤轉診率。正如 AI Weekly 的編輯註記所言:「Comment 格式把各國的失敗模式與準確率數字留在頁面之外。」框架刻意放在工作流程與部署經驗,而非臨床表現數字——那些存在於稍早的同儕審查評估中。

這種節制是雙刃劍。一方面,僅憑這篇論文,百萬人次的數字無法被獨立分解為各國的敏感度與特異度。另一方面,這也表示作者公開了廠商極少主動提供的東西:決定一個臨床表現優異的模型是死在試驗階段、還是觸及百萬人的營運經驗。

更廣的意義

對臨床 AI 領域而言,ARDA 這份回顧出現在一個冷靜反思的時刻。文獻中大量是單中心驗證研究,它們一旦碰到新的 EHR 架構、取像協定與病患族群,實 world 表現便直線下滑。一份公開、跨越十年、三個國家的部署紀錄——包括失敗與修正——為醫院採購方、監管機關,以及日益增多的臨床基礎模型公司,提供了真正的參考點。

它也描繪出大型科技公司「負責任地退場」臨床 AI 營運的模板:Google 貢獻模型與研究夥伴關係,在地被授權者擁有法規核准與交付,公共衛生部門把工具整合進既有國家計畫。這個模板能否推廣到眼底照片以外、標準答案不如視網膜病變明確的疾病,仍是未解的問題。

一百萬次篩檢同時是個大數字與小數字:相對於 5 億 3,700 萬糖尿病人口只是零頭,卻證明了臨床 AI 可以被治理、監測、跨國規模化而不崩潰。這篇論文真正教會我們的是:最難的部分從來不是模型。

資料來源