← All posts / Research

Google AMIE AI 在即時視訊看診中達到執照醫師水準

Google Research 展示 AMIE——一套能進行專家級即時視訊醫療看診的 AI 系統,在診斷準確率、同理心與臨床推理上匹敵甚至超越基層主治醫師。

Google AMIE AI 在即時視訊看診中達到執照醫師水準

Google 的醫療 AI 系統 AMIE(Articulate Medical Intelligence Explorer,清晰表達醫療智慧探索器)達到了許多醫界人士認為還要數年才能實現的里程碑:它現在能夠進行即時視訊看診,其表現在多個面向上匹敵——甚至在某些維度上超越——持有美國執照的基層主治醫師(PCP)。2026 年 8 月 11 日發表的論文《邁向即時視訊看診的專家級醫療 AI》(arXiv: 2608.09861),其結果被譽為臨床 AI 的分水嶺時刻。

AMIE 做了什麼

在一項隨機多組對照評估研究中,Google 讓 AMIE 與十位持有美國執照的基層主治醫師進行對決,雙方分別與專業病人演員進行 100 場模擬視訊看診。由 20 位資深基層臨床評估委員組成的獨立小組負責評審,整項研究彙集了來自 29 位專科醫師共 12,747 條專家標註。

研究設計相當嚴謹:AMIE 不只是文字聊天。它會看、會聽。它在即時視訊對話中解讀病人演員的視覺與聽覺線索,引導虛擬身體檢查——要求演員做出特定動作或展示特定部位——然後進行診斷推理。這一切都融入即時視訊對話的自然流程之中。

這是 AMIE 先前純文字版本的重大進化。現在的系統是一個完整的多模態臨床代理(agent),能夠處理人類醫師在視訊看診時自然會觀察到的面部表情、皮膚狀況、步態、聲音特徵,以及其他身體訊號。

數據令人驚嘆

核心結果:AMIE 視訊版達到 91% 的診斷準確率,其第一順位鑑別診斷在 100 個案例中有 91 例與預設的參考診斷一致。在 100 場模擬看診中,其整體評估得分為 83%,與同一研究中的執照醫師持平,且在多數項目上領先。

臨床評估委員在多項臨床評量標準上,將 AMIE 評為等同或優於執照醫師:包括病史詢問、診斷推理、治療建議、以及身體觀察與檢查。最令人驚訝的是,病人演員在同理心、信任感與對照護品質的信心方面,對 AMIE 的評價甚至優於人類醫師。他們也偏好視訊體驗勝過 AMIE 先前的文字聊天介面,認為能夠看見與被看見是建立信任的關鍵因素。

站在扎實基礎之上

這項視訊看診能力是一個持續超過兩年、不斷累積證據的研究計畫的最新成果。AMIE 首次受到關注是在 2024 年 1 月的 arXiv 預印本《邁向對話式診斷 AI》中,該研究顯示系統在診斷準確率上超越基層醫師,且在專科醫師評比的 32 項臨床軸心中,有 28 項表現更優。該論文隨後於 2025 年 4 月發表於《Nature》(s41586-025-08866-7),更新後的結果顯示 AMIE 在專科醫師評比的 32 項軸心中有 30 項更優,在病人評比的 26 項中有 25 項更優。

2025 年稍晚,Google 展示了 AMIE 能夠在診斷對話中判讀醫學影像——X 光與 MRI——等同於賦予 AI 系統「看見」放射學資料並將其納入臨床推理的能力。一項真實世界臨床可行性研究進一步驗證了系統:AMIE 在其前七大可能診斷中,有 90% 的真實臨床案例能正確涵蓋最終診斷。

2026 年 8 月的視訊看診研究將上述所有能力整合進單一的、即時的、多模態的互動之中——這是迄今為止對一場完整遠距醫療看診最接近的模擬。

為什麼這很重要

其影響遠超出基準測試成績。新冠疫情期間遠距醫療使用率暴增,此後便成為醫療體系的常設環節,但遠端看診的品質始終受限於醫師透過螢幕能觀察到多少。AMIE 即時解讀視覺與聽覺線索的能力——可能比疲勞的人類醫師更加穩定和專注——有機會突破部分限制。

對於面臨基層醫師嚴重短缺的地區,特別是鄉村與開發中國家,一套能透過視訊提供專家級診斷看診的 AI 系統可能帶來變革性的影響。Google 明確將 AMIE 定位為協助而非取代醫師的研究系統——但它所設定的表現門檻,引發了關於人類與 AI 醫師之間未來分工的嚴肅問題。

同理心的結果尤其值得關注。AMIE 與病人演員建立信任感的能力——有時比研究中的人類醫師更有效——挑戰了一個常見假設:AI 系統在醫療的人性化層面永遠會有所不足。來自 AI 系統的模擬同理心是否在倫理上等同於真正的人類同理心,將是醫界必須認真面對的課題。

限制與下一步

Google 一直審慎強調 AMIE 仍是研究系統,而非產品。該研究使用的是與受過訓練的病人演員進行的模擬看診,並非真實病患的真實病況。雖然臨床情境由醫學專家設計且具多樣性,但仍只是真實基層醫師每日遇到之完整案例譜的一個受控子集。真實世界的臨床部署需要經過廣泛的法規審查、安全驗證,以及與現有醫療工作流程的整合。

此外還有開放性問題:AMIE 在訓練資料中代表性不足的人群上表現如何?在邊緣案例和罕見疾病上如何?當視訊訊號品質下降,或病人表現模糊到訓練資料未涵蓋時會發生什麼事?

儘管如此,趨勢已不可逆轉。短短兩年多時間,AMIE 從一個在紙面基準上擊敗醫師的文字診斷聊天機器人,進化為在即時臨床視訊看診中匹敵執照醫師的完整多模態代理——同時還能讓病人感到被傾聽。問題已不再是 AI 能否在遠距醫療中達到臨床水準。而是醫療體系能多快適應一個 AI 已經做到這一點的現實。