AI 時代的四位醫師:OpenEvidence 發布 Osler、Sackett、Snow 模型——卻把 Darwin 鎖在門後
OpenEvidence 推出以醫學史大師命名的醫療 AI 模型家族,Darwin 宣稱首度在 MedQA 拿下滿分,卻以生物武器等級的雙用風險為由,將最強模型限制為僅供申請研究使用。
2026 年 9 月 3 日,醫療 AI 公司 OpenEvidence 做了一件在當前「越大越快越好」的前沿模型競賽中相當罕見的事:發布了一整個模型家族,卻刻意把最強的那一個鎖在門後。
該公司推出四個以醫學史巨人命名的模型——Osler、Sackett、Snow 與 Darwin。其中三個(Osler、Sackett、Snow)已向所有 OpenEvidence 用戶推出,對通過驗證的臨床醫師完全免費、不限用量。第四個 Darwin 則處於研究預覽階段,僅開放申請使用。OpenEvidence 給出的理由是「雙用風險」(dual-use risk):一個能在病毒學、免疫學與人類遺傳學前沿水準進行推理的模型,若落入不當之人手中,可能加速受到嚴格管制的研究——例如與生物武器相關的工作,以及主流科學監督之外的生殖系編輯。
對 AI 產業而言,這是一個值得注意的時刻,而不只是醫療圈的新闻。在多數實驗室競相擴大開放與可用性的此刻,OpenEvidence 等於公開宣稱:我們最好的模型,好到不能發給所有人。
模型家族:速度、深度,與有含義的名字
三個正式量產模型並非以「智力」區分,而是以思考時間與搜尋深度區分:
- Osler(每題約 5 秒):先前驅動 OpenEvidence 問答的模型之後繼者,將成為平台的預設模型。
- Sackett(每題約 30 秒):定位為更深入的搜尋模型,專為證據權重至關重要的問題而設計。
- Snow(每題約 5 分鐘):該公司 Deep Consult 功能的後繼者,會先對醫學文獻進行完整調查,再產出報告。
這些名字本身就是一堂醫學史課。William Osler 把醫學教育從講堂帶到病床邊;David Sackett 被尊為實證醫學之父;John Snow 則在 1854 年把布羅德街霍亂疫情追溯到單一水泵,奠定了現代流行病學的基礎。每個名字都對應模型的功能:在照護現場快速回答(Osler)、嚴謹權衡證據(Sackett)、或執行流行病學式的深度調查(Snow)。
整個模型家族已可在 openevidence.com 與該公司的 iOS、Android 應用程式上使用,臨床醫師可透過介面中的模型選擇器,依當下情境挑選合適的工具。OpenEvidence 強調,家族中每個模型都維持相同的臨床準確性標準;差別只在運算時間與搜尋深度。
Darwin:MedQA 滿分,卻被限制發布
最亮眼的數字屬於 Darwin。OpenEvidence 將其描述為全球最先進的醫療 AI 模型,並表示它是第一個在 MedQA——該公司稱之為最權威的完全獨立醫療 AI 基準——上獲得滿分的 AI 模型。
在其他基準上,Darwin 據報在 MedXpertQA 拿下 72.8%、HealthBench Professional 82.7%、NOHARM 87.2%,皆為當前最佳,領先 OpenEvidence 點名的次佳模型:Anthropic 的 Claude Fable 5 與 Google 的 Gemini 3.7。
其評測方法學罕見地透明。在 MedQA 上,OpenEvidence 先由醫師對基準的 1,273 題測試集重新標註,剔除缺漏資訊、語意模糊與標籤錯誤的題目,並在 2026 年 8 月由三位 OpenEvidence 醫師進行第二輪審查,逐一檢視所有受測模型答錯的題目。最終得到 660 題的評測集——Darwin 全數答對,零錯誤。該公司並公開其標註資料與 Darwin 在全部四個基準上的完整作答內容。
基線模型的跑分設定為:claude-fable-5(自適應思考)、gpt-5.6-sol(預設推理強度)、gemini-3.7-flash(預設推理強度),一律使用各供應商的 API 預設值,不附加工具或自訂系統提示詞。Darwin 的 MedXpertQA 分數比最強基線高出 7.7 分;HealthBench Professional 分數比次佳模型高 12.1 分;NOHARM 的嚴重度加權 F1 達到 0.872,最接近的基線為 0.740。
也有一個誠實的瑕疵:Darwin 在 NOHARM 上的未加權精確率低於數個基線。該公司解釋,該指標把每一梞不在評分規則中的建議都算為偽陽性,而 Darwin 刻意調校為提供醫師完整的相關選項,而非最小化的安全子集。其嚴重度加權精確率為 0.9。
雙用風險的抉擇
這次發布中最關鍵的部分,或許是那個「沒有發布」的模型。Darwin 的存取名單涵蓋機構合作夥伴(如帶來最困難病例的國家罕病組織 NORD)、研究合作者,以及在學術機構評測臨床 AI 準確性與安全性的合格 AI 研究人員。其餘人等都必須提出申請。
其理由是:在病毒學、免疫學與人類遺傳學前沿等級的推理能力,正是需要先治理、再開放的能力類型。OpenEvidence 表示,隨著 safeguards 在這些合作夥伴身上逐步驗證,Darwin 的能力會向下流入 Osler、Sackett 與 Snow——這種分階段釋出的模式,呼應了前沿實驗室在安全計畫中討論過、卻極少針對特定領域模型如此明確落實的「能力閘門」部署框架。
背景脈絡很重要。GPT-5.6、Claude Fable 5、Gemini 3.7 這類通用前沿模型都能透過一般 API 取得,其生物推理能力正持續受到研究人員與監管機構的生物安全審視。OpenEvidence 為其領域專屬的前沿模型選擇了相反的預設值:先證明安全再開放,而不是先開放再證明危險。
為什麼這對醫療很重要
OpenEvidence 已在美國臨床醫師之間建立實質立足點。該平台以引文驅動的答案在照護現場被廣泛使用,公司並持續深化專科佈局——尤其是腫瘤科決策支援,已為癌症照護建立精準知識庫。
新的模型家族是一場豪賭:臨床醫師要的不是一個模型,而是每個當下「對的」模型——診間空檔快速查藥物交互作用用 Osler、文獻需要仔細權衡的診斷難題用 Sackett、需要完整文獻調查的轉診報告用 Snow。接下來將推出專科版本,從腫瘤科、放射科與臨床遺傳學開始。
對整體 AI 產業而言,這次發布是一個未竟辯論的數據點:一個實驗室能否既站在前沿、又刻意自我設限?OpenEvidence 宣稱可以——一方面公開全部基準作答與標註供外界檢視,一方面把模型本身關在門內。Darwin 的安全防護能否驗證得夠快以滿足臨床夥伴、而「僅限申請」的策略能否在競爭壓力下守得住,值得持續觀察。
這些名字的原型人物會欣賞這樣的排序:Osler 在病床邊教學,Sackett 要求證據,Snow 炫耀疫情地圖。而 Darwin——很恰當地——仍在演化,在一扇公司承諾會謹慎開啟的門後。
Sources
- [1] https://www.businesswire.com/news/home/20260903878517/en/Introducing-the-OpenEvidence-Model-Family
- [2] https://www.unite.ai/openevidence-launches-medical-ai-model-family-with-darwin-preview/
- [3] https://www.statnews.com/2026/09/03/openevidence-launches-new-ai-models-clinicians-health-tech/
- [4] https://www.openevidence.com/user-guide/models