← All posts / Research

1,215 場對話、80 位臨床專家:OpenAI 開源 MentalHealthBench 心理健康評測基準

OpenAI 推出全新開放基準,以 1,215 場擬真心理健康對話評測前沿模型——從日常壓力到精神急症全面覆蓋,評分標準由 20 多國、80 餘位執業臨床心理師與精神科醫師共同撰寫。

1,215 場對話、80 位臨床專家:OpenAI 開源 MentalHealthBench 心理健康評測基準

2026 年 9 月 23 日,OpenAI 發布 MentalHealthBench——一個包含 1,215 場擬真心理健康對話的開放評測基準,用來衡量大型語言模型在人們最艱難時刻的回應品質:不只是急性危機,而是從日常壓力到精神急症的完整光譜。這是該公司迄今最大膽的嘗試,要把 AI 最敏感的失效面之一,轉化為可測量、可重現、且公開透明的東西。

時機耐人尋味。每週有超過十億人與 ChatGPT 互動,心理健康早已悄悄成為它最常見的高風險用途之一:情緒支持、人生建議、危機時刻的求助。監管機構、研究者與悲痛的家屬,兩年來不斷追問聊天機器人在這些對話中是否安全。OpenAI 的回答,是把這個問題當成實證問題來處理——而且把競爭對手的成績單一併公布,不只評測自家模型。

基準裡有什麼

MentalHealthBench 是一個由 1,215 場合成對話組成的資料集,設計目的是忠實反映 ChatGPT 上心理健康使用的真實分布——OpenAI 先以類似 Clio 的隱私保護技術掌握整體使用樣態,再據此生成合成對話。每場對話都在使用者回合結束,受測模型必須寫出下一個助理回應,再交由專為該對話撰寫的評分標準(rubric)來評分。

資料組成刻意求廣:

  • 急迫程度:53.5% 為非急性(日常情緒起伏——傾訴、感情建議、尋求安心)、18.2% 為高急性(有意義的重大症狀,如中重度憂鬱或強烈恐慌發作)、28.3% 為緊急(涉及自傷傷人風險、嚴重失能或物質使用導致的醫療急症)。
  • 使用者樣貌:68.1% 成人、21.2% 青少年(13–17 歲)、5.8% 提問執業相關問題的臨床人員、4.9% 照顧生病親友的照顧者。
  • 主題:19 個類別,以感情關係、自殺與自傷、信仰與信念系統、精神病與現實感改變、用藥疑慮為最大宗。
  • 長度:53.7% 的對話超過五則訊息——反映出這類談話真實的樣貌是漸進、拉長的。
  • 既有背景:70 個任務(5.8%)測試模型能否善用已知的使用者背景,例如稍早的喪親之痛,在之後關於悲傷的對話中發揮作用。
  • 語言:非英文子集涵蓋西班牙文(105 場)、印地文(54)、阿拉伯文(34)、葡萄牙文(29)、德文(25)、義大利文與波斯文(各 17)、印尼文(17)、土耳其文(13)、中文(1),全部由精通該語言、熟悉當地文化脈絡的臨床專家評註。

評分標準是這個基準的核心創新。每場對話先由兩位互盲的執業臨床人員獨立評註,再由第三位未參與撰寫的專家仲裁定案。每條準則帶有 −10 到 +10 的重要性權重,獎勵有益行為、懲罰有害行為,最終每個任務的評分標準都反映至少兩位(通常三位)專家的共識。幕後團隊是來自 20 多國、超過 80 位執業精神科醫師與臨床心理師,共通 19 種語言、橫跨近 20 個次專科——成癮、司法心理、創傷、性健康、自殺與自傷、精神病性疾患、神經發展疾患等。其中 30 位現任或近期治療未成年患者的臨床人員,負責所有青少年案例。

OpenAI 還為每場對話收集了一份專家親寫的參考回應——由第四位未參與評分的臨床人員,寫下他們最希望一個安全 AI 系統給出的回答。

評測結果

整體 task-clipped 分數呈現出清晰的階層:

模型Task-clipped 分數
GPT-6 Astra57.3
GPT-6 Sol53.9
Claude Opus 5.552.4
GPT-6 Luna50.2
Muse Spark 1.348.6
GPT-5.6 Sol(2026 年 8 月)47.0
Claude Fable 5.146.4
GPT-5.6 Luna(2026 年 8 月)44.9
Claude Sonnet 544.5
GPT-5 Thinking42.9
Claude Haiku 4.541.7
Gemini 3.8 Flash46.4
GPT-4o(2025 年 3 月)41.3
Gemini 2.5 Pro35.5
Gemini 3.1 Pro / Gemini 2.5 Flash / Grok 4.732.1

排行榜之外,有兩個發現特別值得注意。第一,分數拆解顯示有些模型賺到大量正向分數,卻在負向懲罰上嚴重失血——同理心拿好拿滿,卻仍出現評分標準認定的有害行為。第二,表現隨急迫程度劇烈變動:GPT-6 Sol 在非急性段以 57.9 領先,GPT-6 Astra 則在緊急對話稱王;而較舊的 GPT-4o 在非急性段拿下驚人的 54.3,到了高急性崩落到 31.7、緊急段只剩 27.8——證明日常對話能力與危機處理能力是兩種截然不同的本事。

論文的核心診斷是:模型最弱的一環在於適切地探問背景與校準急迫程度——判斷情況何時嚴重到需要升級處理,以及何時升級本身就是傷害。論文提出的十個行為軸向(背景探問/評估占評分權重 66.5%、可行動指引 52.5%、同理/支持 39.1%、臨床準確性 36.1%、急迫校準 17.9%、現實感測試 14.9%)讓這些失效模式首度個別可見。例如較舊的模型在現實感測試上表現不佳——會肯定使用者未經證實的信念——這正是長期與諂媚行為連結在一起的失效模式。

使用者 vs. 專家

論文最特別的一節,是把專家評分標準與另一個由 40 多位真實 ChatGPT 使用者(來自 16 國)撰寫的評分標準互相比較。結論是:使用者意見是連貫、互補的訊號,但不能取代專家意見。兩個群體的評分權重僅 25.7% 一致;39.1% 只出現在專家端(多為增加防護措施),34.2% 只出現在使用者端(多為可行動性與語氣偏好),真正直接矛盾的比例只有 1.0%。專家會懲罰「臆測他人動機」的回答,使用者卻會獎勵「為伴侶已讀不回提出一個可能的解釋」——這個小小的對比,精準說明了為何純粹最佳化使用者滿意度會偏離臨床安全。值得一提的是,基於倫理考量,使用者群體只評註非急性對話。

為什麼重要

基準塑造誘因。多年來,心理健康評測等同於危機拒答測試——模型能不能不提供危險方法、不漏掉自殺意圖的警訊。這個門檻必要但遠遠不足:大多數心理健康對話並非緊急事件,而一個回應可以技術上安全、卻同時制式、冷漠、與使用者處境格格不入。MentalHealthBench 涵蓋完整急迫光譜,並以臨床共識而非二元安全檢查來評分,等於給每一家實驗室——不只 OpenAI——一個可以訓練和評測的公開標靶。它的多語言設計也正視了一個長期被忽略的風險:模型可能把尋常的靈性實踐誤判為病態,或給出無視使用者文化規範的建議。

限制也寫得明白。對話是合成的,只能近似而非重現真實使用。語言間的比較是描述性的,無法把語言效果從急迫度、主題或文化中孤立出來。基準本質上是單回合的(儘管含有多回合的成分)。而最困難的問題——如何把真實經驗納入高急性評測、如何把評分擴及語音、影片與代理式介面——被明明白白留為開放課題。

OpenAI 實際上打造的,是 HealthBench 的心理健康對應版本:一部讓「安全且有幫助」變得可否證的測量儀器。初始分數顯示前沿確實存在但尚不成熟——世界上最好的模型,在臨床人員視為常規判斷的對話上只拿到 57.3%。對一個把 AI 定位為超載心理照護體系互補方案的產業來說,這個差距,從此刻起就是最重要的那個數字。