← All posts / Policy

Anthropic 投入 500 萬美元,資助獨立研究 AI 對使用者福祉的影響

Anthropic 於 2026 年 8 月 25 日宣布啟動 500 萬美元補助計畫,資助完全獨立、開源的研究,評測 AI 模型對使用者福祉的影響——申請截止於 9 月 21 日,10 月 5 日通知入選者提交完整提案。

Anthropic 投入 500 萬美元,資助獨立研究 AI 對使用者福祉的影響

2026 年 8 月 25 日,Anthropic 宣布啟動一項 500 萬美元的補助計畫,資助獨立研究 AI 對使用者福祉的影響。這項計畫將提供直接經費、Anthropic 模型的存取權限與技術支援,給建造開源評測(open-source evaluations)的研究團隊——也就是整個 AI 產業都能用來衡量 Claude 這類模型如何影響使用者情緒狀態、心理健康與長期福祉的度量工具。

最關鍵的結構性設計在於:獲補助者完全獨立運作,所有產出都以開源形式發布,任何開發者都能取用。Anthropic 等於是花錢購買外部問責機制,而不是再生產一份自家基準測試。時程也相當緊湊——申請截止於 2026 年 9 月 21 日,獲選提交完整提案者將於 10 月 5 日收到通知。

為什麼「福祉」特別難評測

這份公告难得地坦白說明了為何這個領域需要外援。對大多數模型行為而言,評測很直接:看單一回答,判斷是否準確、得當。福祉不是這麼回事。

Anthropic 舉的例子:處於困境的使用者不一定會立刻透露自傷念頭。何時該轉為更謹慎的回應,可能要進行到一段長對話的後期才會明朗——這是單輪測試永遠無法捕捉的脈絡。而且同一個回應在某個情境下合理,在另一個情境下可能有害。若使用者詢問減重,Claude 或許會給出標準的飲食與運動建議——但若這位使用者有飲食失調的病史,同樣的回應就變得不恰當,甚至可能造成實質傷害。

這個框架——福祉評測本質上是脈絡相依、縱向、因人而異的——正是整個計畫的技術核心。它也解釋了為什麼 Anthropic 要向機器學習評測圈之外招募人才:這項計畫鎖定的是懂得衡量「人類結果」的臨床醫師、心理學家與方法學專家,而不只是會評估模型輸出的人。

嚴謹的福祉評測長什麼樣

伴隨補助計畫,Anthropic 的 Safeguards 團隊同時發布了指導文件,說明什麼樣的福祉評測才夠嚴謹、值得作為基礎建設。五項標準特別值得注意:

  1. 清楚陳述要測什麼——什麼算通過、什麼算失敗,以及為什麼重要。模糊的構念只會產生模糊的基準。
  2. 在設計與驗證階段都納入臨床與領域專家,而不是最後才找來背書。
  3. 同時測試「保護」與「傷害」兩面——評估過度順從與過度拒絕的風險。一個對任何困難情緒話題都拒絕互動的模型,對使用者的傷害不亞於魯莽互動的模型。
  4. 反映使用者真實的使用方式——這通常意味著要多輪情境建構,風險在長對話中逐步升高、脈絡不斷變化,而非孤立的一次性提示詞。
  5. 用真實的領域專家驗證評分器,確保模型評分的自動化判斷,與受過訓練的人類結論一致。

雙向傷害標準值得特別留意。產業界對 AI 安全的辯論常常簡化成「模型說了嚇人的話」對上「模型又拒絕了」。Anthropic 的指導文件把兩種失敗模式都正式列為第一級評測目標——等於承認一個對每段情緒對話都迴避的「陪伴型」助理,本身就是一種福祉傷害。

時代背景:AI 已成為情緒基礎建設

這項計畫落在了一個 Anthropic 直接點明的轉折點上:AI 系統已成為人們工作與學習的核心工具,但同時也成了對話夥伴,在人們困難時刻提供情緒支持。然而產業至今仍缺乏明確標準,規範模型在以下情境該如何行為:當使用者開始向模型尋求陪伴,或在心理健康危機中轉向 AI 求助。

這不是假想的使用者群。對人們實際如何與 Claude 對話的研究顯示,尋求支持與尋求建議的對話量相當可觀。這個現實與「缺乏共同度量標準」之間的落差,正是補助計畫想要填補的。Anthropic 這一年持續朝這個方向鋪路——發布自身對 Claude 對話類型的研究、八月初更新 Fable 5 的防護措施,現在則希望透過外部、獨立的工具來檢驗這些工作。

一個模式,與一個對照

福祉計畫是 Anthropic 一連串「外包審視」資助工具的最新一員:Economic Futures Research Fund(研究 AI 對勞動市場的影響)、AI for Science 計畫,以及 2026 年 5 月與蓋茲基金會宣布的 2 億美元全球健康與教育合作。共同設計是 Anthropic 出錢、但不控制研究——這種治理姿態既可讀作真正的安全投資,也可讀作聲譽避險。

最接近的對照組是 OpenAI 於 2025 年 12 月啟動的 AI and Mental Health Grant Program,總額上限 200 萬美元,資助獨立的安全與福祉研究,單筆補助介於 5,000 至 10 萬美元之間。Anthropic 的計畫規模是其 2.5 倍,但更有意義的差異在於對「交付物」的聚焦:Anthropic 不只是資助研究,而是資助開源評測與基準——可重複使用的公共建設,不是 PDF 報告。

後續觀察重點

真正的考驗在 10 月 5 日之後。獲選計畫做出的評測,會不會像 HELM、SWE-bench 或各種安全基準那樣,成為其他實驗室實際採用的產業標準?還是淪為被引用但從未被整合的學術文物?兩個訊號可以判斷:其一,OpenAI、Google、Meta 的模型會不會被第三方拿去跑這些福祉評測;其二,Anthropic 會不會承諾公開報告 Claude 在受補助者所建基準上的表現——包括不好看的那些。

在福祉度量變得跟程式碼基準一樣標準化之前,每一家實驗室的安全主張,本質上都是自己給自己打的分數。五百萬美元,是改變這件事的頭期款。