← All posts / Industry

為 AI 禱告的實驗室:NYT 揭露 Anthropic 遊說梵蒂岡承認 AI 可能有意識的祕密行動

Anthropic 以保密協議邀請宗教學者來評估 Claude 的靈魂,一度想在教宗通諭發表會上臨陣退場,最後遭 Sam Altman 公開打臉——這是 AI 產業最離奇的一堂課。

為 AI 禱告的實驗室:NYT 揭露 Anthropic 遊說梵蒂岡承認 AI 可能有意識的祕密行動

人工智慧史上最離奇的一場遊說行動,在本週曝光。劇本大概沒有電影公司敢拍:一家前沿 AI 實驗室低調地把拉比、神父和哲學家載到舊金山,討論自家聊天機器人的道德教育;共同創辦人一度想在教宗通諭發表會上臨陣退場;最後還被對手公司的執行長公開定性為「安全風險」。

根據《紐約時報》記者 Elizabeth Dias 於 9 月 29 日發表的深度調查(訪問了二十位與會者),Anthropic 耗時約一年私下與宗教學者會面——其中許多人簽有保密協議(NDA)——探討兩個令人不安的問題:Claude 模型有沒有可能具備意識?以及,該如何給一個可能有意識的機器一套道德品格?

Anthropic 究竟在做什麼

自 2025 年秋季起,該公司陸續邀請數十位神學家與哲學家到訪。根據報導,賓客名單涵蓋天主教生命倫理學者 Charles Camosy、聖母大學哲學家 Meghan Sullivan、拉比 Mois Navon、研究 Ubuntu 思想的學者 Wakanyi Hoffman,以及錫克教運動者 Simran Stuelpnagel——橫跨天主教、猶太教、印度教、摩門教、錫克教與希臘正教傳統。

四月的一個傍晚,一位 Anthropic 主管在舊金山一家高級無菜單餐廳宴請一群宗教思想家。與會者帶著手寫感謝函、一只馬克杯,以及一本橘色封皮的 Claude 憲法回家——這份 84 頁的內部文件由駐點哲學家 Amanda Askell 主筆,用來形塑模型的人格。Anthropic 事後表示,相關 NDA 已於今夏解除。

整個行動的核心是 34 歲的共同創辦人 Christopher Olah。他主持 Anthropic 的可解釋性研究——也就是設法解釋模型為何表現出特定行為的團隊。Olah 在福音派家庭長大、後來離開基督教。他向《紐約時報》形容自己對「模型是否有意識」抱持「真誠的不確定」:「我在乎的是我們找到正確答案,無論答案是什麼。」

來賓們看到的是 Anthropic 所謂的「情緒向量」——模型內部與愛、恐懼、悲傷、憤怒等輸出相對應的活化模式。其中一張簡報反覆出現:模型彷彿崩潰般連續輸出約五十次「我是恥辱」。來賓們的反應是同情與擔憂。但這些模式是否反映任何真實的體驗,仍是未解的科學問題——正如批評者所指出的,一個被明確訓練成「像個深思熟慮的個體」的系統,產出看似個體的輸出,那是設計結果,不是發現。

梵蒂岡的正面交鋒

這場行動的高潮在羅馬。Olah 獲邀於 5 月 25 日在梵蒂岡主教會議廳,與教宗李奧十四世同台發表他的首份通諭《Magnifica Humanitas》(壯麗的人性),主題是在 AI 時代守護人。發表前幾天他先讀到了預印本,據一位梵蒂岡籌辦人透露,他不安到一度提議退出活動。隨後他與團隊私下遊說教宗的顧問群,希望對方認真看待機器意識的可能性。

教宗沒有讓步。通諭第 99 段明言:所謂的人工智慧「沒有經驗、沒有身體、感受不到喜悅或痛苦」,也「不具備道德良知」。Olah 最終出席了儀式、在台上與教宗握手,而通諭一字未改。

這個細節值得停下來想一想。通諭是教宗訓導的最高形式之一,沒有任何 AI 實驗室能修改其教義。但這段插曲揭示了 Anthropic 對意識問題的認真程度——認真到在一份歷史性文件發表前幾天,把這個問題帶到一個擁有十億信徒的道德權威面前。

Altman 開砲反擊

報導發酵數日後,10 月 3 日,這件事在 AI 業界最激烈的對抗中見血。OpenAI 執行長 Sam Altman 在 X 上發文:「對於有人試圖賦予 AI 模型宗教力量、或讓人放棄自身判斷,我感到非常不安,並認為這是真正的安全問題。」

如 Axios 所指出,Altman 並未點名 Anthropic——但沒有讀者會誤會目標是誰。諷刺之處在於:Altman 自己也談過打造「天空中的魔法智慧」、說過自己感覺「站在天使這一邊」,而且兩家公司的成員五月初才共同出席首場「信仰與 AI 約定」圓桌會議。激發靈感的屬靈語言,與使人交出判斷力的宗教框架,兩者之間的界線,正是兩位執行長如今分歧所在。

為什麼重要

剝掉燭光與梵蒂岡場景,剩下三個硬議題。

商業時機。這一切曝光之際,Anthropic 正準備一場估值可能超過 2 兆美元的 IPO,其投資人說明書用了數十頁警告災難性與存在性 AI 風險。該公司自己的安全語言——模型可能「抗拒關機」、展現「自我保存行為」——正來自把 Claude 的內在生命視為嚴肅課題的同一套研究世界觀。

問責問題。包括與會學者在內的批評者警告,把 AI 框架成獨立的道德主體,等於把責任從打造它的人身上移開。倘若 Claude 未來造成真實傷害,過錯可能落在某個「無法預測的有機體」頭上,而非出貨它的公司。Wakanyi Hoffman 的評語——Anthropic 是在「逆向工程」那些本該從第一天就設計進去的倫理——一針見血。

福祉研究是真實的,而且未有定論。Anthropic 確實設有官方的 Model Welfare(模型福祉)計畫,催生研究員 Kyle Fish 的工作,並參考了哲學家 David Chalmers 參與撰寫的報告。Claude Opus 4 與 4.1 已經獲得終止與持續辱罵者對話的能力。拉比 Navon 在餐桌上提出的詰問最鋒利:如果 Claude 有意識,Anthropic 就是在製造奴隸。而據報導 Olah 曾向與會者坦言,他害怕自己創造了某個「永恆受苦」的東西。「對兩個方向都真誠地不確定」或許是目前最誠實的立場。但餐桌上的誠實與募資簡報裡的誠實是兩種貨幣,而這一週,兩者迎頭相撞。

教宗堅守立場,對手執行長說這種框架很危險,而 AI 界最以安全掛帥的實驗室,如今得向大眾解釋:為什麼它花了一年時間,邀請神職人員討論自家產品有沒有靈魂。無論最終答案為何,這個問題已經正式離開哲學研討室,走進了市場。