← All posts / Policy

讓對手當裁判:Anthropic、OpenAI 與 Google 低調籌組產業自主 AI 安全標準組織,馬斯克要把它變成「互相審查」

三大前沿實驗室自 7 月起秘密召開工作小組會議,設計一套共同安全標準與部署前測試機制;同一週,馬斯克在 All-In 峰會重提「敵對實驗室互相審查」方案,而 Nvidia 與 Broadcom 則堅稱沒有任何需要放慢的事。

讓對手當裁判:Anthropic、OpenAI 與 Google 低調籌組產業自主 AI 安全標準組織,馬斯克要把它變成「互相審查」

當華盛頓還在爭論 AI 風險是否真實存在,實際打造前沿模型的三間實驗室,已經低調著手建立業界自己的答案——一個由產業主導、共享的安全標準組織,在最先進的模型上線前先行測試。

根據 The Information 週末刊出的報導,以及《華盛頓郵報》週一的證實,Anthropic、OpenAI 與 Google 自 7 月起持續召開工作小組會議,設計一個產業主導的組織,為前沿 AI 制定共同安全標準、在部署前測試最先進的模型,並協調任何單一實驗室無法獨自察覺的風險。據與會說法,Google DeepMind 執行長 Demis Hassabis 主張,這個組織應在模型部署前進行測試,並採公私合營的形式。

時機並非巧合。這些會談浮上檯面的同一週,正是 Anthropic 執行長 Dario Amodei 發表「為前沿節奏設速」呼籲、前沿安全團隊離職潮登上頭條,以及川普總統——透過那通給黃仁勳的電話——宣稱整場安全討論是「騙局」的一週。產業組織這個構想,是實驗室們的押注:如果政府不願監管、白宮又對監管概念抱持敵意,那麼唯一剩下且具公信力的裁判,就是產業自己。

這個組織實際上要做什麼

細節仍在流動,但已曝光的範圍比空談具體得多:

  • 共享的部署前標準。 為前沿模型設一道共同的門檻——上架前必須通過哪些測試,讓安全不至於淪為實驗室之間「比誰先放水」的競賽。
  • 部署前測試先進模型。 Hassabis 尤其力主組織應在 frontier 系統發布前進行評估——這個環節目前只發生在各實驗室內部、大門深鎖。
  • 第三方與跨實驗室評估。 報導提及對第三方模型進行 prompt injection 等穩健性測試——這正是今日實驗室極少互相對彼此系統執行的對抗性檢測。

前例其實不遠,而且就在去年。2025 年 8 月,OpenAI 與 Anthropic 公布了史上第一次的聯合對齊評估結果,互相測試對方模型的不當行為與失效模式。那次試點證明了跨實驗室審查在技術上可行;如今提議的組織,則是要把它制度化。

馬斯克的版本:讓對手當裁判

這時就輪到馬斯克登場了。本週在洛杉磯的 All-In 峰會上,與 SpaceX 總裁 Gwynne Shotwell 同台受訪時,馬斯克重新拾起並強化了他 7 月接受《經濟學人》專訪時首次提出的方案:頂尖 AI 實驗室應該在發布前,互相審查彼此的前沿模型。

根據 Fortune 等媒體報導,馬斯克的框架有兩個值得注意的稜角。第一,他主張沒有任何實驗室會真的放慢能力研究的腳步——但它們會「扣住」不對外公開新能力,而審查正應該在這個環節發揮作用。這比全面暫停更細膩,也更接近 Amodei「設速」文章實際的訴求。第二,馬斯克把整件事定位為產業自律:只有當實驗室無法互相問責時,政府才應該在最後關頭介入。

對一個經營 xAI、與談判桌三間實驗室全部正面交鋒、還曾警告 AI 可能「碾碎所有人」的人來說,這個立場相當耐人尋味。它也與當下的政治氛圍完美接合——白宮 AI 顧問 David Sacks 本週告訴 CBS,安全是實驗室的工作、不是政府的;眾議院議長 Mike Johnson 也說應由產業領袖來帶頭。「互相審查」是「產業會自己處理」這句話的各種版本中,唯一自帶機制的一個。

反作用力:Nvidia、Broadcom 與「沒有需要放慢的東西」

但並非所有人都買帳。一套產業互相審查的制度,設計上必然在最賺「速度財」的硬體層環節增加摩擦。在同一場峰會上,Nvidia 與 Broadcom 的高層駁斥了 AI 構成任何近期威脅的說法,並表明無論放慢辯論如何發展,AI 基礎設施需求依然穩固——Yahoo Finance 如此報導。他們的立場與商業現實一致:Nvidia 的財測暗示明年營收成長約 70%,而一場真正的能力暫停,會直接砍在這條線上。

這道裂痕如今清晰得罕見。模型層——Anthropic、OpenAI、Google DeepMind,甚至連馬斯克——正收斂向某種形式的共同節制與互相查核。算力層——Nvidia、Broadcom——則認為這一切毫無必要。而政治層早已大聲選邊,川普把 AI 競賽定調為「要贏的比賽」、不是「要減速的比賽」。

行得通嗎?

產業主導的標準組織有一個結構性優點和一個結構性弱點,而它們是同一件事:成員彼此是競爭對手。

優點在於誘因。參與會談的每一間實驗室都曾公開支持某種形式的設速——Amodei 的文章、馬斯克的「Dario is right」、Altman 的附和——這意味著每一間都想要保證:節制會是對稱的。沒有人想當唯一一間壓著強大模型不上、讓對手搶先出貨的實驗室。一個擁有實際測試權力的共享組織,是唯一能讓節制「可驗證」而非「憑信任」的機制。

弱點在於執行力。實驗室自己建立的組織可以制定標準、執行評估、公布結果——但它無法強制成員延後一場發表會,也沒有現成答案可以應付一間實力堅強但就是拒絕加入的實驗室,或一個從一開始就無意參與的國家行為者。The Information 指出,捲入會談的實驗室今年稍早在一份獨立安全指標上只拿了 100 分中的 29 到 42 分;這個組織有部分目的,正是要從內部修補這個公信力問題。

還有一個幾乎尚未被討論的反壟斷問題:一個協調發布時程與能力門檻的產業組織,與協調整個產業最敏感商業決策之間,距離近得令人不安。如何讓它「只評安全、不碰商業節奏」,將是今年最大的制度設計難題。

後續觀察指標

三個訊號能告訴你這件事是不是玩真的。第一,缺席會談的 xAI 與 Meta,會不會加入、或被邀請加入。第二,這個組織的評估結果會不會公開,還是像今天的內部紅隊測試一樣永遠保密。第三,目前在 AI 安全立法上僵持不下的國會,會把產業自主組織視為成文法的充分替代品,還是視為「實驗室無法自律」的證據。

實驗室們花了兩個月設計一位裁判。這位裁判最終能不能拿到哨子,如今是 AI 政策中最關鍵的未定之問。