← All posts / Research

鏡中之機:Anthropic 發布 R&D 自動化指數,Claude 已主導 26% 的 Claude 建造工作

Anthropic 發布首份 R&D 自動化指數:Claude 已「主導」實驗室 26% 的 AI 研發工作(二月時還不到 1%),3 萬個內部 Agent 在全監控下運行,而投入安全研究的運算資源僅占 6% — 這是迄今對「前沿實驗室距離遞迴自我改進還有多遠」最量化的一次公開丈量。

鏡中之機:Anthropic 發布 R&D 自動化指數,Claude 已主導 26% 的 Claude 建造工作

2026 年 9 月 17 日,Anthropic 發布了前沿 AI 實驗室有史以來最量化的一份「自我剖析」。在這篇標題為《用於理解前沿實驗室內部 AI 發展速度的量測方法》(Measurements for understanding the pace of AI development inside frontier labs)的文章中,該公司公開了三項全新指標:自家模型完成了多少比例的 AI 研發工作、內部 Agent 的行為受到多完善的監督,以及運算資源在能力與安全之間如何分配。頭條數字相當刺眼 — 截至 2026 年 8 月,Claude 已「主導」(leads)Anthropic 26% 的 AI 研發工作,而在二月,這個比例還不到 1%。但真正的故事藏在副標裡:這家以安全為宗旨的頂尖實驗室,開始公開丈量自己與「遞迴自我改進」之間的距離。

拆解 26% 這個數字

這個數字來自 Anthropic 稱為 R&D 自動化指數(R&D Automation Index)的原型工具。量尺本身並非自創,而是 Epoch AI 提出的自動化等級(Automation Level, AL)量表,從 AL0(完全沒有 AI 參與)到 AL5(AI 完全自主運作,人類不在迴路內)。其中兩個中間檔位最關鍵:AL3 是 AI「協作」(collaborates),能在人類密切指導下完成大部分工作區塊;AL4 是 AI「主導」(leads),能從一個高層級提示出發、端到端完成任務的大部分,人類只在一旁監督。

截至 2026 年 8 月的量測結果:

  • 在任何被量測的 AI 研發工作子項中,Claude 都未完全自主運作。整套量表裡沒有任何一處達到 AL5。
  • Claude「主導」(AL4 以上)了 Anthropic 26% 的 AI 研發工作。二月時,這個比例低於 1%。
  • 達到「AI 協作」(AL3)以上的工作比例則超過 90%。

短短六個月,「主導」比例從微不足道攀升到公司所有下一代模型建造工作的四分之一。Anthropic 對發布目的毫不諱言:這些指標能「幫助世人理解,各前沿實驗室距離遞迴自我改進(recursive self improvement)— 也就是模型完全自主建造自身後繼版本的能力 — 還有多遠」。

指數是怎麼煉出來的

方法論是整份報告最有趣的部分,因為它可以被複製 — 而 Anthropic 正是在號召其他實驗室跟進複製。

沒有人能靠手工枚舉前沿實驗室研發流程裡的每一項任務,因此 Anthropic 從工作紀錄(Slack 與內部文件)由下而上建構任務清單:對 2026 年 7 月的每一週,隨機抽樣模型研發迴圈各部門 20% 的員工,由一個 Claude 研究 Agent 檢視每位抽樣者該週的工作,列出其經手的任務。最終得到約 15,000 項粒度極細的任務,再由 Claude 將其組織成一棵 542 個節點的階層式樹狀結構,其中 378 個葉節點的名稱諸如「評測平台缺陷診斷與修復」、「RL 沙箱出口與網路政策」、「服務事故檢討報告」。

這棵樹是凍結的 — 未來每一次量測都針對同一籃子工作進行,指數因此能追蹤「可比較工作」隨時間的自動化程度。對樹中每個節點,一個 Claude Agent 會深入研究該類工作在全公司的實際執行方式,再由一個獨立的 Claude 評審(judge)賦予六級自動化等級之一,且只允許看到被評月份或更早的證據。節點權重按人員工時分配,投入人力越多的類別權重越高。

最顯而易見的質疑 — 評審模型在給自己的家族打分數 — 也被檢驗過。Anthropic 讓實際負責各工作領域的員工在「不知道模型收集了什麼證據、下了什麼結論」的情況下評分。結果:評審模型與人類的完全一致率為 59%,而人類彼此之間只有 35%;模型與人類評分相差在一級以內的比例達 97%。這不證明客觀,但確實比人類自己評自己的一致性還要好。

Anthropic 也坦承「凍結籃子」的限制:指數上升代表 2026 年 7 月那籃工作正在被自動化,卻看不出人類是否已退守到籃子外的新型工作。為此,公司將 2026 年 2 月到 7 月每月新出現的任務與 1 月的籃子比對,發現「新穎任務」數量並未上升 — 模型研發工作的結構在這個分析粒度下是穩定的 — 並計畫定期重建籃子、適時改版發布數字。

3 萬個 Agent,10 億次決策

第二組量測涵蓋監督機制:在 Anthropic 最常用的內部平台上,任一時刻約有 30,000 個 Agent 從事研究與工程工作。兩層監控約束著它們:

  • 線上監控(online monitors)在行動執行前即時檢查 — 覆蓋率 100%,通常在數秒內 — 會直接阻擋危險行動或自動導正偏離。它們是為「發生太快、無法挽回」的傷害設計的,例如 Agent 試圖把模型權重複製出 Anthropic 系統。
  • 離線監控(offline monitors)在事後閱讀所有活動 — 同樣 100% 收錄 — 針對發展緩慢、可逆轉的問題,例如模型失準(misalignment)的跡象。每週約標記 100,000 份對話紀錄,由多個分類器層層過濾誤報;其中約 50 件最高優先級的標記會送交人類審查,大約每千份對話紀錄有一到兩份被標記複查。

升級率的數字同時給出了規模感與節制度:2026 年 8 月分析的超過 10 億次 Agent 決策中,僅 0.002% — 約 47,000 分之 1 — 被線上監控阻擋。任何人類遭阻擋的行動都會在一週內獲得人為覆核。METR 此前曾獨立紅隊測試其離線監控平台,Anthropic 表示這些監督量測也已刊載於其 2026 年 8 月的風險報告。

內部 Agent 框架中有兩個設計決策,值得所有打造多 Agent 系統的人參考。其一,每個 Agent 擁有獨立身分,且身分跨模型升級持續存在 — 底層模型換代,Agent 的紀錄仍連續不斷,每個行動都能以 Agent 為單位跨時間稽核。其二,Agent 之間透過共享的開放訊息系統溝通,而非私聊:每則訊息都綁定發送者的身分並與操作紀錄交叉參照,讓 Agent 把其他 Agent 的主張當成「待查證的聲明」而非自己的想法,也讓行為監控能穿透 Agent 之間的通訊,而不會停在每個 Agent 的邊界上。

6% 給安全

第三組量測恐怕會招來最多批評。在 2026 年 7 月 13 日至 20 日的快照週中,投入 AI 研發的運算資源裡約 6% 分配給安全工作;若只看「AI 驅動的 AI 研發」,安全占比約 12%。Anthropic 強調這兩個數字是刻意保守的估計 — 同時推進能力與安全的 token 一律不計入,而安全分類器(safeguards classifiers)這筆「規模相當」的獨立運算開支也完全排除在外。

公司為「用運算資源當代理指標」辯護:安全研究本質上吃研究員時間而不吃 GPU。但它的價值在於可比性 — 同一把尺,跨實驗室、跨時間。文章也誠實點出了誘因問題:「安全研究與能力研究很難區分,而每個開發者都會傾向把界線畫得寬鬆。舉證責任應該由開發者承擔。」

為什麼是現在

這份披露落地於一場風暴正中央。Anthropic 執行長 Dario Amodei 是呼籲自願放緩前沿發展最重量級的聲音,據美聯社報導,OpenAI 的 Sam Altman 與 Elon Musk 已相繼附和,而川普總統則持反對立場。一位 Anthropic 研究員帶著對技術威脅的嚴厲警告離職,點燃了近期的討論。與此同時,路透社報導該公司在 IPO 前正斟酌發布新模型,而 Claude 透過 Palantir 的 Maven 參與軍事目標選定的疑雲仍未散去。

在這個背景下,文章的定調經過精心計算:「我們應該盡一切可能縮小前沿實驗室所知與公眾所知之間的落差。」Anthropic 呼籲其他開發者定期發布同樣三項量測、採用公開方法論,讓數字能跨時間、跨實驗室比較 — 並承認兩大障礙:尚無共同方法論,以及「用自己的模型評自己的系統」的評審者問題。它提出的解法是第三方驗證,或在保護競爭敏感資料的前提下跨實驗室互相評審。公司並表示計畫讓多個組織的獨立第三方評估人員進駐,取得與內部風險團隊相當的權限。

後續觀察

  • 其他實驗室會不會跟進? OpenAI 本週剛發布失準通報框架與六起事件報告;若 OpenAI、Google DeepMind 或 xAI 也公布 R&D 自動化比例,這就會從單一實驗室的數字升級為真正的產業指標。
  • 26% 會不會從統計變成觸發器? Anthropic 自己就拋出了可能性:這類量測「也可以成為更嚴格要求的觸發條件,例如在新模型投入後續 AI 研發前設一段固定的測試窗口」— 一個蓄勢待放的降速機制。
  • 二月到八月的斜率會不會重演? 六個月內從不到 1% 到 26%,這才是最該讓人在意 — 或興奮 — 的數字。若下一次更新又翻了幾倍,「距離 RSI 多遠」就不再是抽象問題。
  • 安全運算占比會不會標準化? 6% 是一個從現在起每家實驗室都會被要求追平或解釋的數字。

還有一個安靜卻值得記住的細節:這套用來丈量 Claude「接管自身建造」程度的指數,本身就是 Claude 建造的 — 任務清單、樹狀結構、研究 Agent、評審,全是。量測儀器已經由被量測的對象製成。至少,Anthropic 把鏡子轉向了自己。