Claude 已「主導」Anthropic 自家 AI 研究的 26% — R&D 自動化指數內幕
Anthropic 的透明化新舉措首次量化遞迴自我改進:Claude 主導該實驗室 26% 的 AI 研發、3 萬個 agent 同時運行、而安全研究僅佔研發算力的 6%。
2026 年 9 月 17 日,Anthropic 公開了前沿 AI 實驗室從未發布過的東西:一組有完整方法論支撐的硬數據,說明「用 AI 打造 AI」這件事如今到底做到了什麼程度。核心數字令人咋舌——截至 2026 年 8 月,Claude 已「主導」(leads)Anthropic 自家 AI 研發工作的 26%,高於 2 月時的不到 1%;達到「AI 協作」等級以上的工作份額更超過 90%。這個模型在打造它的實驗室裡,已經不只是編程助手,而是承擔了四分之一的研究職能。
這些數字發表在題為《Measurements for understanding the pace of AI development inside frontier labs》(理解前沿實驗室內 AI 發展速度的度量)的文章中,以 Anthropic Institute 名義發布,由 Marina Favaro 與 Phillie Wright 共同執筆,共同創辦人 Jack Clark 提供研究方向,概念驗證團隊還包括 Jun Shern Chan、Fabien Roger 與 Holden Karnofsky 等人。其政策意圖十分明確:當各國政府與公眾正在辯論是否放慢前沿 AI 的發展速度時,公眾需要看見實驗室內部實際發生的事。該公司寫道:「我們應該盡一切可能,縮小前沿實驗室所知與公眾所知之間的落差。」
三項度量,一份快照
文章提出三項指標,目標是成為可持續、可驗證的常規報告標準。
R&D 自動化指數。 Anthropic 將公司內所有 AI 研發工作逐一盤點建檔,評定每項任務目前的自動化程度,再加權彙總成單一指數。評級尺度並非自創,而是採用 Epoch AI 提出的「自動化等級」(Automation Level, AL)階梯,從 AL0(完全沒有 AI 參與)到 AL5(完全自主、無人類介入)。中間兩級最關鍵:AL3 是 AI「協作」(collaborates)——在人類密切指導下完成大塊工作;AL4 是 AI「主導」(leads)——只憑一個高層級提示就能端對端完成大部分任務,人類僅從旁監督。
2026 年 8 月的讀數是:完全自主的工作為零、達到「主導」以上的佔 26%、達到「協作」以上的超過 90%。換言之,Claude 距離無人監督地打造自己的後繼者還很遠,但從 2 月的約零到夏末的四分之一,這條曲線的斜率才是故事最陡峭的部分。Anthropic 也坦言,若外界真的就「放慢前沿速度」達成協調(如其執行長 Dario Amodei 所呼籲),這些數字應會隨之變化。
Agent 監督。 僅在 Anthropic 最常用的內部平台上,任一時刻就有約 3 萬個 AI agent 從事研究與工程工作。這些 agent 的每一個動作在執行前都會(通常在數秒內)通過線上監控器,用以攔截快速且不可逆的傷害,例如 agent 把模型權重拷出系統。離線監控器則在事後閱讀 agent 的活動紀錄,獵捕緩慢累積的問題,例如失準(misalignment)的跡象。該公司分析了 2026 年 8 月這些 agent 超過 10 億個決策,發現其中 0.002%(約 47,000 分之 1)被監控器阻擋。監控器每週標記約 10 萬份對話紀錄交由分類器複查,其中最高優先的每週約 50 件升級到人工審查。METR 曾獨立紅隊測試過這套離線監控平台,Anthropic 也表示正在設立常駐的第三方評估者,其內部存取權限將與內部風險團隊相當。
算力配置。 在快照週(2026 年 7 月 13 日至 20 日)中,投入 AI 研發的算力約 6% 用於安全工作,而投入「AI 驅動的 AI 研發」的算力則有約 12% 屬於安全。Anthropic 強調這些數字刻意從保守計算:對能力與安全助益相當的工作一律不計入安全,安全分類器的算力也另行計算。
如何在不用自欺的情況下度量「AI 打造 AI」
附錄是全文最有趣的部分,因為它正面迎擊最顯而易見的質疑:Anthropic 用 Claude 來評量 Claude。這套方法論本身就是一件度量工程。
沒有任何單一人能逐一列出前沿實驗室的每項研發任務,因此 Anthropic 採取由下而上的方式建構任務清單:對 2026 年 7 月的每一週,從模型研發閉環的每個部門隨機抽樣 20% 員工,讓 Claude 研究 agent 閱讀每位抽中人員該週的 Slack 訊息與內部文件,列出其經手任務。這產生了約 15,000 條細粒度任務,再由 Claude 將其組織成 542 個節點的階層樹,其中 378 個葉節點的名字像是「評測平台缺陷診斷與修復」、「serving 事件檢討報告」。這棵樹被凍結,因此未來每次度量都對照同一籃子工作評分。每個節點的權重來自人員時間:每位抽中者每週貢獻一單位權重,均分到其當週經手的任務上。
為了檢驗評審模型是否可信,Anthropic 讓各工作領域的負責員工在「盲測」狀態下(看不到模型收集的證據與判斷)為自己領域評分。結果相當坦白:模型與人類的完全一致率為 59%,而人類彼此之間只有 35%;模型與人類評級相差在一級以內的比例達 97%。公司還驗證了研發工作的結構並未在凍結籃子底下悄悄位移:將 2026 年 2 月至 7 月每月新出現的任務與 1 月基線相比,並未發現「新型」任務增加。
為什麼重要
這件事的意義不在於具體數字,而在於先例。遞迴自我改進(recursive self-improvement)——模型全自主地打造後繼模型——多年來一直是安全文獻中的理論閾值。自動化指數把它變成一個可追蹤、可稽核、方法論公開的量,而且照 Anthropic 的說法,「任何前沿開發者都能發布」同樣的度量。該公司明確邀請跨實驗室比較,同時坦承兩大障礙:目前沒有共同方法論,而且自我評量有「裁判模型與受測模型共享盲點」的風險。它提出的解方是第三方驗證、在保護競爭敏感資料的前提下跨模型互評,並考慮把這類指標當作更強要求的觸發條件——例如在新模型投入後續 AI 研發前設立固定的測試窗口。
時空背景讓這步棋既是科學也是戰略。Anthropic 把這些度量與其提出的「進階 AI 框架」(Advanced AI Framework, AAIF)直接掛鉤——該框架將對任何發布前沿模型的實驗室施加透明化義務——也與 Amodei 對協調放慢速度的呼籲相呼應。主動公布不算好看的數字(6% 的安全算力佔比肯定會被反复引用),是一種在監管者代為設定標準之前,先由自己設定報告標準的布局。Reuters 與 Bloomberg 都以 26% 作為報導頭條;可以預期「AL4 佔比」將成為財報電話會議與政策聽證會上對每一家前沿實驗室的標準提問。
誠實的但書就寫在文件裡:一週的算力數據只證明度量做得出來,不構成趨勢;凍結籃子追蹤的是 2026 年 7 月工作的自動化,而不是人類可能遷移過去的新工作;算力佔比度量的是支出而非努力——更有效率的安全分類器會在數學上讓安全百分比縮水,但安全工作一點也沒有減少。但作為第一個公開的「遞迴自我改進儀表板」,它確實為外界監看這個地球上後果最深遠的工業程序,添了一項真正的工具。
Sources
- [1] https://www.anthropic.com/institute/measuring-pace-of-ai-development
- [2] https://www.bloomberg.com/news/articles/2026-09-17/anthropic-says-claude-drives-26-of-its-research-and-development
- [3] https://www.engadget.com/2261909/anthropic-says-claude-leads-26-percent-of-its-ai-research-and-development/
- [4] https://ca.finance.yahoo.com/news/anthropic-says-claude-now-leads-221019926.html