三個實驗室、三種定義、同一場競賽:遞迴自我改進的路線之爭
Fortune 深入報導各家前沿實驗室在「遞迴自我改進」(RSI)上的分歧策略:OpenAI 承認尚無安全抵達完全 RSI 的路徑、Musk 目標 2027 年底全面自動化,而一位物理學家直言這是「人類史上最糟的主意」。
在過去十年的大部分時間裡,「遞迴自我改進」(Recursive Self-Improvement, RSI)只是一個思想實驗——那種 AI 安全研究者在論文裡推演、政策制定者客氣地略過的情境。那個時代已經結束了。Fortune 於 9 月 19 日刊出的深度報導檢視了各家前沿實驗室,發現它們不只是在討論 RSI,而是正在積極競逐它——而且是以三種不同的策略、三種互不相容的定義,朝著沒有共同終點線的方向衝刺。
這個詞本身聽起來很直白:AI 系統找出改進自己的方法、打造自己的後繼者。但 Fortune 的報導清楚顯示,整個產業連「什麼才算 RSI」都沒有共識。
定義問題
有些實驗室把 RSI 定義為任何來自 AI 的回饋被用於模型改進;另一些則把這個詞保留給完全自主運作——人類徹底退出迴圈——的情境。這個區別並非學術討論。因為沒有公認的 RSI 門檻,不同公司的進度宣稱根本不是在度量同一件事,這使得跨實驗室的比較——以及公眾監督——近乎不可能。
未來生命研究所(Future of Life Institute)所長、UC Santa Cruz 物理學教授 Anthony Aguirre 把界線畫在「自主性」上。自主式 RSI「本質上是指 AI 能夠設計系統的下一個版本、再下一個版本,如此循環改進自己」,他告訴 Fortune。他對這個動態的警告,正是安全研究者重複多年的簡單邏輯:「AI 做得越多,速度就越快,因為 AI 的運作遠比人類快得多。」
Aguirre 對這條路的終點毫不留情。「你可以從 Anthropic 這些年的圖表看到,越來越多的研究是由 AI 完成,而且越來越接近完全自主,」他說。「而這種成功最終導致的結果,我認為極其可怕。我認為這大概是有人類歷史以來最糟的主意。而沒錯,他們正在做這件事。」
Anthropic 的數字——以及它的極限
Aguirre 所說的「圖表」,是指 Anthropic 於 9 月 17 日發布的 R&D 自動化指數:Claude 如今「主導」該公司 26% 的 AI 研發工作——能夠「從一個高層級的提示出發,端到端完成大部分任務」,但仍處於人類監督之下。該實驗室超過 90% 的 AI 研發工作,已達到或超過「AI 協作」層級。
這是前沿實驗室有史以來最量化的一份自我剖析,Anthropic 也明確呼籲競爭對手發布可比較的指標。至今沒有一家跟進。同樣值得注意的是,Anthropic 並未說明它距離「完全自主的模型改進」還有多遠——而那才是真正用來評估失控風險時有意義的數字。換句話說,對梯度透明,對終點不透明。
OpenAI:最坦白的讓步
OpenAI 的立場——本月稍早在多篇文章中闡明——某種意義上最令人矚目,因為它最坦誠。該公司已打造出自動化「研究實習生」(research intern):一個能在人類指導下執行定義明確研究任務的系統,包括「一位熟練研究者需要花上幾天才能完成的任務」,並將 2028 年 3 月設為全自動 AI 研究員的目標日期。
但同一時間,OpenAI 承認它還不知道如何「安全地一路走到對齊的、完全的 RSI」,而且「不能假設對齊與安全的進展能夠跟上」。該公司指出,更強大的系統可能變得更難以監督——對一家同時仍在全速朝該里程碑邁進的實驗室而言,這是相當驚人的自白。OpenAI 的官方立場是「快速的 RSI 未必是我們應該追求的結果」,而且「是否前進、如何前進,必須取決於我們保有人類控制的能力,以及對效益與風險的知情民主選擇」。
該公司也為這場競賽提出了自己的理由:「自動化的 AI 研究者,也可以是自動化的安全或對齊研究者。」這是加速陣營最強的論證——同一個可能掙脫監督的能力,也可能被用來解決對齊問題本身。
Musk 的快轉時鐘
Elon Musk 顯然更急著往前衝。談到 xAI 的 Grok 模型時,他說「人類正逐漸越來越少參與其中」,而且「每一個後繼模型都是由前一個模型打造的」——不過他也澄清,這個過程尚未完全自動化。他的時程:這個里程碑也許今年底就能達成,「但不會晚於」2027 年。這比 OpenAI 的 2028 年 3 月更激進,但兩家公司對里程碑的描述並不相同——考慮到定義上的混亂,這兩條時間線也無法直接比較。
Suleyman 的人本主義出口
Microsoft AI 執行長 Mustafa Suleyman 代表了第四種立場:根本不要朝無界自主性競速。他在 2025 年一篇文章中首度提出的「人本超級智慧」(humanist superintelligence)框架,主張先進 AI 應該「經過審慎校準、依情境調整、有所界限」——明確排除「一個無界、無限制、高度自主的實體」。
在一個「自主性越多就越好」已成為預設假設的產業裡,這是有意義的區隔。Suleyman 的立場把「人類結構性地留在迴圈中」當作設計原則,而不是一個終將被工程手段移除的暫時限制。
失控風險 vs. 漸進現實
Cornell 大學電腦科學教授 John Thickstun 專研究控制 AI 行為的方法,他為「起飛情境」提供了務實的反方觀點。某種形式的遞迴自我改進「其實在 AI 發展中已經進行一段時間了」——研究者多年來一直在用上一代模型為訓練下一代模型的系統撰寫程式碼。就連 Andrej Karpathy 長期進行的「AI 訓練 AI」實驗,也只產出「小幅改進,沒有大的創造性躍遷」。
恐懼情境建立在過程中出現失控超級智慧的可能性上——自我改進的系統進展到人類無法監督或控制的地步。而截至目前為止的實際觀察,是漸進式的輔助:開發確實變快了,但沒有觀察到不連續的躍遷。
為什麼現在重要
有三個訊號讓本週的 RSI 討論與以往每一輪都不同。第一,Anthropic 的指數為這條梯度提供了具體數字——26% 主導占比、超過 90% 協作占比——把抽象辯論轉換成一條可測量的曲線。第二,OpenAI 公開承認自己沒有安全抵達終點的路徑,卻仍承諾繼續走下去;這是一家前沿實驗室首次承認其路線圖與安全能力之間存在落差。第三,時間線不再只是假設性的:2027 年底(Musk)、2028 年 3 月(OpenAI),以及 Anthropic 刻意不設日期的配速承諾,彼此相差不到 18 個月。
與此同時,產業自身的安全措施仍是落後的一方。Fortune 指出,這是實驗室自這項技術誕生以來就面對的挑戰:確保安全與能力同步推進。對於協調放緩的呼籲,各方分歧依舊——Anthropic 表示願意在競爭對手「以可驗證方式」跟進的前提下放緩或暫停;其他公司則未承諾。甚至不是每個主要玩家都對自己的 RSI 路徑發過言。
Fortune 這篇報導捕捉到的,是一個正走向其歷史上最關鍵能力轉型的產業:沒有共同定義、沒有可比較的指標、沒有協調機制,而且時間線的差距以「季」計而非以「十年」計。Aguirre 的判詞最終或許會被證明是誇張的。但舉證責任已經悄悄轉移:現在必須證明「自主式 RSI 即將到來」的人,不再是提出警告的那一方——而是必須證明「自己剎得住車」的,正在打造它的實驗室。
資料來源由 frontmatter 自動呈現。
Sources
- [1] https://fortune.com/2026/09/19/what-is-self-improvement-rsi-full-autonomy-openai-anthropic-xai/
- [2] https://www.anthropic.com/institute/measuring-pace-of-ai-development
- [3] https://aiweekly.co/alerts/openai-concedes-no-path-to-safe-full-rsi-xai-targets-2027
- [4] https://www.washingtonpost.com/business/2026/09/19/ai-recursive-self-improvement/00f9ebe8-b411-11f1-92c2-5c918f4a6127_story.html