← All posts / Research

人類打造的最後一個 AI?35 位中國研究者發表 75 頁遞迴自我改進路線圖

由上海交通大學、清華大學、上海 AI Lab 與 Theseus Labs 等 35 位作者組成的團隊,發表了首份以「自主性」為中心的遞迴自我改進(RSI)路線圖——從執行既定改進到 AI 改寫自身的改進流程共分五級,並提出新指標揭示前沿模型的真實水位。

人類打造的最後一個 AI?35 位中國研究者發表 75 頁遞迴自我改進路線圖

最重要的人工智慧,可能不是解開最難問題的那一個,而是解開「如何打造更好 AI」這個問題的那一個。這正是論文《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》(人類打造的最後一個 AI:邁向真正的遞迴自我改進)的核心命題。這份約 75 頁的立場文件與綜述已發布於 arXiv(編號 2609.11873),由 35 位作者共同完成,團隊以上海交通大學為主,結合清華大學、上海人工智慧實驗室(Shanghai AI Lab)、Theseus Labs、ModelBest(面壁)、騰訊混元等多家學術與產業機構。論文於 2026 年 9 月 10 日首次上線、9 月 15 日更新 v2 版,迅速成為本月 Hugging Face 與 alphaXiv 上討論度最高的論文之一。

它要回答的問題相當直接:從 OpenAI 的 Noam Brown 到 DeepMind 的 Demis Hassabis,如今前沿實驗室一致宣稱「遞迴自我改進」(Recursive Self-Improvement, RSI)——即 AI 實質加速 AI 本身的研發——是最高優先目標。但這句話到底是什麼意思?我們如何知道自己何時真正擁有它?今天的系統又位於哪個位置?論文的答案是:一座五級自主性階梯、一個新的能力成熟度指標,以及一句清醒的警告——目前所有被行銷為「自我改進」的系統,最多只到第二級。

為什麼叫「人類打造的最後一個 AI」?

這個標題刻意帶有挑釁意味。如果改進真的變成遞迴式的——每一代 AI 都讓下一代更聰明、更快速、更便宜——那麼總有一天,人類將不再是主要的工程師,而更像監管者、客戶或園丁。論文並未宣稱那一刻已經到來;它想做的是過去缺乏公認框架的事:為這個領域建立一套共享詞彙,用來衡量朝向 RSI 的進展,讓「我們的系統會自我改進」不再只是行銷話術,而成為可檢驗的主張。

論文通訊作者為上海交通大學的周炫寒(Xuanhe Zhou),段毅(Yi Duan)、劉穎(Ying Liu)、唐子睿(Zirui Tang)等人為共同貢獻的第一作者群,團隊橫跨學界與業界——包括騰訊混元團隊與 ModelBest 的工程師提供實際部署系統的案例研究。整個研究配有公開專案頁(theseus-labs-rsi.github.io),並明確與空泛的 RSI 論述保持距離:路線圖中的每一級,都附有判斷系統是否達標的評測協議。

Headroom-Closed Index:一把度量「不均衡進步」的尺

在定義 RSI 之前,論文先測量了地形。作者提出Headroom-Closed Index(HCI,剩餘空間收斂指數)——將模型分數相對於該基準測試家族首年 90 百分位前沿模型做正規化,衡量「可用進步空間」已被收斂了多少,再以平方根加權聚合成各領域軌跡。

研究發現是論文的實證亮點。到 2026 年,高等數學與研究生級科學的 HCI 值分別達到 86.4 與 85.8,廣域知識為 77.2——但其他領域遠遠落後,且各能力面的進步時間點差異極大。這意味著:基礎模型的進步是極度不均衡的。靜態排行榜恰恰在「空間已被收斂」的領域裡美化模型,而 RSI 真正需要的互動式、有狀態、會用工具、長時間軸的能力,離收斂還很遠。作者論證,這種不均衡正是「改進」必須從一次性的訓練 run,轉變為持續性、自主性流程的根本原因。

論文也用當前的產業現實來鋪陳動機:Kimi K3 僅啟動 896 個專家中的 16 個(宣稱較 K2 有約 2.5 倍的擴展效率)、Qwen3.8-Max 在 2.4 兆參數中啟動 950 億,而 OpenAI 則報告 GPT-5.6 Sol 曾為自身的投機解碼草稿模型設計並執行數百項實驗。瓶頸已不是能力,而是開發負擔——這正是把「改進」本身交給機器的理由。

RSI 自主性五級階梯

論文的核心貢獻是這座階梯。它以改進迴圈(改動某處、測量效果、保留有效的改動)為分析單位,並在每一級追問:迴圈內的哪些決定,已經從人類手中轉移給系統?

  • B0 — 任務內改進:基準線。模型在單一任務實例內改進(思維鏈精煉、單次提示的自我修正),但不留下任何持久改變。今日的推理模型大多在此。
  • L1 — 改進執行自主:系統執行被指定的改進:資料清理、超參數調整、核心最佳化、評測執行、部署調優。人類決定改什麼,機器在執行層面處理「怎麼做」。論文盤點了此級在資料、訓練方法、平台、評測安全與部署最佳化等層面已在運轉的工業系統。
  • L2 — 改進策略自主:系統自己選擇如何改進:搜尋提示詞、代理骨架(agent harness)、甚至模型與訓練配置。Promptbreeder、GEPA、MPO 等系統被放在這一級——它們自主突變並篩選改進策略,但依據的仍然是外部指定的固定適應度指標。關鍵在於,論文發現今日最受矚目的「自我改進代理」仍停留在 L2,因為目標與驗收規則仍由外部設定。
  • L3 — 學習經驗獲取自主:系統自己生成訓練經驗——自適應任務生成、自我對弈(self-play)、透過環境互動自主練習。它不只決定怎麼改進,還決定接下來練什麼。
  • L4 — 部署與環境適應自主:已部署的系統從實際運行中蒸餾軌跡、修改自身的代理架構、並選擇性地保留與上線更新——在真正運作的環境中學習。
  • L5 — 遞迴後設改進:系統改進「改進流程」本身:改寫自己的搜尋程序、改進後繼者的評估方式、甚至修正研究目標與政策。到了這一級,「人類打造的最後一個 AI」這個說法才成為字面事實。

這座階梯的紀律性在於:每一級都以移轉的決定權定義,而非基準分數——這讓不同實驗室的主張可以互相比較,也杜絕了把情境內學習(B0)重新包裝成自我改進的常見話術。

四個應用領域,四種不同的時鐘

論文另闢一章將框架套用到四個應用場景,說明 RSI 的到來速度取決於回饋可用性、驗證成本與部署限制,各領域差異極大:

  • 科學——可以演化假說模組、實驗代理與反思系統,但驗證又慢又貴。
  • 具身智慧——演化課程、技能與世界模型;模擬讓經驗變得便宜,但「模擬到現實」的轉移才是瓶頸。
  • 軟體工程——最 RSI-ready 的領域:可執行的測試提供了便宜且可信的驗證;演化程式代理骨架已是工業實務。
  • 醫療——限制最多:安全、隱私與法規負擔意味著改進迴圈在可見的未來仍需人類把關。

產業章節則以具名案例落地:Theseus Labs 的環境–資料–模型共同演化、Lark 為可靠企業級 RSI 打造的資料基礎、Humanlaya 以交付驅動的資料品質迴圈、ModelBest 的零人力工業管線、騰訊混元的經驗驅動自我改進,以及一個建構在可驗證研究基礎設施上的代理原生研究實驗室。

八個開放問題——與一個清醒的結論

論文的最後一章抗拒亢奮。它列出八個研究方向,包括:跨元件診斷(觀察到的失敗很少能直接指出該改哪個元件——資料、上下文、工具介面、模型還是評估器;Humanlaya 案例讓這種模糊性非常具體);自主練習下的可擴充驗證;多元件同時適應時的複合交互作用管理;以及長時間軸評估,檢驗「改進」能否遷移到產生它的情境之外。

框架中隱含的結論是:真正的遞迴自我改進,目前在任何地方都尚未實現。即使是最強的已展示系統,也只是自動化了執行與策略(L1–L2),而人類仍掌握目標設定、評估與驗收。驅動這份綜述的三大瓶頸——資源密集的基礎模型開發、可擴充學習對有用經驗與可靠驗證的依賴、以及診斷與上線更新持續消耗的人力——「仍只是部分被解決」。

為什麼重要

這篇論文出現的時機,正是 RSI 論述全面主流化的一週:OpenAI 高層宣稱「AI 改進 AI」以極大差距名列研究首位、美國參議院聽取能力軌跡簡報、前沿實驗室競相自動化自身的研究管線。在這片喧囂中,一份出自中國重量級學術–產業聯盟的嚴謹分類學做了兩件有用的事。它給了監管者與安全研究者一把共同的尺,得以追問實際上究竟委派了多少自主性——這才是監督該問的問題。它也給了工程團隊一套紀律:在宣稱自我改進之前,先說清楚改進迴圈裡哪些決定真的由系統做出,並拿出持久性的證據。

標題的前提——人類總有一天會從頭打造最後一個 AI——仍屬推測。但檢驗這個前提的路線圖已經寫在紙上:五級階梯,附評測協議。作者寫道,AI 迄今達成的一切不過是滄海一粟;而這座階梯讓「剩下的海洋由誰來填」變成一個可以回答的問題。