← All posts / Research

AI4AI-Bench:首次實測「遞迴自我改進」,發現 AI 距離自我升級還很遠

新基準測試要求 LLM 代理改寫打造 AI 的訓練演算法本身。最強系統只走完到達最佳解不到五分之一的距離,而且多數代理根本沒碰模型的學習規則。

AI4AI-Bench:首次實測「遞迴自我改進」,發現 AI 距離自我升級還很遠

遞迴自我改進(Recursive Self-Improvement, RSI)——即 AI 系統升級「產生 AI 系統的流程本身」,讓能力循環加速直到起飛——這個情境十年來一直是個怎麼吵都吵不完的辯題,雙方都能靠思想實驗各說各話。2026 年 8 月 20 日,由 Yizhe Chi 領銜的十人研究團隊在 arXiv 上發布了一個基準測試,把這場辯論變成了一個數字。這個數字很低,卻是這個領域迄今在這個問題上最有價值的一次實測。

這篇論文《AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement》(arXiv:2608.20318)做了一件現有基準測試都沒做的事:把 RSI 真正需要的那一項特定技能單獨剝離出來,然後實測今天的代理到底有沒有這個技能。答案目前為止是:多半沒有。

為什麼需要這個基準測試

作者的第一步,是對「RSI 的迴圈究竟在哪裡」提出精確論證。RSI 不是代理寫出更好的應用程式、抓更多資料,或調整學習率排程。它是改進「產生 AI 系統的流程」——也就是訓練演算法本身,包括目標函數與更新規則,這些把算力轉換成能力的核心機制。一旦改進了這一層,之後每一次訓練的「算力—能力兌換率」都會提升,包括用來打造下一代代理的那次訓練。這是唯一能夠複利滾動、導致起飛的改變。

這個定義之所以重要,是因為它直接淘汰了目前大部分號稱「AI 改進 AI」的成果。現有的代理式基準測試,贏家靠的正是那些「不算數」的操作:收集更多資料有幫助,但不會改變兌換率;調超參數是在固定演算法上做搜尋,而不是發明新演算法。論文的核心批評就在這裡——沒有任何基準測試能區分「改變執行方式」與「改變學習方式」。只有後者才算 RSI 的進展,而市面上沒有任何東西在測它。

AI4AI-Bench 的設計,就是要把所有逃逸路線一次堵死。

設計:凍結的倉庫、隱藏的評分器、不給玩檢查點

整套設計極為嚴格,而嚴格正是重點:

  • 10 個凍結的研究程式碼倉庫,橫跨 10 個不同的訓練演算法家族
  • 每個代理獲得單張 B300 GPU 上的 4 小時,改寫其中一個倉庫的訓練演算法
  • 代理寫出的程式碼隨後從零重新執行最多 12 小時,由一個代理看不到的固定評分器計分
  • 分數的比較基準,是用完全相同程序跑出來的該倉庫原始演算法成績

由於 10 個任務的指標彼此不可通約,每個任務都被映射到同一個標準化量尺上:0 代表不具資訊量的模型,0.1 代表倉庫原本就搭載的演算法,1.0 代表該任務的最佳解。注意這個設計——只要贏過出廠基線就超過 0.1,而真正有趣的範圍,是從「現有工程成果」到「理論最佳」之間那 0.9 的距離。

這些設計選項對「鑽漏洞」充滿敵意,多數基準測試做不到這一點:評分器是隱藏的,代理無法過擬合;程式碼必須從零重跑,存個檢查點也無法造假;基線是真正發表過的研究工程,不是稻草人。當作者預期受測系統必然會找捷徑時——2026 年的今天它們確實會——基準測試就該長這個樣子。

結果:能力差距,加上意向差距

在全部 10 個任務上,針對 6 個系統的 29 種組態進行測試後:

  • 平均分數:0.166——只比 0.1 的出廠基線高一點
  • 最佳系統:0.250——不到現有演算法與最佳解之間距離的五分之一

最佳系統的成績就是頭條,也值得最直白的解讀:連最強的代理,都只走完了「既有演算法」到「理論天花板」不到 20% 的距離。是真實的、非零的,但幅度有限。

行為面的分析比分數更揭露真相。大多數提交結果根本沒有改變模型的學習方式。它們動的是執行層——資料管線、排程、包裝器——而不是學習規則。結果也精確地按此分裂:真正修改了學習演算法的少數派平均 0.226,其餘的只有 0.126。有意義地擊敗基線的代理,恰恰是那些真的朝基準測試獎勵的方向揮棒的那批。

接著是研究者們反覆咀嚼的另一個發現:調高推理強度(reasoning effort)並沒有教會代理設計更好的演算法——只是讓它們敢去嘗試。更高的推理強度把「會去碰學習演算法」的提交比例從 8% 拉到 64%,平均分數從 0.094 升到 0.196。意願大幅上升,技能幾乎沒動。

這就是論文低調的第二項結論:當前系統與 RSI 之間的差距,不只是能力差距,有一部分是意向差距。今天代理的預設姿態是保守的——寧可調手上現成的旋鈕,也不重寫機器本身,即使被推著去做結構性改動,也只走得了一小段。一個更願意嘗試的代理,不等於一個會複利成長的代理。

誠實的限制

作者很謹慎,讀者也應該如此。十個倉庫涵蓋面不小,但樣本仍少。單張 GPU 上的 4 小時預算是很緊的限制,擁有整個叢集的前沿實驗室完全可以碾過去——這個基準測試量測的是「固定且適度預算下的代理」,這是設計選擇,不是能力上限。而「不到五分之一的距離」是一個會移動的地板;這個基準測試的價值在於看斜率,不在於看截距。

值得稱許的是,團隊公開了任務套件、評分器與每一次計分的提交結果,讓這個量測可以隨系統演進反覆重跑。它明確地是一支溫度計,而今天讀數偏低。它定案的不是「RSI 會不會來」——它定案的是這個問題從今以後可以在公開的排行榜上、用數字回答。

為什麼實驗室之外的人也該在乎

兩類人應該注意。

預測者與政策圈:遞迴自我改進正在為大量 AI 時間表扛重物——實驗室路線圖、風險評估、以及內建於兆美元基礎設施投資計畫裡的改進速率假設。而在針對這些時間表所依賴的特定能力的第一次認真實測中,它幾乎還在原點。任何假設 RSI 迴圈已經在轉動的預測,都應該能解釋為什麼這個基準測試不同意。

把開放性任務交給代理的開發者:就算永遠不跑這個基準測試,論文的區分法也值得偷來用。當有人宣稱他的代理「改進」了某個系統,先問它動的是哪一層——是改變了執行方式,還是改變了學習方式?這是截然不同的兩種主張,而多數令人印象深刻的展示,都是前者偽裝成後者。這裡看到的失敗模式——面對困難的開放性問題,系統壓倒性地選擇邊緣的安全編輯——也會出現在你的程式碼庫裡。如果你要的是改掉機制而非拋光表面,請明說,因為預設行為永遠是保守的小修。

基準測試的職責,就是讓模糊的主張變得可證偽。「AI 能不能改進 AI?」這個問題已經被思想實驗吵了好多年。從這週起,它有了數字、有了量尺、有了每一次嘗試的公開紀錄。這就是這篇論文的貢獻——而那個數字,目前是 0.166。