150 美元的自我進化:MIT 與 Sakana AI 的 SIFT 把遞迴自我改寫 Agent 的成本砍到十分之一
用 LLM 評審引導的樹搜尋,讓 coding agent 改寫自身後在 Polyglot 拿下 35.1%,只花 5 小時與 150 美元 API 費用——僅為過往方法十分之一的算力。
過去兩年,「遞迴自我改進」(recursive self-improvement)幾乎是 frontier 實驗室的專利——前提是你有 frontier 等級的預算。Darwin-Gödel Machine(DGM)證明了 coding agent 可以改寫自己的 scaffolding、並因此在程式能力上變強,但代價是數千 CPU 小時的算力,某些組態在 SWE-Bench 上的評測開銷甚至超過 22,000 美元。這個價格門檻,實質上把一整個研究方向鎖在了少數幾個資金雄厚的團隊手裡。
MIT 與 Sakana AI 於九月發表、本週開始獲得廣泛關注的一篇論文提出:真正的門檻從來不是演算法,而是評測帳單。SIFT(Self-Improvement via Fast Tree-search)保留了遞迴改良迴圈,但把其中大部分昂貴的 benchmark 重跑,換成便宜得多的東西——一個只靠「閱讀程式碼」就能為候選自我修改排出高下的 LLM 評審。
瓶頸從來不在搜尋,而在評測
核心觀察簡單得近乎直白。當自我改進中的 agent 對自己提出一項修改時,過去的框架靠「用修改後的 agent 重跑一部分 benchmark 任務」來估計修改有沒有效。在 Polyglot-50 上,單次子集評測就要價約 6.00 美元與 2.6 CPU 小時;而評審呼叫——讓一個模型讀兩份 patch、挑出勝者——只要幾美分。
SIFT 的做法是把這套經濟學整個翻轉過來。每個候選 patch 照樣進入搜尋樹,但第一線的篩選由兩兩比較的 LLM-as-a-judge 訊號負責。勝敗紀錄以正規化 Bradley-Terry 模型聚合為每個節點的強度分數,再驅動一個輕量、完全分離式(disaggregated)樹搜尋中的排序式親代取樣。昂貴的下游任務評測,只留給最有希望的節點。
評審不只是廉價替代品——它本身就是導引訊號。因為兩兩判決幾秒內就能返回,搜尋在每一步都能拿到中繼回饋,不必再苦等冗長的評測跑完才能繼續探索。
關鍵數字
頭條結果:以 o3-mini 為基礎 coding agent,SIFT 把 DGM 式的初始 harness 從 14.2% 的基準,推升到完整 Polyglot benchmark 上的 35.1%,只用了 30 步擴展——勝過 DGM 需要 80 個節點才拿到的 30.7%。這次運行在 5 小時牆鐘時間、42 CPU 小時、約 150 美元 API 額度(含評審費用)內完成。
不同價位點的運行同樣具有說服力:
- Qwen3-30B agent 搭配 Qwen3-480B 評審:31.1%,總花費 34.30 美元(其中評審 4.10 美元),6.7 小時 / 224 CPU 小時
- Qwen3-30B agent 搭配 gpt-5.4 評審:32.0%,33.70 美元,6.8 小時 / 188 CPU 小時
- o3-mini agent 搭配 gpt-5.4 評審:35.1%——CPU 預算約為 DGM 的十分之一
除了分數本身,還有兩個結構性發現值得注意。第一,harness 可以遷移:用某個 coding model 自我改進時發現的 agent harness,換到其他模型上依然保有增益,代表發現的 scaffolding 捕捉到的是通用性質,而不是對單一骨幹模型過擬合。第二,探索機制確實重要——把探索參數移除後,o3-mini 的結果從 35.1% 掉到 30.1%,證實增益來自真正的搜尋,而非某一條幸運的血緣線。
為什麼重要
真正的意義不在「35.1%」,而在「150 美元」。Sakana AI 把這項工作定位為其遞迴自我改進(RSI)研究計畫的一部分——抵達 agent 能主動撰寫、評測、驗證自身底層系統程式碼的臨界轉折點。SIFT 是這個命題的低預算版本,而低預算版本才是能被大量複製的版本。
對學術實驗室而言,200 美元以內、250 CPU 小時以內的入場券,把自我改進 agent 從工業級專案變成一門專題課的規模。對整個領域而言,它擴大了能夠審計、重現、壓力測試遞迴改進迴圈的人群——面對一項安全影響顯而易見的能力,這恰恰是最需要擴大的那群人。論文自己的安全章節也明白指出:遞迴迴圈會放大標準的 agentic 風險,而無邊界的自我修改正是必須盯緊的失效模式。
限制也必須誠實面對。評審可能出錯,一個強大但有偏差的評審會讓搜尋跟著偏差;作者提到,在評審排序與實測準確率上都被持續壓制的節點可以被剪枝,未來的評審也可以做成 agentic——主動跑輕量探針、檢視執行軌跡,而不是只冷讀 patch。此外 Polyglot 終究是個 benchmark,針對 benchmark 調整的自我修改,仍然是对 benchmark 的調整。
但方向已經很清楚。自我改進最昂貴的部分從來不是寫程式碼,而是決定該留下哪一個版本的自己。SIFT 證明:對這個問題,一個夠好、而且極度便宜的答案,就足以讓整個迴圈持續轉動。