← All posts / Research

從零到自主只花六個月:DeepMind 現在讓 Agent 負責部分模型訓練流程

DeepMind 負責人 Koray Kavukcuoglu 在 AI Agenda Live 峰會上表示,Google 現在信任 AI agent 自主執行模型訓練流程的部分環節——設計實驗、分析結果、提出新假說,全程由人類監督。

從零到自主只花六個月:DeepMind 現在讓 Agent 負責部分模型訓練流程

在深度學習的大多數歷史裡,模型訓練流程一直是整個領域中最依賴人力的環節。研究員設計實驗、啟動訓練、盯著 loss 曲線、從評估結果裡判讀訊號,再爭論下一步該試什麼。如今這個圖像正在產業最頂端改變。在舊金山舉行的 The Information「AI Agenda Live」峰會上,Google DeepMind 負責人 Koray Kavukcuoglu 表示,公司現在信任 AI agent 自主執行模型訓練流程的一部分——進行實驗、分析結果並提出新的假說,全部在人類監督之下進行。接著他補上了一句 讓整個聲明真正有分量的話:他說,六個月前,agent 根本還沒有被這樣使用過。

DeepMind 究竟說了什麼

這番話出自 Kavukcuoglu 在峰會上的對談,而措辭本身很重要。DeepMind 沒有人聲稱某個模型一夜之間完成了自我訓練,也沒有人說某次前沿訓練從頭到尾沒有人類參與。Kavukcuoglu 描述的是一條 agent 在實驗循環中承擔真正責任的流水線:它們啟動實驗、閱讀並解讀結果,然後產生決定「下一步試什麼」的假說。人類監督位於循環之上,而不是嵌在每一步裡面。

時間尺度是最驚人的部分。六個月,在 2026 年差不多就是一個模型世代週期。「我們絕不會讓 agent 碰訓練流程」到「agent 在監督下執行部分訓練」之間的距離,在一個產品週期內就走完了。這個速度比任何跑分圖表都更能說明方向:如果訓練自主權能在六個月內從零走到局部,那麼真正有趣的問題是,再過六個月這條曲線會長成什麼樣子——而那個時間點,恰好是多個實驗室聲稱早期遞迴自我改善(recursive self-improvement)工作流將開始發揮作用的時候。

讓這件事變得可信的背景

Kavukcuoglu 對這個主題並非局外人。2026 年 8 月,他在一場領導層改組中接掌 Google DeepMind(Demis Hassabis 卸下日常領導職務),而他繼承的,正是那個最明確把「強大 agent」當成安全問題領域來對待的組織。2026 年 6 月,DeepMind 發布了「AI Control Roadmap」(v0.1 版本同步以 arXiv 論文形式公布),提出一套管理自主 agent 風險的三步驟框架——刻意借鑑資安實務,把 agent 當成可能漂移、失效或悖離意圖的系統來對待,而不只是工具。

這份路線圖在此刻格外重要,因為它撐起了那句「在人類監督之下」的後半句。DeepMind 的立場是:對齊訓練(alignment-trained)的模型是第一道防線,外層再包覆控制措施,用來攔截 agent 工作流可能出現的不當行為。把訓練的一部分權限交給 agent,正是這份路線圖當初寫出來要處理的情境——這暗示 agent 參與訓練的內部採用,與組織今年夏天公布的安全骨架是並進的,而非超前的。

還有一層競爭框架。本月稍早,Anthropic 公布了「R&D Automation Index」,揭露 Claude 現在「主導」該公司約 26% 的 AI 研究工作,高於 2026 年 2 月的不到 1%——意味著在對手實驗室裡,AI 主導的工作在半年內從誤差範圍攀升到研究組合的四分之一。Kavukcuoglu 的峰會聲明可以讀成 Google 的對應揭露:量化程度較低,但描述的是同一個底層轉變。每一間前沿實驗室,現在都在不同程度上用自家模型來打造自家模型。整個產業正從不同的起點、不同的揭露文化,收斂到「AI 輔助的 AI 開發」這條路上。

為什麼這比一般產品更新更重要

訓練循環內部的自主性,和聊天機器人新功能或降價是截然不同等級的消息,原因有三。

第一,它直接攻擊研究的成本結構。實驗設計與結果分析是每間實驗室最稀缺的資源——比 GPU 窄、比資本窄。資深研究員的一週,大多消耗在 Kavukcuoglu 說 agent 已能處理的那類工作上。如果 agent 能扛下實驗循環、人類只負責監督,組織的有效研究產能就與人數脫鉤。在模型發布已從 2023 年的約每 73 天一次,加速到 2026 年每 18 天一次的產業裡,這正是可能讓曲線繼續上彎的機制。

第二,它改變了遞迴自我改善辯論的形狀。人們爭論的情境——AI 有意義地改進 AI——通常被當成未來的門檻事件。但 Kavukcuoglu 的聲明,加上 Anthropic 的 26% 數字,把它重新框架成一個現在進行式的漸變:不是一個會翻轉的開關,而是一條上升的占比曲線。對這兩份揭露最誠實的解讀是:AI 研究的部分自動化已經在前沿實驗室上線了,真正的開放問題只剩下速度、監督品質,以及天花板在哪裡。

第三,它拉高了監督層的賭注。「在人類監督之下」這幾個字承擔了整句話的大部分重量,而產業自己也清楚。就在 DeepMind 發布控制路線圖的同一個月,他們自己的公共政策文章就警告過科學將出現「新的驗證瓶頸」——當 agent 產生假說與結果的速度超過人類有意義地查核的能力時,瓶頸就出現了。如果 agent 負責提出並執行訓練實驗,人類審查者必須消化的機器生成研究,在數量與細微程度上都會超過任何既有審查機制的設計負荷。研究自動化之後,瓶頸不會消失;它只會轉移到簽核者的那一端。

接下來看什麼

實驗室之間的「揭露落差」本身正在成為一個故事。Anthropic 給了自動化占比一個明確數字;Google 描述了能力但沒有量化;OpenAI 對內部 agent 使用量的說明則一如既往地少。可以預期,來自研究者、乃至最終來自監管機構的壓力,將推向標準化申報:前沿模型的開發過程中,有多少比例是機器主導的——就像產業先前被推著公開安全評估一樣。

Kavukcuoglu 本人給過一個穿過跑分雜訊的實用尺標:數一數你一天裡遇到的 agent。對 DeepMind 而言,六個月前的答案是訓練循環裡零個 agent,今天是實驗循環中一個受監督但自主的切片。下一個檢查點不在於 agent 能不能做更多——這條軌跡沒有人認真懷疑——而在於監督層、控制路線圖與人類審查能量,能否以同等速度擴張,跟得上它們所看照的自主性。這場發生在實驗室內部、能力與監督之間的賽跑,現在已經在生產環境中開跑了。