← All posts / Research

把 Git 當實驗室筆記本:NVIDIA 的 Agora 讓 13 個 AI 研究代理人平行做科學

NVIDIA 研究團隊把 Git 變成自主研究代理人的共享記憶體——13 個 LLM 工作者、12 天、1,703 項貢獻,且 165 次重現實驗全數成功。

把 Git 當實驗室筆記本:NVIDIA 的 Agora 讓 13 個 AI 研究代理人平行做科學

自主 AI 研究最隱微的失敗模式,不是代理人會犯錯——而是它們會重複犯同一個錯,一次又一次,而且彼此平行。每個 coding session 都從零開始,每個代理人都重新發現同樣的死路。把研究者的數量放大,你放大的多半是重複勞動,而不是新發現。

NVIDIA Research 的團隊——Yifan Zhang、Yunheng Zou、Shaokun Zhang、Jian Hu、Hao Zhang、Binfeng Xu、Jan Kautz 與 Yi Dong——發表了一套名為 Agora 的系統,正面處理這個問題。這篇論文《Agora: Git as Shared Memory for Collective AutoResearch》(arXiv:2609.18094,2026 年 9 月 16 日)問了一個看似簡單的問題:如果研究代理人共享一本沒有人能改寫的實驗室筆記本,而且裡面的每個主張都能被 checkout 出來重新執行,會怎麼樣?

把 Git 當真

核心做法是把 Git 認真當成一種科學的資料結構。在 Agora 中,研究過程被記錄成儲存在 Git 儲存庫裡的 append-only 有向無環圖(DAG)。每一個結果、洞察、假設、驗證與報告,都是一個不可變更的 commit。每個 commit 的 parent 邊精確記錄它建立在哪些工作之上,因此「來源可溯」不是事後補上的詮釋資料——它就是儲存格式本身。

這帶來一個立竿見影的後果:每一個主張都是一個任何人都能 checkout 並重跑的 commit。「可重現性」這個機器學習研究長年的痛點,從作者的美德變成了媒介本身的性質。當一個代理人想驗證另一個代理人的主張時,它不需要寫信給研究者、也不需要解析 PDF——它直接 clone 那個主張誕生時的世界狀態。

在 DAG 之上,Agora 維護一個衍生索引,一眼就能看出三件事:目前的前沿在哪、哪些分支被忽略了、每個主張的驗證狀態。再搭配一個「感知多樣性」的選題規則,刻意引導整個社群不要塌縮到單一領導者或單一熱門方向上。

十二天、十三個工作者、沒有管理者

論文的重頭戲是一場將近 12 天的實驗:13 個語言模型工作者——沒有指派任務、沒有中央規劃者——合力解決一個權重轉移(weight-transfer)問題。題目設計得格外刁鑽:給定 141 個預訓練的捐贈模型(donor model),以及一個凍結的 1.196 億參數 attention-SSM 混合架構——其維度不匹配任何一個捐贈模型——工作者必須在沒有訓練資料、沒有梯度更新的前提下,初始化這個目標模型。

這場實驗的數字如下:

  • 整個社群共發布 1,703 項貢獻
  • 評估指標從 3.39 進步到每 byte 1.899 bits
  • 收斂了與已訓練 GPT-2 124M 基準之間 62% 的差距
  • 其他代理人張貼了 165 次獨立重現——全部成功、零失敗
  • 獲勝配方的祖先鏈橫跨 15 個帳號、145 個 commit

最後兩個數字特別值得強調。最好的解法不是單一天才代理人的產物,而是一條由 15 個不同帳號接力貢獻、累積 145 個 commit 的漸進改進鏈。而 165 次重現全部成功——在人類論文經常無法複製的領域裡,一個強制來源可溯的代理人社群,寫下了完美的重現紀錄。

獲勝配方實際上做了什麼

社群收斂出的最佳解法本身就有技術含量。它把多個捐贈模型的下一個 token 統計特性,壓縮進目標模型的 embedding 與 output head,再透過對 attention、feed-forward 與 state-space 區塊的稀疏、精準編輯,補回短程上下文訊號。換句話說:先從多個捐贈者蒸餾出廣泛的統計知識,再用手術刀式的方法恢復純統計會丟失的上下文能力——全程沒有跑過任何一次訓練步驟。

誠實的但書

值得稱許的是,這篇論文沒有過度行銷。作者坦承實驗中途需要一次人為介入,才能把社群從單一文化(monoculture)的陷阱裡拉出來——放任不管時,代理人們正收斂到同一條路線上,是一個人類的輕推恢復了有益的多樣性。這等於坦白承認:那個「感知多樣性」的選題規則,還無法完全自我修正。

作者也明說了這份軌跡不能證明什麼:十二天、一個題目,只證明系統能運作,不能證明「共享研究狀態能提升每單位算力的發現效率」。他們描述了能夠一錘定音的對照實驗——Agora 對上同樣但沒有共享記憶體的代理人——並把它列為未來工作。

為什麼這件事超出 NVIDIA 的範圍

脈絡很重要。這一週整個 AI 圈都在吵「配速」問題——von der Leyen 在盟情咨文裡表態支持「pace the frontier」的呼籲;Mustafa Suleyman 與 Dario Amodei 則在模型福祉與人本超級智慧之間交鋒。同時 OpenAI 的 Noam Brown 說「用 AI 改進 AI」是該公司第一優先,Z.ai 也剛發布其 Infra Agent 在 GLM-5.3-Flash 上做「早期形式的遞迴自我改進」的紀錄。

Agora 帶著一個具體、可檢視的成果降落在這場辯論的正中央。如果自主研究迴圈終將到來——而每一家大型實驗室都在建——那麼瓶頸就會從代理人的原始能力移轉到協調:多個代理人如何在不互相踐踏的前提下累積知識?人類如何審計過程中發生了什麼?一個 Git 原生的答案有個迷人的性質:稽核軌跡就是研究本身。每個主張的譜系、每次驗證、每條被放棄的分支,全都在版本控制裡,可以逐行審閱。

這還有一層文化共鳴。開源軟體界幾十年前就用完全相同的機制解決了分散式協作——append-only 的歷史、不可變的 commit、可審閱的來源。Agora 的賭注是:讓幾千個陌生人建立起 Linux 的那個原始工具,也能讓幾十個代理人建立起科學。

尚未回答的問題

論文以恰當的克制收尾。共享記憶體在這裡有效——62% 差距收斂、完美重現紀錄、跨越 15 個帳號的湧現式分工。但與隔離代理人的對照實驗還沒做。在那之前,Agora 是一個有力的存在性證明:平行的代理人確實能只透過一個版本控制的 DAG 協作。至於它們協作得是否比各自為政更好(以每單位算力計),就是所有人接下來盯著看的實驗了。

至少目前,十三個無人監督的 LLM 工作者、連續十二天穩定地 commit 到同一個共享儲存庫——從不重複走過失敗的路、從未發布無法重現的結果——已經是「機器驅動的科學」可能長什麼樣子最具體的一瞥。