1,000 個儲存庫、5,000 個技能、獎牌率提升 134%:BAAI 的 DisCo 把 GitHub 變成代理的養分
BAAI 的 DisCo 框架將 1,000 個常用機器學習儲存庫蒸餾成 5,000+ 個經驗證的代理技能,每個儲存庫成本約 40 美元——在固定使用 GPT-5.5 的條件下,配備技能的研究代理在 MLE-bench 提升 134.3%、PaperBench 提升 34.4%。
機器學習領域最重要的知識,並沒有寫在代理能直接使用的地方。它存在於 README 檔案裡、存在於 issue 討論串中、存在於某人在三次失敗後才發現的特定參數順序裡、存在於把訓練任務從損毀檢查點救回來的復原步驟裡。BAAI 本週發表的 DisCo 框架(論文編號 arXiv:2609.02749,〈Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills〉)正是要解決這個問題——而它的核心數據很難忽視:配備蒸餾技能的研究代理,在 MLE-bench 提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%,對比的是完全相同但沒有技能的代理。
缺失的那一層:操作性知識
論文的定位相當精準。今日的自動化機器學習研究代理,結合了模型骨幹與負責規劃、執行、記憶和驗證的框架。但這種架構漏掉的,是作者所稱的操作性知識(operational knowledge)——「知道一個方法」與「讓它跑起來」之間的訣竅。
這些知識並非不存在於世界上。它們散落在儲存庫與論文裡,但「以寫給人類讀者的形式呈現,且大到無法在任務中載入」。面對 vLLM 部署問題的代理,無法在任務中途消化四萬行程式碼;就算可以,它真正需要的也不是程式碼摘要,而是一套程序:這個能力何時適用、要執行什麼、如何驗證結果、實驗失敗時如何復原。
DisCo 的答案是:把這套程序蒸餾出來、驗證它、然後重複使用。「一旦蒸餾成緊湊且經驗證的技能,這些知識就可以跨任務重複使用,而不必在每次執行時重新發現。」
兩種蒸餾模式,一座圖書館
DisCo 以兩種互補的形式運作:
- 任務無關蒸餾(task-agnostic):把領域內廣泛使用的儲存庫濃縮成可重複使用的技能,橫跨整個開源生態系大量生產。
- 任務導向蒸餾(task-oriented):針對具體任務的需求,即時產出所需的技能。
任務無關路線的成果,就是 AREX-Skill 技能庫:從 1,000 個常用機器學習儲存庫蒸餾出 5,000+ 個經驗證的技能,組織成 20 個研究領域與 178 個能力(套件)家族。涵蓋範圍包括機器學習工程、大型語言模型、電腦視覺、資料科學、科學計算、模型部署、訓練基礎設施、機器人學、生成式媒體與生醫 AI,並提供 vLLM、SGLang、AlphaFold2、FAISS、Unsloth、Diffusers、LeRobot 等具名技能。
值得注意的是,這一切並非免費。團隊報告的成本是每個儲存庫約 40 美元——換言之,整座 1,000 儲存庫的技能庫大約只花了四萬美元的蒸餾運算成本。對一個能讓強力代理在 Kaggle 式任務上獎牌率翻倍的資產來說,這個數字小得驚人。
真正重要的數字
所有基準測試比較都固定了代理設定——GPT-5.5 骨幹、研究框架與下游執行預算——只改變代理是否擁有 AREX 蒸餾技能:
| 基準測試 | 情境 | 指標 | 基線 | + 技能 | 提升 |
|---|---|---|---|---|---|
| MLE-bench | 機器學習工程(75 場 Kaggle 競賽) | 任一獎牌率 | 31.11% | 72.89% | +134.3% |
| PaperBench | 論文重現(20 篇論文) | 重現分數 | 29.45 | 39.59 | +34.4% |
| FrontierCS | 演算法最佳化(188 項任務) | 分數 | 70.63 | 77.14 | +9.2% |
| PassNet | 編譯器 pass 最佳化(200 個樣本) | AS 分數 | 1.343 | 1.531 | +14.0% |
MLE-bench 的結果最為突出。在 75 場 Kaggle 競賽中把任一獎牌率從 31% 拉到 73%——而不更動模型、框架或運算預算——這個效應比多數前一代模型升級整整一個世代帶來的還大。而且它來自增加上下文,而非增加參數。
團隊對增益來源的解讀值得引述其精神:操作性知識至關重要;優勢在困難任務上最明顯,技能幫助代理避免昂貴的無導引試錯,並從瀕臨失敗的狀態中復原;預算也花得更有生產力,因為相關的技能圖讓代理更早抵達解空間中有用的區域,把更多預算花在實驗與驗證上。
技能如何打造——又如何保持誠實
DisCo Creator 透過四階段工作流建構每個技能:從錨點界定能力範圍、以可採信的證據奠基、建構候選技能圖、在發布前驗證與精煉。錨點可以是來源(任務無關)或問題(任務導向)。支撐證據、驗證檢查與未解決的缺口都保留在建構紀錄中——來源可追溯性是一級公民,而非事後補上的裝飾。
每個技能採用開放的 Agent Skills 格式(以 SKILL.md 為核心,可選配 references/ 與 scripts/ 資源),並以路由器把請求收斂到領域、家族、儲存庫與工作流,讓代理只載入所需分支。這種漸進式揭露設計讓初始上下文保持精簡,同時保留通往更深層指令與可執行輔助工具的通道。
維護問題也被正面處理:儲存庫技能會對照上游變更追蹤,每個技能都記錄來源 commit、驗證步驟與刷新要求。考量機器學習工具的迭代速度,決定這座圖書館一年後是否還有價值的,將是這套刷新紀律——而非最初的蒸餾。
立即上手
整個技術棧完全開放且現在就能用:
# 安裝 DisCo CLI(需要 Node.js >= 22.19.0)
npm install -g --ignore-scripts @arex-skill/disco
# 安裝技能庫並啟動 Researcher 模式
disco repo-skills install
disco
技能也可以匯出到其他編碼代理——Codex 與 Claude Code 是文件明載的目標——因此這座圖書館並不鎖死在 DisCo 自家的執行環境裡。儲存庫採 Apache 2.0 授權,但有一個重要但書:每個技能帶有自己的授權,衍生自其上游儲存庫;使用者在重新散布前必須檢查每個技能的授權元資料。
為什麼這篇論文的重要性超過單一研究
這裡有一個遠超出 BAAI 一家機構的啟示。過去兩年,產業對於改進代理的隱含理論一直是「更多參數、更多推理 token」。DisCo 的結果主張:我們所稱的代理能力,有很大一部分其實是缺失的上下文——而上下文可以被製造、驗證,並以工件形式發布。
它也重新定義了開源本身的價值。AREX-Skill 技能庫之所以存在,是因為數千位工程師發布了可用、有文件說明的機器學習儲存庫。BAAI 在致謝中把這點講得很明白:這些儲存庫技能「之所以存在,是因為許多研究員與工程師為社群釋出了高品質的機器學習、代理、資料、生醫/化學、視覺與基礎設施專案」。GitHub 一直是一座知識銀行;DisCo 則是把存款轉化為代理可用資本的機器。
未解的問題依然存在。技能品質取決於蒸餾模型的品質,蒸餾廠的錯誤會傳播到數千次下游執行中。每技能授權的狀況確實複雜——1,000 個上游儲存庫帶著數十種互不相容的授權。而 +134% 的 MLE-bench 增益是相對於無技能基線量測的;當技能庫成為標準配備後,邊際優勢會向新常態壓縮。
但作為「妥善包裝的操作性知識價值幾何」的證明,arXiv:2609.02749 是今年最乾淨的示範之一。「知道方法」與「能讓它跑起來」之間的差距,換算下來大約是每個儲存庫 40 美元。