資料擊敗了架構:一項六年消融實驗改寫預訓練史
Dwarkesh Patel 與 Jerry Han 發布縝密的六年消融實驗:2019 至 2025 年間,資料改進帶來的算力效率增益是模型架構的 3.24 倍——資料 12.0 倍、模型僅 3.7 倍——而且兩者幾乎完全獨立、互不依賴。
過去六年 AI 的進步,有多少來自更好的資料,又有多少來自更好的模型?這個問題聽起來早就該有人回答,但直到現在才真正有人做了。2026 年 9 月 8 日,Dwarkesh Podcast 主持人 Dwarkesh Patel 與 Jerry Han 發表了《Pretraining Progress Is Mostly Coming From Data》,把六年的預訓練技術進展拆解成「資料」與「模型」兩個組成部分。核心數字相當直白:2019 至 2025 年間,資料改進帶來的算力效率增益是模型改進的 3.24 倍——在固定 10^19 FLOPs 預算下,資料貢獻了 12.0 倍的算力乘數,模型只有 3.7 倍。
對一個把數十億美元投入架構研究、優化器調校與核心工程,卻把資料管線視為不起眼管道作業的產業來說,這是個令人不安的結果。而它出現的時機尤其敏感——整個領域此刻正為「資料之牆」(data wall)焦慮不已:新鮮的人類網路文字,可能正在耗盡。
他們到底做了什麼
這項研究之所以可信,在於方法論。作者為 2019 到 2025 的每一年重建了兩種工件:一份該年度代表性的開源模型配方(當年公開已知的演算法堆疊——架構、優化器、初始化、學習率排程、超參數),以及一份該年度代表性的公開資料語料庫(當時最好的開放爬取加上篩選技術)。
模型這條線,從 2019 年的 GPT-2 一路走到 2025 年的 OLMo-2,沿途納入 RoPE 位置編碼、RMSNorm、SwiGLU 激活函數、QK-norm、並行注意力+MLP 區塊,以及優化器與初始化的持續改良。資料這條線,則從 OpenWebText——約 90 億 token、僅收錄 Reddit 高讚連結網頁,基本上就是 GPT-2 的訓練語料——走到 2025 年 UltraFineWeb 等級的語料庫:涵蓋整個網際網路的爬取,加上以分類器驅動的篩選,能預測哪些文件實際上會提升模型表現。
然後是燒錢的部分。研究團隊訓練了這些配方與語料的完整交叉組合——每一代模型配上每一代資料——跨越 10^17 到 10^19 FLOPs 的五個算力預算,每個資料點跑多個獨立隨機種子,並共用同一個分詞器(GPT-2 BPE)與上下文長度(T=2048),確保比較基準一致。
有一個測量上的難題值得理解:在不同資料集上訓練的模型,無法用交叉熵損失互相比較。因此作者改用 OLMES(整合 10 項相對簡單的選擇題基準)評測末端能力,再推導出「算力乘數」——相對於 2019 年基線,某個配方/語料組合需要多少更少的算力才能達到固定的能力門檻。末端能力評測帶來的雜訊,則透過種子重複實驗與參數化自助法(bootstrap)的誤差區間來處理。
三個重要發現
發現一:資料的效率增益是模型的 3.24 倍。 在 10^19 FLOPs 預算下,2025 年的資料語料本身價值 12.0 倍算力乘數;2025 年的模型配方只有 3.7 倍。逐年拆解,資料軸每年約 1.51 倍進步,模型軸約 1.24 倍,兩者合併時每年聯合進步 1.57 倍。
發現二:兩軸幾乎完全獨立。 一個只含模型與資料加成效果的線性模型,就能解釋 OLMES 分數 88% 的變異量。OLMo-2 架構的增益不需要特定搭配 UltraFineWeb 才能實現,反之亦然。這個獨立性對產業是低調的好消息:資料工作與架構工作是互補的槓桿,不是彼此競爭,誰也不必等誰。
發現三:作者自己很在意的但書——這是小尺度實驗。 這裡的每一次訓練都遠低於前線規模。那些主要在超大規模才發揮作用的模型端創新(MoE 路由、稀疏注意力變體、讓十萬張 GPU 不發散的穩定性技巧),在 10^19 FLOPs 下不會顯現為算力乘數。作者明說:像 GQA 這類推論端效率優化、分詞器改良、長上下文機制,都不在他們的度量能捕捉的範圍內。
帆船與貨櫃輪
這篇文章最有價值的部分,是作者拒絕過度延伸結論的克制。天真的解讀是:2019 到 2024 年的預訓練進步「不過是資料工程」,模型研究無關緊要。他們認為這是錯的——而用的比喻是航海。
小模型是帆船:容量有限,裝載什麼貨物必須錙銖必較。這正是資料品質增益在實驗尺度上佔主導的原因。前線模型則是貨櫃輪:擁有巨大的過剩容量,且相對 Chinchilla 最適值高達 100 倍的超量訓練(overtraining),可以吸收海量、品質較低的資料,讓隨機梯度下降自己把訊號從雜訊中分離出來。對前線語料激進篩選,反而強迫在小資料上跑幾十個 epoch,實證上表現比更大、平均品質更低的資料集還要差。
照這個讀法,模型研究的歷史性貢獻不是效率,而是讓規模本身變得可用。FlashAttention、MoE、各種正規化技巧,主要不是讓訓練變便宜,而是移除了那些讓十萬張 GPU 叢集上的訓練不可行的限制——梯度爆炸、記憶體耗盡、頻寬高牆。資料工程讓每一個 FLOP 更聰明;架構讓每一座叢集成為可能。
為什麼此刻重要
時機,讓這篇研究從有趣的部落格文章升級為產業級結果。三股潮流在此交會。
第一,資料之牆。 如果資料改進一直是預訓練效率的主導引擎——而研究中檢視的語料全是對有限的 Common Crawl 存量做篩選,而非擴大它——那麼預訓練進步的主引擎,依賴的是一項不會再生的資源。用作者的話說:「我們不會憑空生出更多網際網路。」合成資料能否真正擴充語料而不劣化模型,因此成為關鍵問題——作者明言這超出本次研究範圍,並列為未來工作。
第二,它把一個已有的懷疑量化了。 Epoch AI 的趨勢追蹤估計預訓練算力效率每年提升約 3 倍,而 Anson Ho 等人早已猜想「多數軟體進展其實來自資料品質改善」。這項研究是第一個把這個猜想附上硬數字(12.0 倍對 3.7 倍)的細粒度、自底向上拆解。值得注意的是,它量測到的每年 1.57 倍聯合進步低於 3 倍的頭條估計——正是因為規模相依與推論端的增益在小尺度下無法顯現。兩個數字之間的落差,本身就是一項研究發現。
第三,它重新框架了自動化研究的問題。 Ryan Greenblatt 指出,歷史上多數資料語料的改進,看起來就像自動化研究者能用實證方法直接測試的那種進步——對不同資料混合跑消融實驗、量測下游表現、迭代。如果這個觀察成立,那麼預訓練進步的主導軸線,恰好就是 AI 驅動研發會最先加速的那條軸線。
誠實的限制
作者異常坦白,讀者應該把發現與但書放在一起看:實驗尺度相對前線訓練極小;OLMES 是一套簡單基準,它獎勵的資料工程會不同於例如程式碼評測;每年選一個代表性配方與語料是判斷題,不是詳盡普查;部分年代(NeoX、the Pile)的算力乘數仰賴外推。the Pile 輸給 OpenWebText 正說明了這一點——它的貢獻是來源多樣性(PubMed、arXiv、GitHub、專利),而這對英文網路散文選擇題的轉移效果極低。
這些都不削弱核心結論:六年來,這個領域的效率引擎不成比例地燒著資料這種燃料。下一個六年,可能取決於這種燃料是否可再生。