← All posts / Research

OpenBMB 開源 Ultra-FineWeb-L1:1.3 兆 Token 的 2025 年網頁語料,Apache 2.0 授權釋出

OpenBMB 發布 Ultra-FineWeb-L1——以六個 2025 年 Common Crawl 快照構建的 1.3 兆 token 英文網頁語料庫,是迄今涵蓋最新爬取快照的開源預訓練資料集,消融實驗中較 FineWeb 高出 0.6 分。

OpenBMB 開源 Ultra-FineWeb-L1:1.3 兆 Token 的 2025 年網頁語料,Apache 2.0 授權釋出

2026 年 8 月 20 日,OpenBMB——源自清華大學與面壁智慧合作的開源社群——在 Hugging Face 上以 Apache 2.0 授權,低調發布了今夏最具份量的 AI 基礎建設工件之一:Ultra-FineWeb-L1。這是一個從六個 2025 年 Common Crawl 快照中提煉出的 1.3 兆 token 英文網頁語料庫。

聽起來平淡無奇,實則不然。預訓練資料是 AI 技術堆疊中極少有實驗室願意公開的一層,而目前所有人用來訓練模型的開放語料庫——FineWeb、FineWeb-Edu、DCLM、RedPajama——全部建基於 2024 年或更早停止的爬取資料。就 OpenBMB 所知,Ultra-FineWeb-L1 是涵蓋最新 Common Crawl 快照(一路到 CC-MAIN-2025-51)的開源網頁預訓練資料集。如果你要在 2026 年底訓練一個開放基礎模型,希望模型的世界知識涵蓋 2025 年下半年,目前市面上只有這一個選擇。

Ultra-FineWeb-L1 到底是什麼

Ultra-FineWeb-L1 是 OpenBMB UltraData 框架的 L1 過濾層。這個 2026 年 2 月推出的分層資料管理體系將資料分為 L0 到 L4 五層;L1 代表「過濾」:基本清理、啟發式過濾、敏感欄位替換與去重——把原始爬取轉為可用文字的重工,但不做品質篩選。L2 才是品質「挑選」,L3 則是精煉為合成問答與多風格改寫。

首波釋出包含 逾 1 兆 token、約 11.4 億份文件,按 Common Crawl 快照(CC-MAIN-2025-30 至 CC-MAIN-2025-51)組織,以 Parquet 格式發布。每份文件包含四個欄位:UUID4 格式的 uid、清理後的 content、帶有 URL、語言分數、WARC 記錄 ID 與爬取日期的 JSON meta,以及 dataset_index 來源標識。

處理管線建基於 Hugging Face 的 FineWeb 流程,但幾乎每個環節都升級了:

  1. trafilatura 2.0 主文提取——這個提取庫的最新大版本,剝除導覽列、留言與樣板文字。
  2. fastText 語言過濾——僅保留高信心度的英文文件。
  3. 啟發式過濾——沿用 FineWeb 對重複內容、低品質文件與異常行結構的規則。
  4. 敏感欄位替換——信箱、IP、電話、身分證號與信用卡號以佔位符替換,而非直接刪除。
  5. MinHash 去重——沿用 FineWeb 的策略,在每個快照內部而非跨快照去除近似重複文件。
  6. 代理輔助的客製化清理——最新穎的環節。OpenBMB 動用 UltraData 的資料品質檢測工具與「資料清理代理」,針對殘留 HTML、亂碼與 mojibake、隱形字元、損壞內容與異常文件長度做定向處理。

最後一步值得玩味:語料構建中最枯燥的環節,如今也交給了語言模型。訓練下一代模型的資料集,有一部分正是由這一代模型清理出來的。

支撐這一切數字

OpenBMB 不是只丟出語料就了事——他們跑了完整的消融實驗。遵循 FineWeb 的評測方法學,每種資料配置都以 MiniCPM5-1B(稠密 10 億參數模型)在完全相同的設定下訓練 20B token:32 張 GPU、全域批次 512、Muon 優化器。評測涵蓋六大類 12 項基準(常識、閱讀理解、推理、自然語言理解、數學、表格理解),採 3-shot Cloze 格式提示。

在兩條管線共同覆蓋的快照 CC-MAIN-2025-26 上,訓練結束時的結果:

資料配置六類宏觀平均12 項微觀平均
FineWeb9.033%8.484%
Ultra-FineWeb-L19.668%9.180%
Ultra-FineWeb-from-FW9.954%9.414%
Ultra-FineWeb-from-L110.379%9.798%

這張表有兩層訊息。第一,單是升級後的 L1 清理管線,就在相同資料上比 FineWeb 高出 宏觀 0.635 分、微觀 0.696 分——同一份爬取,更乾淨的文字,更好的模型。第二,各層效果會疊加:在 L1 清理之上再套用 Ultra-FineWeb 分類器的 L2 品質挑選(「from-L1」)得到全場最佳,優於直接在 FineWeb 上做挑選(「from-FW」)。清理與挑選是互補關係,不能互相取代。

值得一提的是,MiniCPM5-1B 本身(2026 年 5 月 25 日發布)正是以 Ultra-FineWeb 作為核心預訓練語料,拿下了 10 億參數級的開源 SOTA——這些消融數字不是實驗室裡的玩具,而是生產環境的配方。

為什麼「更新鮮的爬取資料」比想像中重要

看到「1.3 兆 token 網頁文字」,直覺反應是:我們已經夠多了。Hugging Face 的 FineWeb 有 15 兆 token,Nemotron、Qwen、DCLM 兩年來發布的 TB 級語料庫不勝枚舉。重點不在規模——在於時效。

基礎模型的知識凍結在預訓練截止日。模型對軟體版本、時事、價格、人物與 API 的全部認知,都來自那一刻。開放生態有一個安靜卻嚴重的問題:幾乎所有開放預訓練語料都停在 2024 年。想讓模型具備 2025 年知識的建模者,過去只有三條路:授權專有資料;自建爬取與清理管線(FineWeb 自己的日誌顯示,這是動輒數月的工程與龐大運算開銷);或從閉源前沿模型蒸餾——伴隨授權爭議與「模型塌縮」的疑慮。

Ultra-FineWeb-L1 改變了這道算式。六個橫跨 2025 年中至年底的快照、經過驗證的清理管線、Apache 2.0 商用授權。對當前正在訓練的開放權重模型浪潮——Meta 的 Muse 系列、阿里巴巴的 Qwen 3.8、NVIDIA 的 Nemotron——一個更新鮮的開放語料庫,直接侵蝕了閉源實驗室最後幾項結構性優勢之一:專有且持續更新的資料管線。

還有一則難以忽視的地緣政治註腳。2026 年發布最多開放預訓練資料的兩個組織都是中國機構:OpenBMB(清華背景)與阿里 Qwen 團隊。當華府還在辯論晶片出口管制與「Pax Silica」陣營政治時,這個人人(包括美國實驗室)依賴的開放資料公共財,正越來越由北京維護。開放,終究是一種策略,而不只是理念。

授權細節與但書

有兩點值得留意。其一,授權條款有一個不常見的但書:程式與管線工件為 Apache 2.0,但 README 明文禁止未經授權的原樣再散布——不得未經許可直接鏡像、轉載或重新打包整個語料庫。這是針對頻寬成本與第三方轉售的務實防線,偏離了純粹的 OSI 精神。衍伸使用、訓練與微調不受限制,且一如所有爬取語料,使用者仍須尊重原始網頁來源的權利。

其二,「僅限高信心度英文」是明確的範圍選擇。姊妹版本補上了其他需求:Ultra-FineWeb(L2)提供約 1 兆英文加上 1,200 億中文 token 的分類器精選資料;Ultra-FineWeb-L3 則新增 4,000 億以上英文與 2,000 億以上中文 token 的合成問答與多風格改寫——後者至今仍是最大的開源中文合成預訓練語料庫。

誰該關注

  • 開放模型訓練者:這是 FineWeb 的直接替代品——更新的快照、經實測的品質優勢。「from-L1」配置(宏觀 10.379%)是下一個要超越的基準。
  • 資料工程團隊:獲得一套代理輔助語料清理的參考實作——管線每個階段都有文件,UltraData 平台工具全部公開。
  • 研究人員:拿到更罕見的東西——一場在 20B token 規模、四種資料配置、訓練設定完全一致下的對照實驗。
  • 其他人:請記住這個日期。開放資料公共財剛剛追上 2025 年底。下一代的開放基礎模型將「知道」GPT-5 上市之後發生的事——開放與閉源之間那道名為「知識截止日」的鴻溝,剛剛縮窄了一年。

Ultra-FineWeb-L1 已上架 Hugging Face,技術報見 arXiv,UltraData 框架文件見 ultradata.openbmb.cn。