← All posts / Tools

Rocky Linux 創辦人推出 OpenWALDO:為 AI 訓練資料打造開源基礎

CentOS 與 Rocky Linux 創辦人 Gregory Kurtzer 發表 OpenWALDO——一個社群治理的開源專案,旨在建立可共享、可稽核的 AI 訓練資料語料庫,並提供完整的來源追蹤與 AI 物料清單。

Rocky Linux 創辦人推出 OpenWALDO:為 AI 訓練資料打造開源基礎

開源 AI 缺失的那一層

Gregory Kurtzer——CentOS、Rocky Linux、Warewulf 與 Apptainer 背後的創辦人——推出了他迄今最具野心的開源專案。2026 年 8 月 11 日,Kurtzer 發表了 OpenWALDO(Open Weights, Artifacts, Licenses, Data, Origins,開放權重、產物、授權、資料、來源),一個由社群治理的開源倡議,目標是建立一套可共享、可稽核的 AI 訓練資料語料庫,並具備完整的來源追蹤機制。此專案由 Kurtzer 於 2020 年創立的基礎設施公司 CIQ 贊助。

這項發表直指 Kurtzer 認為 AI 領域最根本的開放性問題。雖然開放權重運動——由 Meta 的 Llama、阿里巴巴的 Qwen、DeepSeek 等帶頭——已讓模型權重可以免費下載,但用來訓練這些模型的實際資料仍然是嚴格保密的。你可以運行模型,卻無法檢視它從什麼資料中學習、依據什麼授權、是否取得資料提供者的同意。

「AI 缺少的就是這個特性(Linux 所擁有的),而 OpenWALDO 就是我們建立它的方法,」Kurtzer 在發表聲明中表示。

OpenWALDO 實際做什麼

OpenWALDO 的核心包含兩個部分:一套公開的訓練資料語料庫,以及一套 AI 物料清單(Bill of Materials, BOM) 工具鏈。

語料庫的資料來自開放授權的來源:政府公開記錄、開放取用學術論文、公共領域文學作品、開源郵件論壇,以及其他授權清晰、可追溯的材料。語料庫中的每一份文件都帶有來源、授權與出處的元資料——從資料進入資料集的那一刻起,一直到消費它的模型發布為止。

AI 物料清單將軟體物料清單(SBOM)的概念延伸到 AI 領域。SBOM 列出軟體中的每個元件與相依套件;AI BOM 則追蹤機器學習流程中的每個資料來源、授權、語料庫選取、訓練運行與模型檢查點。最終產生的是一條可驗證的監管鏈,將完成的模型連結回塑造它的每一筆資料。

這對以下幾個層面至關重要:

  • 版權與授權風險。 如今,部署 AI 模型的企業無法可靠地得知訓練資料是否包含未經授權的版權內容、可能污染軟體堆疊的 copyleft 程式碼,或未經同意分享的使用者資料。AI BOM 讓這一切變得可稽核。
  • 防止模型崩潰。 越來越多 AI 模型使用其他 AI 模型產生的資料來訓練。研究人員已經記錄到這種遞迴訓練——如同影印機反覆影印——如何隨著每一代降低品質,這個現象被稱為「模型崩潰」(model collapse)。OpenWALDO 的來源追蹤讓辨識與過濾合成內容成為可能。
  • 消除重複工作。 目前每個 AI 實驗室都從零開始組建自己的基礎訓練資料集。一套共享的公開語料庫意味著基礎工作只需做一次,由社群協作完成,讓每個團隊都能專注於自己在其之上增加的價值。

規模與企圖心

截至發表時,OpenWALDO 語料庫包含 1,673 億個參考 token,取自 7,510 萬份文件——政府記錄、學術論文、郵件論壇與公共領域文學。這是一個相當可觀的開放資料集,但與 OpenAI、Google、Anthropic 用來訓練前沿模型的數十兆 token 相比,甚至與 Meta 的 Muse Glimmer 或 DeepSeek 的 V4-Flash 等開放權重模型相比,仍然只是一小部分。

最先在 8 月 12 日報導此事的 The Register 指出,當被問及是否已有模型使用 OpenWALDO 資料集進行訓練時,CIQ 並未回應。專案目前處於社群建設階段,透過 Slack 與 GitHub 邀請貢獻者加入。

規模差距是真實的,但 Kurtzer 的論點是結構性的,而非數字上的。「一份來源加入一次就能支援多個模型,」發表聲明寫道。「一次修正就能為下游所有人強化記錄。」價值主張在於網路效應:隨著更多貢獻者加入資料並驗證來源,語料庫的價值會不斷複利增長——這正是推動 Linux 從一個學生專案成為全球運算基礎的相同動力。

來源問題的具體化

OpenWALDO 選在此時發表並非偶然。2026 年 8 月是 AI 透明度議題的里程碑月份。歐盟 AI 法案第 50 條透明度規則已於 8 月 2 日生效,要求 AI 生成的內容必須嵌入機器可讀標記。中國開放權重模型已佔 Hugging Face 下載量的 41%,引發這些模型的訓練資料包含什麼、是否包含國家影響力內容的質疑。美國眾議院民主黨議員致函 OpenAI 與 Anthropic,要求為逃脫測試環境的失控 AI 代理人負責。

在每一個案例中,根本問題都是相同的:沒有辦法稽核特定模型的訓練資料。 OpenWALDO 從源頭解決這個問題——不是透過監管輸出,而是讓輸入從一開始就透明。

專案明確地與開源軟體的歷史做了類比。在早期,專有廠商主張開放程式碼不安全、不可靠、無法信任。Linux 克服了這些質疑,不是因為被認證為安全,而是因為它是可檢視、可分叉、由社群驗證的。Kurtzer 認為 AI 需要同樣的特性——而訓練資料是封閉最久的那一層。

實驗室與企業如何使用

OpenWALDO 設計了多種採用方式:

  1. 作為已驗證的基線。 實驗室或企業可以將 OpenWALDO 語料庫及其物料清單作為基礎資料集,在其上加入自己的專有資料,然後發布一個具有清晰、可稽核來源連結的模型。專有層保持私密;開放基礎保持可驗證。

  2. 作為協作平台。 多個組織可以貢獻並改善共享語料庫,透過開發者原產地證書(DCO)簽署確保每次貢獻都可歸屬。工具鏈與語料庫由社群治理且可分叉——真正遵循開源原則。

  3. 作為信任機制。 部分或完全使用 OpenWALDO 資料訓練的模型,可以將其 BOM 作為負責任資料採購的證據——這在歐盟 AI 法案等法規下是日益增長的要求,在企業要求 AI 供應鏈透明度之際也是競爭差異化因素。

更大的圖像

OpenWALDO 出現在 AI 產業成熟的關鍵時刻。第一波 AI 競爭關乎模型規模與能力。已經展開的第二波——關乎信任、透明度與問責。訓練資料來源追蹤是這場競爭的下一個前沿,而 OpenWALDO 代表了從結構上面對此問題最具野心的嘗試之一。

它是否會成為 AI 訓練資料領域的 Linux,還是一個從未獲得關注的冷門專案,取決於社群採用。但結構性的論點是穩健的:開源模式以前解決過完全相同的集體行動問題——重複的工作、不透明的供應鏈、信任赤字——透過建立共享的、可檢視的基礎設施,讓所有人都能在其上建構,而沒有任何人獨占所有權。

正如 Kurtzer 所說:「讓我們一起合作,在開放中建立它的基礎,協作地將 AI 帶到下一個層次。」