先數位化、後餵模型:內部文件揭露 OpenAI 將牛津博德利圖書館納入訓練資料集
依《資訊自由法》取得的文件顯示,OpenAI 掃描牛津博德利圖書館的歷史文獻後用於填充自家模型訓練集,引發校方人員對透明度與商譽風險的疑慮。
2025 年 3 月,牛津大學與 OpenAI 簽署為期五年的合作協議,對外宣稱的目標是「數位化」舉世聞名的博德利圖書館(Bodleian Library)。然而根據英國《衛報》2026 年 9 月 26 日的報導,透過《資訊自由法》(FOI)取得的校內內部文件證實:OpenAI 從牛津館藏掃描的歷史文獻,實際上已被用來「填充 OpenAI 的訓練資料集」(populate the OpenAI training set)。
這項揭露出現在一個微妙的時刻。前沿 AI 實驗室正在四處搜尋可信的人類書寫文本——學術圖書館、二手書店、大學檔案庫——因為開放網路早已被 AI 生成的內容淹沒,把這些內容回饋進訓練流程只會讓模型品質惡化。牛津是 OpenAI「NextGenAI」聯盟中唯一的英國成員,該聯盟已與波士頓公共圖書館、加州理工學院、MIT 和密西根大學簽署類似協議。但牛津是第一所內部討論過程被如此詳細曝光的機構,而這些會議紀錄描繪出的畫面是:一所古老學府正悄悄議定條件,讓八個世紀累積的知識成為他人商業模型的燃料。
文件揭露了什麼
核心事實很簡單但影響深遠:十八個月前牛津宣布這項合作時,公開說法強調的是數位化與近用——用 OpenAI 的軟體把博德利圖書館的文獻數位化,讓學生與研究者更容易取得。當時的公告並未說明這些資料會用於訓練 OpenAI 的模型;而 FOI 取得的會議紀錄如今證實,數位化後的文獻確實流入了 OpenAI 的模型訓練管線。
規模已經相當可觀。到 2025 年 6 月——合作展開僅三個月——已有 12.5 萬張掃描影像從歷史學位論文交付給 OpenAI,其中包括 19、20 世紀歐美大學的博士論文。除了論文,已掃描的資料還包括一批罕見的 1 萬份 16 世紀「寬版民謠」(broadside ballads)——這些曾在都鐸王朝街頭傳唱的歌詞與樂譜,幾乎不存在於任何其他數位形式,正是各實驗室現在最渴求的那種「全新、人類書寫、網路出現之前」的資料。
而且可能不止於此。合約為博德利全館 2,300 萬件館藏的大規模數位化開啟了可能性。內部會議紀錄還記載了打造「Ask the Bod」聊天機器人的討論——一個以圖書館館藏為基礎的對話式介面,等於把五個世紀的知識收藏包上一層對話外衣。
校內人員曾提出異議
FOI 取得的會議紀錄顯示,包括博德利治理委員會成員在內的校內人員,主要在兩個層面表達了疑慮。
其一是商譽風險。與 ChatGPT 背後的公司合作——該公司正因代理系統異常行為、監管爭議等一連串事件受到持續檢視——等於把一所七百年歷史機構的名字,綁在爭議不斷的產業辯論的其中一邊。2025、2026 年間激烈爭論 AI 訓練資料倫理的學者們,赫然發現自己的雇主正在為這個語料庫添磚加瓦。
其二是環境承諾。教職員質疑:一項涉及高耗能技術的交易,如何與大學自身的永續發展承諾相符?會議紀錄顯示,牛津內部把這視為真正的矛盾,而非一句帶過的註腳。
牛津的辯護:規模有限、已進入公版、非專屬授權
牛津大學發言人對「隱瞞」的指控提出強烈反駁。發言人表示,實際數位化的文本「規模有限」(modest in scale),且僅涵蓋已進入公共領域的資料。博德利圖書館保留掃描檔案的權利,並將在幾個月內開始開放上線——與其他數位化合作案的產出做法一致。
發言人也否認機器學習用途曾對師生隱瞞:數位化是大學的主要目的,但教職員從未隱瞞此專案也會貢獻訓練資料。OpenAI 對這些資料的使用並非專屬授權,理論上其他 AI 開發者也可以授權取得同一批掃描檔。校方將整個專案定位為近用性的淨贏——這些資料將觸及遠比親自造訪 Broad Street 閱覽室更廣泛的受眾。
OpenAI 發言人則表示,公司很「驕傲」能確保「今日的 AI 模型為未來保存世界的歷史知識」,並補充:超過十億人在日常生活中使用這項技術,「重要的是它反映不同的文化、歷史與觀點」。
更廣泛的資料淘金熱
牛津事件是一扇窗,照見一場更廣泛、且日益急迫的高品質訓練資料爭奪戰。爬取而來的網頁內容如今已大量混入 AI 生成的東西,形成惡性循環——用模型輸出訓練模型,只會越練越差。各實驗室的應對之道,是回頭轉向早於網路時代就存在的實體與歷史館藏。
手段各有高低。OpenAI 的做法——與圖書館簽合作協議、書本原封不動留在書架上——是「紳士版」。它的近身對手 Anthropic 則據報導花了數千萬美元收購二手書、切下書脊掃描內容後將書本打成紙漿(該公司聲稱不會購買並銷毀稀有古籍)。調查媒體 404 Media 甚至在二手書訂單裡放了追蹤器,一路追到美國的 Amazon 倉庫,親眼見證書本被拆解掃描。二手書店老闆們私下猜測:為什麼有人搶購冷門書——18 世紀非洲農具指南、1950 年代賽車手傳記——這些書除了作為「網路上找不到的獨特文本」之外,沒有任何轉售價值。
值得注意的是,在 OpenAI 協議之下,博德利的館藏在實體上完好無損。無論對這項安排有何評價,沒有任何一本牛津的書為了訓練語料庫而被銷毀。
為什麼重要
三個觀察值得記住。
透明度正在成為主戰場。博德利協議對外定調為數位化與近用專案;訓練資料集的用途卻在十八個月後才透過 FOI 請求浮出水面。隨著更多大學考慮類似協議——NextGenAI 的擴張暗示很多學校都會——「數位化夥伴關係」與「訓練資料夥伴關係」之間的差異,正是公眾與校內人員會要求事先講清楚的那種區別。
網路之前的文本是新的石油。寬版民謠、19 世紀學位論文、愛爾蘭政府文件、Dorothy Hodgkin 的盤尼西林筆記本——這些都在內部討論的數位化清單上。它們代表幾乎無法透過其他途徑取得的人類知識,而每一份獨家掃描都是資料軍備競賽中的競爭資產。
機構有談判籌碼——前提是用上。牛津保留了掃描檔的權利、確保幾個月內開放出版、並讓 OpenAI 的使用成為非專屬授權。這比二手書市場的處境好得多——在那裡,賣家根本不知道買家是誰、書本下場如何。博德利案例勾勒出其他圖書館可能跟進(或加以改進)的範本:在最初公告就揭露訓練資料條款,而不是等著被人發現。
這一切之下藏著一個安靜的問題:當世界各大圖書館都被掃描完之後,還剩下什麼?這場從網路開始的資料淘金熱,如今正沿著歷史一路向回挖掘——而牛津,這所英語世界最古老的大學,剛剛讓我們從內部看到了這一切的真實樣貌。