← All posts / Policy

「人類史上最大規模的勞動竊取」:紐約時報訴 OpenAI/Microsoft 案解密封文件,揭露兩巨頭的私下真心話

曼哈頓聯邦法院於 9 月 17 日公開未塗黑的訴訟文件:Microsoft 高層在內部備忘錄中稱大規模抓取新聞內容是「人類史上最大規模的勞動竊取」,Nadella 在證詞中坦承付費牆內容理應取得授權,OpenAI 內部文件更直言聊天機器人對出版商構成「生存威脅」。

「人類史上最大規模的勞動竊取」:紐約時報訴 OpenAI/Microsoft 案解密封文件,揭露兩巨頭的私下真心話

2026 年 9 月 17 日,曼哈頓聯邦法院悄悄公開了一批文件,瞬間改寫了《紐約時報》訴 Microsoft 與 OpenAI 著作權大戰三年的敘事。Sidney Stein 法官解封了這樁指標性案件最新一輪的訴狀,未塗黑的內文揭露了任何公關稿都掩蓋不了的事實:被告自家高層用他們自己的話,把 AI 訓練的經濟學描述得活像原告的開庭陳詞。

最聳動的引言來自 Microsoft 應用科學總監 Brent Hecht。他在 2023 年 1 月的內部備忘錄中,將大規模抓取新聞內容描述為「規模空前、令人震驚的竊取」,並寫下了如今傳遍全球的那句話——「人類史上最大規模的勞動竊取」。三年後,這句話成了呈堂證物,而 Microsoft 在法庭上的官方立場卻是:以受版權保護的文字訓練 AI 屬於「轉化性合理使用」。

解封文件究竟說了什麼

值得注意的是,這批新公開的內容主要來自《紐約時報》自己的訴狀,而非仍處於密封狀態的原始證物——引言因此缺少原始上下文,閱讀時應保持這層警覺。但即便以原告的轉述為準,這些「自白」的力道依然驚人。

「末日循環」簡報。 Hecht 於 2024 年 1 月撰寫的內部簡報包含一組數據:Microsoft 的 Copilot「答案引擎」使 nytimes.com 網域的點閱率相較傳統 Bing 搜尋暴跌了最多 93%。Hecht 將此描述為一個「末日循環」(doom loop),會「同時傷害我們模型的表現與整個網路」——等於明白承認答案引擎正在餓死模型賴以為生的內容來源。同一份文件裡另一段話近乎學術般的坦白:「一個終端產品威脅到其關鍵供應商的經濟基礎,這種情況極不尋常,但這正是我們的 LLM 業務對其『內容供應鏈』造成的局面。」

Nadella 的宣誓證詞。 Microsoft 執行長 Satya Nadella 今年稍早接受 deposition 時證稱:「任何付費牆內容,任何人想要用來做 grounding 或訓練,都應該取得授權。」他並表示,若自己「當時知道 OpenAI 抓取並訓練了付費牆內的資訊」,他會「行使(Microsoft 的合約權利)要求 OpenAI 重新訓練其模型」。他還同意,與聊天機器人對話「已經取代了……在 AI 平台上直接給你資訊,而不是需要前往原始來源網站」。

OpenAI 的內部用語。 OpenAI 的 ChatGPT 負責人 Nick Turley 在內部通訊中寫道,出版商面臨來自 ChatGPT 這類產品的「生存威脅」,這些產品「很大程度上是替代性的」,而且「會隨著能力提升變得愈來愈具替代性」。總裁 Greg Brockman 則形容這些模型「非常擅長新聞」。另一份 Microsoft 文件也承認,生成式 AI 有「真實風險」可能「嚴重破壞那些產出訓練資料的人的就業」。

抓取規模,與那個付費牆「小技巧」

文件也首次量化了出版商內容在訓練管線中的規模。僅 OpenAI 的中期訓練資料集,就涉嫌包含超過 91,692 份《紐約時報》、《紐約每日新聞》與調查報導中心(CIR)作品的副本;一個源自 Common Crawl 的資料集,光 nytimes.com 的文件就超過 200 萬份。資料甚至是雙向流動的:OpenAI 將整個 GPT-3 訓練資料集交付給 Microsoft 用於產品整合,Microsoft 則透過代號「Project Taxi」與「Project Mango」的計畫回頭供應訓練資料——後者組裝成的資料集包含至少 160,903 份出版商作品的副本。

最致命的或許是付費牆事件。當 OpenAI 研究員 Nick Ryder 告訴 Brockman 自己找到了一個「繞過 nytimes 付費牆的 hack」時,Brockman 在訴狀中被引述的回覆只有兩個字:“ah nice”。文件進一步指控,員工刻意在資料送進模型前剝除版權聲明,因為研究人員「不會希望模型輸出」這些聲明給使用者看。

為什麼這對合理使用之爭至關重要

美國的合理使用判斷取決於四項因素,其中第四項——使用是否損害原作的市場——向來是出版商手中最強的牌。內部文件承認產品「很大程度上是替代性的」,再配上 Microsoft 自家的 93% 點閱率下滑數據,對第四因素的直接殺傷力是外部專家報告難以比擬的,也讓「AI 輸出是轉化而非取代新聞」的辯護變得更加棘手。

時機尤其微妙。本月稍早,川普政府才提交了一份法庭之友意見書,為 OpenAI 未經授權使用版權內容辯護,而迄今各法院對 AI 訓練的合理使用主張大體上也偏向科技公司這一方。但正如《紐約每日新聞》的律師 Steven Lieberman 在聲明中所說:「這裡首次揭露的證據顯示,OpenAI 與 Microsoft 明知他們在做的事是錯的。」兩家公司皆未回應對解封文件的置評請求。

公開立場與私下語言之間的落差,才是這則新聞真正的核心。Microsoft 對外把 Copilot 包裝成出版商的夥伴;對內,它自家科學家卻在同一時期寫著關於「竊取」與「末日循環」的備忘錄。無論 Stein 法官最終在即決判決中如何裁定,這份解封紀錄已經改寫了公共輿論的敘事——也讓業界每一場授權談判,從此多了一個尷尬無比的起點。