← All posts / Policy

820 萬段對話只命中 24 次:微軟把整場 AI 版權官司押在一個數字上

微軟在即決判決聲請中主張,專家檢視 820 萬筆 Copilot 對話紀錄後,僅找到 24 筆與原告書籍相符的回應——0.00029% 的重現率,正是 LLM 訓練構成轉化性合理使用的鐵證。

820 萬段對話只命中 24 次:微軟把整場 AI 版權官司押在一個數字上

2026 年 9 月 4 日,微軟走進曼哈頓聯邦法院,在 Sidney H. Stein 法官面前放上一個數字:24。在探索程序中交出的 820 萬筆 Copilot 對話紀錄裡,只有 24 筆回應含有至少 30 個連續單字,與作者們提告所主張的書籍內容相符——重現率 0.00029%。微軾要靠這個數字,終結人工智慧史上規模最大的版權訴訟。

這份文件是 In re: OpenAI, Inc. Copyright Infringement Litigation 多區域合併訴訟中的即決判決(summary judgment)聲請。案件由 Stein 法官主持,集結了美國作家公會(Authors Guild)、多位具名小說與非虛構作家、《紐約時報》公司,以及調查報導中心(CIR)的請求權。微軟同時還提交了針對新聞媒體原告的平行即決判決聲請,以及針對輔助侵權請求權的答辯階段判決聲請。這是本案開打以來微軟最激進的法律行動,也可能是 AI 實驗室與內容擁有者之間全面戰爭中,迄今最重要的一份單一文件。

日誌分析究竟發現了什麼

聲請書的核心,是對 Copilot 真實世界行為的鑑識稽核,由原告自己的專家 Dr. Shawn Shan 執行。有兩組數據值得注意。

對抗式實驗室測試。 Shan 進行了約 530 萬次蓄意抽取嘗試——把長達數百字的書籍原文逐字餵給 GPT 模型,反覆提示直到模型吐出相符文字。即使在這種對抗式協定下,能產生任何 30 字相符的嘗試也不到 1%。微軟的形容是:這是對原告最有利的情境——研究者手上已經有書、鎖定已知段落、一次又一次嘗試逼模型重現原文,結果絕大多數都失敗。

正式環境日誌。 在實驗室之外,Shan 檢視了 820 萬筆真實的 Copilot 對話,找出那 24 筆相符回應。在原告主張的 212 本書中,有 202 本在日誌裡完全找不到任何重現。新聞端的數字略高,但故事相同:59,545 筆對話——不到 1%——與用於接地(grounding)模型的新聞內容共享至少 16 個單字,而 CIR 的專家僅找出 51 筆與 CIR 報導有實質重疊的實例。

這裡有一個關鍵但書,而微軟選擇主動揭露而非隱藏:這 820 萬筆日誌並非隨機抽樣,而是以原告網站相關關鍵字預先篩選過的——也就是說,這個資料集被刻意堆疊成最可能出現侵權內容的對話。即便在這種「做了手腳」的樣本裡,相符次數依然微乎其微。微軟律師團的盤算顯然是:自願交代抽樣偏誤,反而讓頭條數字更有說服力。

合理使用論證

這份聲請書的法律核心,是主張以受版權保護的書籍訓練大型語言模型,在法律上構成合理使用(fair use)。微軟稱這種使用「深刻地具有轉化性」(profoundly transformative),並援引兩件先前的 AI 訓練判決——一件對 Meta、一件對 Anthropic——法院在其中都以類似措辭描述 LLM 訓練。書是寫給人讀的;而 OpenAI 對約翰·葛里遜《The Street Lawyer》、Stacy Schiff《Cleopatra》等文本的使用,在聲請書的框架裡服務的是技術目的:打造一個能回應提示、生成自然語言的系統。

在最棘手的事實爭議上——OpenAI 从圖書館創(Library Genesis)這個盜版儲庫下載書籍——微軟劃出一條硬線:不容爭執的紀錄確立,微軟並未從 LibGen 下載,也未曾參與取得那些資料集;而且訓練資料的來源不改變合理使用分析,因為過程中每一步都服務於同一個訓練目的。微軟也處理了自身應 OpenAI 要求移轉部分 Bing 搜尋索引的爭議,坦承證據尚未有定論,但指出原告專家在移轉的部分索引中,也只能辨識出 8 到 24 本原告主張的作品。

在市場損害——合理使用的第四個傳統因素——上,微軟採取攻勢。它引用原告自己的銷售證據,指出即使 ChatGPT 和 Copilot 從未問世,書的銷量也一樣;引用劇作家 David Henry Hwang 的話,說他不認為被告的 LLM 傷害了他的劇本市場;並援引研究指出,絕大多數消費者即使面對價格大幅降低的 AI 生成書籍也不會購買。聲請書警告:若要求訓練資料必須取得授權,開發者將被迫向數百萬作者逐一清除權利——一道只有最大型企业才爬得過的合規高牆。

原告的反駁,可以預想

《紐約時報》首席律師 Ian Crosby 已直接否定這套框架:探索程序已經確立,微軟與 OpenAI「打造了設計來替代時報新聞、與其業務直接競爭的商業產品」。原告的理論向來是:原始的重現次數低估了傷害——即使全文從未逐字出現,大規模的部分替代仍會吸走讀者、導流與廣告收入,而這些報導正是訓練資料的來源。

反駁論點不言自明。16 個相符單字作為重疊門檻偏低,作為替代證明卻偏高;而且原告會主張,以關鍵字篩選過的探索樣本,對數十億筆從未觸及原告關鍵字的 Copilot 查詢的重現率毫無說服力。一個用不同文字摘要時報調查報導的聊天機器人,依然可能取代使用者點進 nytimes.com 的那一下。這是市場損害論證,不是重現論證——而它正是微軟要求法官親手埋葬的理論。

政治背景同樣無法忽視。幾天前,川普政府的司法部提交了利益聲明書(statement of interest),敦促法官做出有利於 OpenAI 與微軟的裁決,主張以新聞內容訓練 AI 並不違反版權法。聯邦政府的分量,如今站在合理使用這一邊。

為什麼這份文件的重要性超越單一案件

無論 Stein 法官怎麼裁,這份聲請書的結構——一個探索資料集、一份相符字數分析、一個錨定在具體數字而非抽象模型行為宣稱上的合理使用論證——都會成為模板。Anthropic 今年稍早已在另一案中與作家公會和解;OpenAI 還面臨多家報業集團的平行訴訟。此處若獲即決判決,不會直接拘束那些案件,但會交付給每一名 AI 被告一套經過探索程序檢驗的劇本:測量輸出、證明比率趨近於零、主張轉化性目的。

反之,若聲請遭駁回,探索程序繼續,替代理論將交由陪審團檢驗——對 AI 被告而言風險高得多,畢竟涉案金額龐大,具名記者與作家描述自身作品遭遇的證詞極具情感分量。依據 Stein 法官 9 月 3 日簽署的密封令,答辯截止日為 2026 年 10 月 5 日,反對意見書須於 10 月 15 日前公開重新歸檔。

每一個推出檢索接地聊天機器人的實驗室都在看。這項裁決將決定未來多年在開放網路上接地模型的營運成本——而此刻,整個防線押在一個小到可以說出口的數字上:24。