Anthropic 在所有 Claude 文字輸出嵌入隱形浮水印,以符合 EU AI 法案
自 2026 年 8 月 2 日起,所有新版 Claude 模型都會在生成的文字中織入無法察覺的浮水印,並為檔案附加 C2PA 簽署的來源資料——而且是全球適用,不限於歐盟。
Anthropic 悄悄推出了迄今最具影響力的 AI 透明度措施之一:自 2026 年 8 月 2 日起,每個新版 Claude 模型都會在生成的文字中嵌入一個隱形、機器可讀的浮水印。這個浮水印是全球適用的——不僅限於歐盟——同時還為 Claude 產生的檔案附加了經過密碼學簽署的來源詮釋資料。此舉是該公司因應 EU AI 法案透明度義務所踏出的最具體一步,也為整個產業標記 AI 內容的方式樹立了可能改寫格局的先例。
浮水印實際上做什麼
根據 Anthropic 自己的說明文件,這套系統依賴兩個互補機制。第一個是嵌入式文字浮水印:當支援的 Claude 模型生成文字時,它會「將無法察覺的浮水印直接織入文字本身」,而不改變輸出的意義、語氣或可讀性。由於這個訊號是文字的一部分——而非疊加在上方的詮釋資料——它會跟著內容到任何地方。把一段 Claude 文字複製到 Word 文件、部落格文章或社群媒體貼文中,浮水印也會跟著一起過去。
第二個機制是 C2PA 簽署來源詮釋資料。當 Claude 生成支援的檔案類型(如 .svg、.png 或 .jpg)時,它會附加符合「內容來源與真實性聯盟」(C2PA)標準的數位簽署詮釋資料。這是由 Adobe、Microsoft、BBC 等機構支持的開放框架,使用密碼學簽章來斷言媒體的來源和編輯歷史。與文字浮水印不同,檔案來源詮釋資料可能在檔案重新編碼或經過某些處理工具時被移除,但它為合規平台提供了穩健且基於標準的認證。
這兩層機制共同涵蓋了最常見的輸出模式(文字)和次常見的模式(圖像與向量圖形),讓 Anthropic 在內容歸因方面採取了縱深防禦策略。
設計目標是留存——但有限度
Anthropic 對限制非常坦誠。在說明文件和對媒體的聲明中,該公司承認文字浮水印設計上能夠承受基本的複製、貼上和輕度編輯。然而,大幅編輯、改寫、翻譯,或將 Claude 的輸出與人類撰寫的文字混合,都可能使浮水印無法被偵測。這是一個誠實的評估:沒有任何大規模部署的文字浮水印被證明能抵抗蓄意的對抗性修改,Anthropic 也沒有做出相反的宣稱。
至關重要的是,浮水印的存在並不自動證明整份文件都是由 Claude 撰寫的。使用者可能將一句 Claude 生成的句子貼入一篇較長的人工文章中,而那個片段可能帶有標記。Anthropic 的指引很清楚:浮水印表示「存在部分」AI 生成的內容,而非周圍的上下文都是機器撰寫的。這個區別對於學術誠信、新聞業和法律程序等情境極為重要,因為偽陽性可能帶來嚴重後果。
為什麼是現在:EU AI 法案推動全球變革
時間點並非巧合。EU AI 法案的透明度條款——要求通用 AI 系統的提供者以機器可讀的方式標記機器生成的輸出——在 2026 年進入了關鍵的合規階段。Anthropic 確認,2026 年 8 月 2 日或之後在歐盟推出的 Claude 模型將在推出時支援機器可讀標記。但該公司走得更遠:與其打造一個地區限定的功能,Anthropic 決定在Claude 提供服務的所有市場一律套用浮水印。
這種全球性的做法避免了為不同司法管轄區維護不同模型行為的複雜性,也展現了對透明度功能將成為基本要求而非監管負擔的信心。這同時也對 OpenAI、Google 和 Meta 施加了競爭壓力——這三家公司都還沒有部署同等規模的文字浮水印。Meta 的 Muse 模型和 Google 的 Gemini 已經在圖像層面實驗來源標記(SynthID、C2PA 詮釋資料),但持久的文字浮水印在生產系統中仍然罕見。
隱私與偽陽性疑慮
並非所有人都樂見其成。隱私倡導者提出了疑問:當使用者依賴 Claude 撰寫敏感、個人化或專業性內容——心理治療日記、法律草稿、機密商業通訊——時會發生什麼事。浮水印在使用者編輯輸出後仍然留存,這意味著 AI 輔助產生的文字在當事人希望匿名的情境下可能被辨識出來。Anthropic 目前尚未為個人使用者提供退出機制,不過企業 API 客戶可能有不同的合約條款。
此外還有統計偽陽性的問題。任何作用於文字的浮水印方案都必須在可偵測性與標記到純人工內容的風險之間取得平衡。如果浮水印太激進,可能會誤標無辜的文字;如果太微妙,對手就能移除它。Anthropic 尚未公開其演算法的技術細節,使得獨立評估變得困難——這是學術研究者已經指出的缺口。
更宏觀的圖像
Anthropic 的浮水印部署是 AI 透明度的里程碑時刻。這是大型前沿實驗室首次在全球規模上部署持久的文字層級來源標記,而它出現的時機正值全球監管機構——不僅是布魯塞爾,還包括英國、加州及其他地區——正在起草類似的透明度法規。競爭對手會在幾週還是幾個月內跟進尚有待觀察,但先例已經確立:AI 生成的文字可以攜帶其來源,而使用者、平台和監管機構將越來越期待如此。
目前的開放性問題在於:浮水印在對抗情境中是否足夠穩健、Anthropic 是否會允許獨立審計,以及使用者是否會接受他們的 AI 輔助寫作現在留下了永久的隱形痕跡。至少目前為止,Claude 的輸出是業界中最透明的——即使技術保證仍不完美,這仍然是意義重大的一步。
Sources
- [1] https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
- [2] https://www.theverge.com/ai-artificial-intelligence/977823/anthropic-claude-ai-watermarks-c2pa-text-images
- [3] https://www.theregister.com/ai-and-ml/2026/08/11/anthropic-pledges-to-embed-watermarks-to-help-discern-ai-slop-in-sop-to-eu/5285792
- [4] https://interestingengineering.com/ai-robotics/anthropic-claude-text-invisible-watermarks
- [5] https://www.business-standard.com/technology/tech-news/claude-invisible-watermark-ai-generated-text-how-it-works-126081100381_1.html