Anthropic 為 Claude 所有文字輸出嵌入隱形浮水印
Anthropic 現在在全球範圍內,為每一段 Claude 生成的文字嵌入不可感知的密碼學浮水印,以符合 EU AI Act 第 50(2) 條的透明化要求。
AI 內容透明化的新時代
2026 年 8 月 11 日,Anthropic 宣布了 Claude 生成內容標記方式的根本性變革。自 2026 年 8 月 2 日起發布的所有 Claude 模型,現在都會在生成的文字中嵌入隱形密碼學浮水印——不是事後附加的元資料,而是直接編織進語言本身。這道浮水印能承受複製貼上、輕度編輯和格式變更,且對人類讀者完全不可見。
這不是區域性的開關。Anthropic 已在全球範圍內啟用浮水印功能,這意味著無論你是透過網頁介面、API、Claude Code、Cowork,還是透過 AWS Bedrock、Google Cloud Vertex AI 或 Microsoft Azure AI Foundry 等雲端合作夥伴使用 Claude,輸出內容都帶有隱藏訊號。此決策源自於公司對 EU AI Act 第 50(2) 條的承諾,該條款要求生成式 AI 系統的提供者必須確保其合成內容可被機器讀取的方式偵測到。
浮水印的運作原理
Anthropic 描述了兩種不同的內容標記機制,而這個區別非常重要:
文字浮水印。 當 Claude 模型生成文字時,它會在統計上合理的下一個 token 之間進行選擇,選擇方式本身編碼了一組密碼學訊號。這個訊號分散在整段文字中,而非集中在特定片語或字元上。這意味著不存在單一的「魔法字詞」或隱藏字元序列可以讓人找到並移除。Anthropic 表示,浮水印能「承受複製貼上」,且「即使你修改或調整文字」仍然具有韌性——包括輕度校對、重新格式化或重組句子。然而,大量的改寫、翻譯或透過另一個模型摘要,可能會讓訊號衰減到無法恢復的程度。
C2PA 來源元資料。 對於生成的檔案——特別是 SVG、PNG 和 JPG 格式的圖片——Claude 會附加經過數位簽章的 C2PA(內容來源與真實性聯盟)來源元資料。這些元資料記錄了內容的來源、生成模型、時間戳和密碼學簽章。與文字浮水印不同,C2PA 元資料存在於檔案標頭中,可以被懂技術的人移除。但如果完好無損,它提供了從生成到消費的可驗證監管鏈。
兩種方法是互補的:文字浮水印嵌入內容本身,因此更難移除;而 C2PA 元資料細節更豐富但更脆弱。兩者共同構成了 Anthropic 稱之為分層透明化的系統。
EU AI Act 的關聯
此次推出的催化劑是 EU AI Act 第 50(2) 條,該條款已於 2026 年 8 月 2 日生效,作為該法案分階段執行計畫的一部分。這項條款要求生成合成內容(文字、圖片、音訊或影片)的 AI 系統提供者,確保其輸出以機器可讀的方式標記,且可被偵測為人工生成。目標是為下游平台、事實查核人員和執法機關提供識別 AI 產製內容的工具,特別是在虛假資訊和深度偽造的脈絡下。
Anthropic 已正式簽署EU AI Act AI 生成內容透明化實務準則,這是由歐盟委員會與產業利害關係人協商制定的自願性框架。透過簽署,Anthropic 承諾在所有 Claude 輸出中實施機器可讀標記——而且關鍵是,將其擴展到全球,而非僅限於歐盟用戶。這種全球性的做法避免了 AI 內容在某些地區被標記但在其他地區未被標記的碎片化問題,那種情況會破壞偵測工作的效果。
其他主要 AI 公司也在因應同樣的要求。Google 以其開源的 SynthID 技術開創了文字浮水印的先河,並一直在 Gemini 模型中擴大應用。在 2026 年 Google I/O 大會上,該公司宣布 OpenAI、NVIDIA 等公司正在採用 SynthID,這可能成為事實上的產業標準。Anthropic 的方法似乎獨立於 SynthID,使用自己的密碼學浮水印方案,不過該公司尚未公布演算法的技術細節。
實際層面的影響
對於 Claude 的一般使用者來說,這項變更是不可見的。你不會注意到回覆的品質、速度或風格有任何差異。浮水印不會改變含義、可讀性或格式。它在 token 選擇的統計層面運作,而非內容層面。
對於企業和開發者而言,影響更為顯著。任何將 Claude 輸出導入面向客戶內容的應用程式——行銷文案、聊天機器人、自動化報告——現在都會產出帶有浮水印的文字。擔心 AI 生成內容觀感的組織可能需要更新其揭露政策。浮水印還創造了一梡取證軌跡:如果 Claude 輸出出現在否認使用 AI 的情境中,浮水印可以作為證據。
對於平台和內容審核人員,浮水印開啟了新的偵測通道。社群媒體平台、學術誠信服務和新聞查核工具可以建立掃描 Claude 浮水印的偵測器。然而,Anthropic 尚未發布公開的偵測 API 或工具,且該公司指出偵測準確度取決於文字在生成後被修改的程度。
限制與誠實的警示
Anthropic 在浮水印不能做到的事情上,表現得令人耳目一新的坦誠:
- 無法承受大量改寫。 如果有人拿 Claude 的輸出進行實質性的重寫——或者透過另一個 AI 模型來改寫——浮水印訊號會衰減,最終變得無法偵測。
- 無法證明作者身份。 偵測到的浮水印確認 Claude 在某個時間點處理或生成了該文字,但無法區分 Claude 撰寫原始內容、Claude 編輯人類文字,還是 Claude 校對現有資料。
- 偵測工具尚未公開。 在沒有廣泛可用的偵測器的情況下,浮水印的實用性在短期內受到限制。Anthropic 已表示偵測能力將逐步提供給授權合作夥伴。
- 程式碼格式可能造成干擾。 專家指出某些轉換——重新格式化程式碼、去除空白字元,或在 Markdown 與純文字之間轉換——可能削弱浮水印的統計特徵。
更宏觀的圖像
Anthropic 的浮水印倡議出台於 AI 產業面臨巨大壓力之際,必須應對合成內容的擴散。深度偽造、AI 生成的虛假資訊以及數位媒體信任的侵蝕,已使內容來源成為多個司法管轄區的政策優先事項。EU AI Act 是第一個強制要求標記合成內容的主要法規,但英國、韓國和美國數個州也在考慮類似的要求。
產業在浮水印技術上的趨同——透過 SynthID、Anthropic 的系統以及 C2PA 等新興標準——表明隱形內容標記將成為所有生成式 AI 系統的基本期望。真正的考驗將在於這些浮水印能否在現實世界濫用的對抗環境中存活,畢竟惡意行為者有強烈的動機去移除或規避它們。
目前為止,Anthropic 已在產業中佔據了最積極的透明化立場之一。Claude 寫下的每一個字現在都帶有隱藏的簽章——這是 AI 與其所創造內容之間關係的一個安靜但深遠的變革。
Sources
- [1] https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
- [2] https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/
- [3] https://www.theverge.com/ai-artificial-intelligence/977823/anthropic-claude-ai-watermarks-c2pa-text-images
- [4] https://thenextweb.com/news/anthropic-watermarks-claude-output-eu-ai-act-article-50
- [5] https://www.forbes.com/sites/anishasircar/2026/08/13/claude-will-now-leave-a-watermark-on-everything-it-writes-what-does-that-mean/