Claude 開始在文字裡留下看不見的浮水印:解析 Anthropic 的 SynthID 技術實作
Anthropic 最新 Claude 模型已在每個生成的文字中嵌入無法察覺的 SynthID 浮水印——本文解析金鑰驅動機制的運作原理、它能證明與不能證明的事,以及為何全球同步上線。
從現在起,新版 Claude 模型寫下的每一個字,都帶著一個讀者永遠看不見的簽章。2026 年 8 月 14 日,Anthropic 發布了一篇詳細的技術說明,證實其最新模型會在生成文字中直接織入一種隱形、機器可讀的浮水印——這項改變隨著歐盟 AI 法案(EU AI Act)的透明化義務於 8 月 2 日生效而落地。這讓 Anthropic 成為最先將文字浮水印大規模上線的主要業者之一,而此舉正好落在全球激辯「如何管制 AI 生成內容、又不摧毀開放網際網路」的風口上。
到底改了什麼
自 8 月 2 日的合規期限起,在歐洲市場提供服務的 AI 業者,必須依據《歐盟 AI 法案》第 50 條標記機器生成的內容。Anthropic 連同其他幾家主要模型開發商、總計約 190 個簽署方,已在 2026 年 7 月簽署《AI 生成內容透明化實務守則》(Code of Practice on Transparency of AI-Generated Content)。守則要求業者採用能讓合成文字「事後可識別」的標記方法。
Anthropic 的答案,是一種直接嵌入文字本體的密碼學浮水印。該公司明確列出六項設計特性:
- 對可讀性零影響。 有浮水印與沒有浮水印的文字,對讀者完全無法區分。沒有添加任何東西,也沒有隱藏字元或零寬度字元的把戲。
- 不犧牲品質。 內部測試顯示,浮水印對內容、創意程度與可讀性皆無可測得的影響。
- 不增加成本。 這套機制不產生額外 token,模型的服務成本與速度幾乎完全不變。
- 不洩漏身分。 浮水印不含任何可回溯到個人、組織或特定對話的資訊。
- 本質上不專屬於 Claude。 這是業界共通的技術路線;其他簽署守則的業者將部署自己的金鑰與變體。
- 上線即全球生效。 Anthropic 承認,因為目前沒有耐用的方式按地區限縮標記範圍,所以一次套用到全球——這個細節已在歐洲以外引發關注。
浮水印實際上如何運作
這項技術是 SynthID-Text 的版本,即 Google DeepMind 於 2024 年 10 月在《Nature》論文中發表的方案。它屬於可追溯到密碼學家 Scott Aaronson 2022 年提案的一系列方法,而它們共用一個優雅的設計原則:浮水印只改變隨機性的來源,不改變模型本來會考慮的字詞。
大型語言模型一次生成一個字。每一步,模型都會對候選下一個詞排序。有時候多個候選詞實質上可以互換——在「今天天氣又冷又……」之後,接「陰沉」或「灰暗」都不改變語意。平常,這個選擇由亂數產生器決定;浮水印則把任意 RNG 換成帶金鑰的偽隨機來源:由金鑰加上前面幾個字,共同決定選哪個詞。
結果讀起來跟正常文字一模一樣——有時選「陰沉」、有時選「灰暗」,跟以前沒有兩樣。但持有金鑰的人可以掃描一連串選擇,計算這段文字與 Claude 金鑰流程一致的統計機率。Anthropic 自己的比喻是大富翁遊戲:把擲骰換成從隨機起點開始、依序讀取圓周率 π 的位數。對玩家來說,移動步數看起來仍然隨機;但對知道 π 的人來說,整場遊戲的移動紀錄會暴露其來源。
至關重要的是,浮水印永遠不會把 Claude 推向它原本就不會考慮的詞。它不會讓模型選上「靄靄」這種冷僻的同義詞——因為這個微調只作用在真正可互換的選項之間。
浮水印住在哪裡——又會在哪裡消失
這次公告最難得的一點,是對自身限制的坦白:
- 事實性文字標記稀疏。 在「牛頓最有名的著作叫《原理》……」之後,只有一個正確的下一個詞。沒有選擇空間,浮水印就無從作用。
- 程式碼標記很少。 必須精確的程式碼幾乎不帶浮水印;註解中的任意措辭可以被標記,但對程式本身影響微乎其微。
- 輕度潤稿偵測不到。 如果 Claude 只校對人類寫的文字,少數被修改的字可能不足以累積可偵測的訊號。
- 短樣本效果弱。 文章越長,帶金鑰的選擇越多,偵測信心越高。
- 改寫能消除它。 輕度編輯未必能完全去除浮水印;但每個字都換掉就能。Anthropic 的說法是:到那種程度,這段文字恐怕也稱不上是 AI 生成的了。
- 證明的是參與,不是著作權。 偵測為陽性,無法區分「Claude 寫的」和「Claude 大幅改寫的」,對所有權或法律責任也沒有任何說明。它也無法識別其他業者的文字——各家使用不同金鑰,甚至可能採用完全不同的方案。
至於檔案,Claude 走另一條路:PNG、JPG、SVG 等支援格式現在會附加 C2PA 內容憑證——一段以密碼學簽署的中繼資料,註明該檔案由 Claude 製作或處理。與浮水印不同,這不是嵌進像素裡的,而是任何支援 C2PA 的工具都能讀取的開放業界標準。
Anthropic 表示,浮水印偵測 API 正在籌備中,實作細節仍在敲定。8 月 2 日之前發表的舊 Claude 模型適用法律的過渡期,將在「未來幾個月」陸續加入浮水印。
為什麼這件事重要
這次上線,是 Aaronson 式密碼學浮水印第一次在旗艦級消費產品上接受實戰考驗,而利害關係有三個層次。
對監管者,這是第 50 條的概念驗證:AI 法案的透明化制度確實可以在每一段落貼上可見標籤之外運作。對業界,這樹立了協調先例——190 個簽署方承諾採用精神上可互通的標記,而 Google 的 SynthID 血統早已存在 Gemini 之中。對使用者,這第一次劃出了溯源(誰/什麼做了這個)與偵測(從風格特徵猜測)的清晰界線。Anthropic 明確將金鑰浮水印與 Pangram 這類統計偵測器對比——後者靠抓 AI 的措辭習慣,例如模型偏愛「這不是 X,而是 Y」句構,以及出現率異常高的「悄悄」一詞。
未決的問題同樣重大。安全研究人員指出,金鑰浮水印撐得過複製貼上,卻擋不住刻意的改寫;Google 自家的 SynthID 過去就曾被開發者破解。全球同步上線意味著非歐盟使用者也在一部自己沒有發言權的歐洲法律下收到帶浮水印的輸出——這是「布魯塞爾效應」摩擦的預演。而偵測 API 的開放模式至關重要:它是向平台全面開放、限於審核方,還是被法院要求交出?答案將決定浮水印會成為真正的透明化基礎建設,還是換個名字的監控工具。
可以確定的是:無法驗證來源的 AI 文字時代正在結束——一次一個被統計加權的同義詞。
Sources
- [1] https://www.anthropic.com/news/claude-text-watermark
- [2] https://www.nature.com/articles/s41586-024-08025-4
- [3] https://digital-strategy.ec.europa.eu/en/policies/code-practice-ai-generated-content
- [4] https://www.cooley.com/news/insight/2026/2026-08-03-eu-ai-act-transparency-obligations-take-effect-2-august-2026
- [5] https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/