← All posts / Policy

Claude 開始在文字裡寫下看不見的浮水印——SynthID 式機制的真實原理

Anthropic 為符合歐盟 AI 法案,在全球範圍為所有 Claude 生成的文字嵌入無形浮水印——技術源自 Google DeepMind,彎曲的是隨機性而非文字本身。

Claude 開始在文字裡寫下看不見的浮水印——SynthID 式機制的真實原理

Claude 寫下的每一個字,現在都帶著一個你永遠看不見的簽名。2026 年 8 月,Anthropic 開始為 8 月 2 日之後推出的 Claude 模型所生成的所有文字,嵌入隱形、可機器讀取的浮水印——而且在一個影響遠超歐洲的決定中,這套標記機制是全球適用,而非僅限歐盟用戶。

這讓 Anthropic 成為最先將歐盟 AI 法案透明度要求落實到文字層面的前沿實驗室之一,與約 190 家簽署歐盟《AI 生成內容透明度執業準則》(Code of Practice on Transparency of AI-Generated Content)的機構同行。但更有意思的故事在技術面:你要怎麼為「語言本身」加上浮水印,卻不改變語言所說的內容?

法律觸發點:第 50 條第 2 項

自 2026 年 8 月 2 日起,服務歐盟市場的 AI 供應商必須以機器可讀格式標記 AI 生成內容。歐盟 AI 法案第 50(2) 條——其透明度執業準則於 2026 年 7 月簽署——要求生成合成文字、圖像、音訊或視訊的系統供應商,確保輸出內容可被標記與偵測。

嚴格來說,Anthropic 的義務比 Google 窄,因為 Claude 並不原生生成音訊或視訊。但在文字這個 Claude 主導編程與企業工作流程的模態上,公司選擇全面投入:標記範圍涵蓋 Claude Platform API、Claude 聊天介面、Claude Code、Claude Cowork 與 Claude Tag,所有支援的介面、所有地區一律適用。

關鍵的是,這也包括經由雲端夥伴——AWS、Google Cloud、Microsoft Foundry——提供的輸出。只要字是支援的 Claude 模型寫的,浮水印就在文字裡。

浮水印原理:動手腳的是骰子,不是文字

Anthropic 在 8 月 14 日發布的說明出人意料地具體。大型語言模型逐 token 生成文字,每次從候選下一詞清單中挑選。很多時候,多個候選詞基本上可以互換——給定「今天天氣很冷而且……」,下一個詞是「陰天」或「灰濛濛」都不改變語意。正常運作下,這個選擇由一個隨機數決定。

浮水印改變的,只是隨機性的來源。

模型不再用任意的隨機數產生器在「陰天」與「灰濛濛」之間做選擇,而是用一把密碼學金鑰加上前文來決定。從讀者角度來看,選詞仍然是隨機的——但持有金鑰的人可以掃描一段文字,計算這串選擇與 Claude 在該金鑰下會做出的選擇一致的機率。這個模式是統計性的,不是字面上的:模型不會永遠偏向「陰天」;哪個詞勝出取決於前文。

Anthropic 對這方法「不是什麼」說得很明白。文字裡沒有添加任何東西。沒有隱藏字元、沒有零寬度隱寫術、沒有看不見的 Unicode 技巧。浮水印不產生額外 token,因此服務成本不變、模型速度不受影響。而且它不含任何識別資訊——浮水印或金鑰中沒有任何東西能回溯到特定個人、組織或對話。

其技術系譜值得注意。Claude 的浮水印是 SynthID-Text 的一個版本——Google DeepMind 於 2024 年發表在《Nature》的技術,而它又可追溯到 Scott Aaronson 在 2022 年提出的浮水印提案。這一族方法共用同一個設計原則:浮水印只改變隨機性來源,永不改變文字語意。DeepMind 曾在實際環境驗證:向一部分 Gemini 流量提供帶浮水印的輸出,發現用戶按讚/倒讚的比率與無浮水印模型相比沒有統計上的顯著差異。人類評審並排比較帶浮水印與不帶浮水印的回答,也看不出品質差異。

浮水印在哪裡變淡

Anthropic 對這套機制限制的坦白程度罕見——而這正是任何想把偵測整合進工作流程的人需要務實面對的地方。

短文字很難偵測。 偵測是統計性的;一段文字越短,選詞越少、訊號越弱。判斷 Claude 是否參與寫作的信心,隨長度增加。

事實性段落標記稀疏。 當只有一個正確答案時——「牛頓最著名的著作叫《原理》……」之後的下一個詞只能是 “Mathematica”——浮水印無從施力。嚴謹的技術或事實性寫作,訊號因此比創意文體薄弱。

校對幾乎偵測不到。 如果 Claude 只是輕度編修人類的文字,幾乎所有字都是原作者的。浮水印只存在於 Claude 的修改處,而少數幾處文法修正可能根本不足以被偵測。

程式碼是最弱的環節。 必須精確的程式碼——換一個 token 就會壞掉——根本不會被施加浮水印。標記主要存活在程式碼註解、變數命名這類「兩者皆可」的任意選擇中。想用這套機制偵測 AI 寫的程式碼?現實的覆蓋率頂多是部分的。

還有一條界線:浮水印只能回答「這段文字由 Claude 部分撰寫的機率是多少?」它無法確認文字是人寫的,也無法將文字歸因於另一個 AI——即使是另一個有浮水印的模型,因為那會用不同的金鑰,甚至完全不同的方法。

檔案拿到的是密碼學出處證明,不只是統計模式

文字只是標記系統的一半。當 Claude 生成支援的檔案類型——.svg、.png、.jpg——現在會附上遵循 C2PA 開放標準的簽署出處中介資料(與業界通用的內容出處與真實性聯盟規格相同)。簽署標籤代表該檔案經過 Claude 處理,並讓驗證者能偵測事後竄改。

兩套機制互補:文字浮水印跟著複製貼上的文字走,C2PA 中介資料則以密碼學方式錨定檔案。單獨使用都不是萬無一失;合起來才涵蓋 Claude 輸出在真實工作流程中的兩大形態。

布魯塞爾效應,出貨一次搞定

法律上,第 50(2) 條只約束在歐盟境內使用的系統。沒有任何法條強迫 Anthropic 為新加坡或聖保羅的用戶標記輸出。但它照做不誤,而理由坦白得近乎操作層面:公司表示目前還沒有可靠的方式按地區限定浮水印,於是選擇一次出貨、全球統一。

結果就是教科書級的布魯塞爾效應。為單一市場寫下的透明度規則,成為 Claude 輸出的事實上的全球標準——因為合規一次,比維護兩套程式路徑、建置地區感知偵測系統便宜。每一位 Claude 用戶、每個地方,現在都受一套歐盟啟發的透明度機制約束——無論自身司法管轄區有沒有對應規則。

但也存在反向考量。Anthropic 強調浮水印不含用戶識別資訊、無法追溯到個人或對話。但隨著偵測工具陸續推出——Anthropic 說將依法支援第三方偵測——實際問題變成:誰持有金鑰?在什麼程序下查驗標記?換個角度看,透明度基礎設施也是監控基礎設施。

接下來看什麼

三件事值得觀察:

  1. 舊模型補標。 法案為 8 月 2 日前推出的模型設有過渡期,Anthropic 表示正在為它們加入標記。留意 7 月 24 日推出的 Claude Opus 5 何時、以多快速度被補上標記。
  2. 偵測管道。 Anthropic 承諾將發布文件,讓用戶與第三方得以偵測 Claude 的標記。這個管道的形態——公開偵測器?API?審核過的合作夥伴?——將決定這是真透明,還是合規表演。
  3. 另外 189 家簽署者。 Anthropic 是早到者,不是孤行者。隨著其他準則簽署者推出各自的浮水印(Google 的 SynthID 已涵蓋文字、照片、音訊與視訊),互通性成為下一個戰場:一個互不相容、各自帶金鑰的浮水印世界比沒有好,但離 AI 法案立法者想像的無縫出處層還很遠。

此刻,一座安靜的里程碑已立起:全球使用最廣的寫作模型之一,現在能用統計方法證明自己的手筆。文字沒變。變的是骰子——它被動了手腳。