← All posts / Policy

Anthropic 揭露 Claude 隱形文字浮水印的運作原理

Anthropic 詳細說明了正在全球 Claude 模型中部署的統計浮水印技術,以符合 8 月 2 日生效的 EU AI Act 第 50 條透明度規範。

Anthropic 揭露 Claude 隱形文字浮水印的運作原理

2026 年 8 月 14 日,Anthropic 發布了一篇詳細的技術說明,解釋 Claude 模型中的文字浮水印究竟如何運作。自從該公司證實將在全球範圍內為 Claude 的所有輸出加上隱形標記以來,業界對此眾說紛紜,這份文件正面回答了其中的核心疑問。這項改變並非出自產品策略,而是源自 EU AI Act——其第 50 條透明度義務已於 2026 年 8 月 2 日正式生效。

這是商業 AI 系統運作方式中最重大的低調變革之一:新版 Claude 模型生成的每一個字,現在都帶有統計嵌入、機器可讀的簽章,持有正確金鑰的第三方可以驗證。而且 Anthropic 並非孤軍——它是 2026 年 7 月簽署歐盟《AI 生成內容透明度執業準則》(Code of Practice on Transparency of AI-Generated Content)的約 190 個簽署方之一,其他幾家主要模型供應商也正在實作各自的浮水印方案。

為什麼是現在

EU AI Act 第 50 條課予兩項核心透明度義務。生成式 AI 系統的供應商必須確保其輸出以機器可讀的方式標記;部署與人類互動或生成操弄性內容的 AI 之業者,則必須揭露該互動。2026 年 8 月 2 日之後,服務歐盟市場卻未標記 AI 生成內容的供應商,最高可處 2,000 萬歐元或全球年營業額 4% 的罰款。

Anthropic 選擇全球適用浮水印,而非僅針對歐盟用戶。該公司給出的理由很務實:目前還沒有可靠的方法能按地區限定浮水印範圍,因此先全面推出,之後再評估區域性做法。這種「EU 合規、全球交付」的模式,意味著一部布魯塞爾的法規實際上為全球每一個角落的用戶設定了世界上最多人使用的 AI 助手之一的預設行為。

浮水印的實際運作原理

這項技術是 SynthID-Text 的一个版本——Google DeepMind 於 2024 年發表在《Nature》論文中的方法,其源頭可追溯至電腦科學家 Scott Aaronson 在 2022 年提出的構想。設計原理相當精妙:浮水印不會在文字中「添加」任何東西。沒有隱藏字元、沒有看不見的 Unicode 技巧、沒有額外 token,也不會增加成本。

大型語言模型一次生成一個字,從候選下一字清單中做選擇。很多時候,多個候選字基本上同樣合適——在「The weather today was cold and…」這個句子中,下一個字接 “overcast” 或 “grey” 在語意上幾乎沒有差別。正常運作下,這種選擇由隨機數決定。

浮水印改變的是隨機性的來源。原本用任意隨機數產生器,現在改用一把密碼學金鑰加上前面幾個字,來決定同義候選字之間的取捨。選出來的字看起來仍然隨機,但持有金鑰的人可以掃描一段文字,檢查一連串低風險選字的模式是否與金鑰推導的決策一致,進而計算出 Claude 參與寫作這段文字的機率。

Anthropic 提供了一個好記的比喻:想像玩大富翁時,移動步數不由擲骰決定,而是從圓周率 π 的數字序列中隨機選定起點,依序讀取後續數字。對玩家而言,這些移動與擲骰毫無分別。但能看到完整移動紀錄又知道 π 的人,就能判定這局遊戲用了 π 作為隨機來源。這局遊戲,某種意義上,就是「浮水印」。

至關重要的是,這個方法不會讓 Claude 偏向特定詞彙——第一句可能選 “overcast”,下一句可能選 “grey”——而且絕不會迫使模型選擇它本來就不會考慮的字(例如它不會讓 Claude 使用 “nubilous” 這個 “overcast” 的冷僻同義詞)。內部測試顯示,浮水印對內容、創意或可讀性沒有任何影響;Google DeepMind 自己在部分 Gemini 流量上部署 SynthID-Text 時,比較用戶的讚/倒讚評分,也發現有無浮水印的回應在統計上沒有顯著差異。

能做什麼、不能做什麼

這份說明對限制毫不諱言:

  • 只回答一個問題:「這段文字有多少可能是 Claude 部分撰寫的?」它無法確認文字是人寫的,也無法辨識其他 AI 生成的文字——每家供應商用自己的金鑰,方法也可能不同。
  • 短文字難以偵測。 選字越少、訊號越少;段落越長,信心越高。
  • 事實性段落浮水印較稀疏。 當下一個字只有一個正確答案時——「Isaac Newton’s most famous work was called Principia ___」——根本無從水印。校對、輕度編輯人類文字時可偵測的訊號也很少,因為幾乎所有字都是原作者的。
  • 程式碼的浮水印比散文少。 程式碼經常要求精確輸出;只有在存在任意選擇的地方(例如註解)才會套用。
  • 可以被移除。 輕度編輯可能無法完全去除浮水印,但每個字都替換的完全改寫可以——不過 Anthropic 認為,那種文字是否還能稱為 AI 生成都值得商榷。
  • 證明的是參與,不是作者身分。 偵測無法區分「Claude 寫的」和「Claude 大幅編輯的」,對所有權或法律責任也沒有任何說明。

浮水印也無法追溯到特定個人、組織或對話。Anthropic 表示,浮水印和金鑰中沒有任何能還原用戶資訊的東西。翻譯會帶浮水印,因為譯文的每個字都由模型選擇。8 月 2 日前推出的舊版 Claude 模型適用過渡期,未來幾個月會陸續加上浮水印。浮水印偵測 API 正在籌備中。

檔案採用不同機制:C2PA 憑證

對非文字輸出,Anthropic 使用另一套開放業界標準。當 Claude 產生支援的檔案類型(如 .png、.jpg 或 .svg)時,會在檔案 metadata 中附加內容憑證——一份以密碼學簽署的小型註記,聲明該檔案由 Claude 製作或處理。這就是 C2PA,與相機製造商和照片編輯軟體使用的來源標準相同。與文字浮水印不同,檔案本身沒有任何改變;任何支援 C2PA 的工具都能讀取,Anthropic 也將提供自己的驗證工具。

為什麼這與 AI 偵測軟體有本質差異

Anthropic 在密碼學浮水印與 Pangram 等商用 AI 偵測軟體之間劃出了清楚的界線。偵測器沒有金鑰,只能依賴風格特徵——例如 AI 模型特別偏愛「this isn’t X, it’s Y」句構,且過度使用 “quietly” 一詞。對怪癖做統計指紋辨識,與檢查選字是否符合金鑰模式,是截然不同且可靠性低得多的訊號。這個區別正是學界懷疑的核心:如《Nature》報導,研究人員仍不相信浮水印——或任何現行偵測方法——能有意義地遏止「AI 垃圾內容」(AI slop)氾濫,因為浮水印在編輯後容易衰減,且在各模型生態系中的覆蓋率终將是局部的。

更宏觀的視野

有三個影響值得觀察。第一,浮水印是機率性的,而金鑰持有者初期主要是供應商自己及其偵測 API——驗證權力至少在初期集中在被監管的這些公司手中。第二,約 190 個簽署方用不同金鑰與方法實作同一份執業準則,跨供應商偵測將是碎片化的;一段文字可能需要用多個偵測器各測一次。第三,全球推出確立了一個先例:EU 的透明度制度實際上就是全球預設值,這個動態與 GDPR 如出一轍。浮水印不改變 Claude 說什麼。但首次有這種規模的做法,為「這段文字是否有 AI 參與?」提供了數學上可驗證的答案——而這改變了 AI 生成網路的認識論。

對建立在 Claude 之上的開發者與企業,實際結論很簡單:價格、延遲、品質皆不變;輸出中沒有可識別用戶的資料;偵測 API 即將推出。對其他人而言,下次讀到一段流暢得可疑的文字,或許很快就有一個方法可以檢查 Claude 是否經手——前提是那段夠長、不太事實性、沒被大幅編輯,也沒被完全改寫。