← All posts / Policy

Anthropic 為 Claude 所有文字輸出嵌入隱形浮水印

Anthropic 現已將難以察覺的統計浮水印織入 Claude 生成的每一段文字,履行其對歐盟 AI 法案第 50 條透明度規則的承諾。

Anthropic 為 Claude 所有文字輸出嵌入隱形浮水印

2026 年 8 月 2 日起,Anthropic 悄然改寫了 AI 透明度的遊戲規則。凡是在該日期或之後推出的 Claude 模型,都會在生成的文字中嵌入一層隱形、機器可讀的浮水印。這套系統並非僅限於歐盟地區,而是全球部署,代表著 AI 產業迄今為止最具野心的密碼學文字浮水印量產應用。

Anthropic 於 2026 年 8 月 11 日正式宣布,公司已簽署歐盟《人工智慧法案》第 50 條第 2 項「AI 生成內容透明度實務守則」。但該公司的作法遠遠超越了單純的法規遵從:浮水印機制適用於全球所有 Claude 用戶,而非僅限歐盟用戶;同時透過互補的技術機制,涵蓋了文字輸出與檔案輸出兩大類型。

文字浮水印的運作原理

這項核心技術源自 2023 年馬里蘭大學 John Kirchenbauer、Jonas Geiping 與 Tom Goldstein 團隊提出的學術研究。其運作方式發生在 token 層級——也就是大型語言模型用來處理和生成文字的基本單位。

當 Claude 模型生成文字時,其取樣分佈會被微妙地偏向一組被稱為「綠色清單」(green list)的特定 token 子集。一把密碼學金鑰決定了哪些 token 屬於綠色清單,模型在選擇下一個詞之前,會對這些 token 的分數施加一個微小的正向偏移。這個偏移在分析足夠數量的 token 後可以從統計上被偵測到,但對人類讀者來說完全無法察覺。文字讀起來自然流暢、語意不變、品質不受影響。

關鍵在於,這個浮水印不是隱藏字串、後設資料標籤,也不是可以被找到然後刪除的隱形 Unicode 字元。它分散在整段文字的詞彙選擇統計分佈之中。這使得它對常見的規避手段——複製貼上、輕度編輯、翻譯——具有極高的韌性。配備對應密碼學金鑰的偵測演算法,可以分析一段文字,並以極高信心判斷它是否由帶浮水印的 Claude 模型所生成。

這種韌性相較於早期偵測方法有顯著優勢。傳統的 AI 文字偵測器依賴困惑度(perplexity)和突發性(burstiness)等表面特徵,已被證明不可靠且容易欺騙。Anthropic 的做法則是將來源資訊直接嵌入生成過程本身,讓偵測更準確、也更難被剝除。

檔案的 C2PA 標記:第二層防線

對於檔案類輸出——圖片、文件和其他非文字產物——Claude 採取了不同的方式。這些輸出會附加已簽署的 C2PA(內容來源與真實性聯盟)後設資料,其中包含經密碼學驗證的內容來源與編輯歷史資訊。C2PA 與 Adobe、Microsoft、Sony 和 BBC 用於內容憑證的是同一套標準。

這套雙層系統意味著,無論 Claude 產出的是一段文字還是一張生成的圖片,輸出都帶有可驗證的來源資訊。文字帶有統計浮水印;檔案帶有已簽署的後設資料。兩者服務同一個目標:讓下游環節能夠偵測 AI 生成的內容,而無需依賴可能被輕易移除的視覺標籤或免責聲明。

歐盟 AI 法案的關聯

推動這項部署的核心動力來自歐盟《人工智慧法案》,特別是第 50 條第 2 項,該條文要求 AI 生成的內容必須具備透明度。相關透明度義務已於 2026 年 8 月 2 日生效,要求特定 AI 系統的提供者和部署者確保其輸出具有機器可讀的標記。

Anthropic 簽署第 50 條第 2 項實務守則——一份由歐盟執委會與產業利害關係人共同制定的自願性框架,旨在將法案要求轉化為可操作的規範——正式確立了其承諾。該守則建議兩種做法:隱形浮水印與 C2PA 後設資料。Anthropic 兩者皆採用。

透過將浮水印全球部署,而非僅限於歐盟用戶的地理圍欄策略,Anthropic 迴避了區域特定合規所造成的碎片化問題。美國、亞洲以及世界各地的用戶都會收到相同的帶浮水印輸出。這簡化了 Anthropic 的部署工作,同時釋放出明確訊號:該公司押注 AI 內容來源追蹤將成為全球通用的期待,而非僅僅是歐洲的法律要求。

產業影響

Anthropic 是第一家在整條消費級產品線上部署量產規模文字浮水印的主要 AI 實驗室。OpenAI 曾進行浮水印研究的實驗——最著名的是開發了一款分類器,但後來因準確率問題而下架——至今尚未推出可媲美的系統。Google、Meta 和 xAI 也未宣布等同的文字浮水印承諾。

這在競爭格局中造成了分歧。開發者和企業在選擇 AI 供應商時,現在有了一個具體的來源追蹤功能可以評估。帶浮水印的模型提供了對新興法規的內建合規能力,以及偵測自身工作流程中 AI 生成內容的工具。對於擔憂 AI 生成的錯誤資訊、深度偽造或合成內容流入其管道的組織而言,一個能自我標識輸出的模型是重大的差異化優勢。

此舉也對競爭對手施加了壓力。隨著全球監管框架在透明度要求上逐漸趨同——歐盟 AI 法案、中國的深度合成規定、以及美國正在推動的立法——都指向同一方向,那些在浮水印部署上拖延的公司,將面臨在合規和信任兩方面雙雙落後的風險。

限制與未解問題

Anthropic 對浮水印能證明什麼、不能證明什麼保持透明。這個標記表示內容經過 Claude 處理——它並不能證明傳統意義上的「作者身分」。用戶可能將人類撰寫的文字貼入 Claude 進行編輯或摘要,即使原始內容是由人類創作,輸出仍會帶有浮水印。Anthropic 的文件明確將浮水印定位為來源訊號,而非真實性保證。

浮水印在實務上也有其限制。偵測需要存取密碼學金鑰和足夠的文字量——非常簡短的輸出可能不包含足夠的 token 供可靠偵測。此外,雖然浮水印對改寫具有韌性,但若由另一個 AI 模型或決心十足的人類進行足夠激進的重寫,有可能將訊號削弱至偵測閾值以下。

這些限制並不削弱系統的價值。它們只是釐清了系統的適用範圍:Claude 的浮水印是內容來源追蹤的強大、業界領先工具,而非解決所有合成內容問題的萬靈丹。

新的基準線

透過這次部署,Anthropic 為 AI 透明度樹立了新的基準線。現在的問題是,產業其餘業者是否會跟進。對於關注 AI 與資訊完整性交匯點的用戶、開發者和政策制定者來說,這項浮水印是邁向未來的具體一步——在那個未來,數位內容的來源預設即可驗證,而非在損害造成之後才事後補救。