← All posts / Policy

Anthropic 依《歐盟 AI 法案》開始為所有 Claude 生成文字嵌入浮水印

自 2026 年 8 月 2 日起,Claude 在歐盟推出的每個新模型都會在文字輸出中嵌入不可見的機器可讀浮水印,並在檔案上附加經過簽署的 C2PA 來源資料——一項影響遍及全球的合規之舉。

Anthropic 依《歐盟 AI 法案》開始為所有 Claude 生成文字嵌入浮水印

Anthropic 已悄悄跨過了一條所有主要 AI 實驗室覬覦多年的界線。自 2026 年 8 月 2 日起,在歐盟推出的每個新 Claude 模型都會將一種不可見、機器可讀的浮水印直接編織進它生成的文字中,並在產生的檔案上附加經過密碼學簽署的來源詮釋資料(provenance metadata)。該公司在 8 月 11 日確認了這項部署,並將其定位為對《歐盟 AI 法案》(EU AI Act)透明度義務的直接回應。

這不是試點計畫,不是可選的開關,而是對 Claude 在模型層級運作方式的結構性改變,其影響遠遠超出歐洲邊界。

8 月 2 日到底改變了什麼

機制分為兩部分。首先是文字浮水印:2026 年 8 月 2 日或之後推出的任何 Claude 模型,都會將 Anthropic 稱之為「不可感知浮水印」(imperceptible watermark)的訊號編織進其生成的文字中。該公司刻意對底層技術保持模糊,但浮水印是在生成過程中施加的,嵌入於選詞的統計模式中,而非附加為可見標記。關鍵的是,Anthropic 表示浮水印不會改變文字的含義——人類讀者看到的是普通散文,偵測系統看到的則是一個訊號。

其次是檔案來源標記:當 Claude 生成可下載的檔案——文件、圖片、程式碼成品——這些檔案現在會帶有 C2PA(內容來源與真實性聯盟,Coalition for Content Provenance and Authenticity)詮釋資料。C2PA 是與 Leica、Sony 等相機製造商及 Adobe 的 Content Credentials 系統所使用的同一套簽署清單標準(signed-manifest standard)。每份清單都透過密碼學斷言檔案的來源、建立工具及編輯鏈,全部以 Anthropic 控制的金鑰簽署。

由於兩項措施都在模型層級施加,無論輸出來自哪個 Claude 產品介面——消費端的 Claude.ai 聊天、Anthropic API,還是企業整合——浮水印都會存在。沒有任何客戶端開關可以停用它。

為什麼是現在:《歐盟 AI 法案》的壓力

時機並非巧合。《歐盟 AI 法案》針對通用型 AI 模型的透明化條款於 2026 年 8 月 2 日生效,要求提供者以機器可偵測的方式標記機器生成的內容。Anthropic 是第一家公開推出直接回應這項法律義務的浮水印系統的主要前沿實驗室,而不僅僅是承諾未來支援。

Anthropic 自家的說明中心文件明確指出了法規驅動因素:標記適用於「2026 年 8 月 2 日或之後在歐盟推出的 Claude 模型」。然而在實踐中,該公司向多家媒體證實,浮水印在全球範圍內施加於相同的模型版本。不存在所謂的「歐盟專用」模型變體。這意味著在東京的開發者、聖保羅的學生、紐約的記者,只要使用最新的 Claude 模型,都會收到帶有浮水印的輸出——即使法律上只有歐盟要求這麼做。

全球統一施行是一個刻意的策略選擇。建立並維護兩個模型變體——一個有浮水印、一個沒有——在營運上將極其複雜,且會造成明顯的合規漏洞。Anthropic 選擇了從此單一、統一標記的模型線。

浮水印能撐過什麼——以及什麼會破壞它

最關鍵的實際問題是耐久性。Anthropic 對此的限制展現了令人耳目一新的誠實。根據該公司自己的指引,文字浮水印:

  • 能撐過直接複製貼上、簡單重新排版,以及通過大多數下游工具的傳遞。
  • 可能撐不過大幅編輯、激進改寫、跨語言翻譯,或將 Claude 的輸出與大量人類撰寫文字交錯混合。Anthropic 明確告訴《Business Insider》,將 Claude 的輸出與其他文字混寫可能使浮水印無法被偵測到。

這就是文字浮水印的根本矛盾。與圖片不同——圖片的浮水印可以嵌入在能抵抗大多數轉換的像素級雜訊中——文字是一種離散的、易於操縱的媒介。任何基於統計選詞模式的浮水印,都可以透過足夠的改寫來洗掉。因此,Anthropic 的做法最好被理解為一個「防篡改可見」(tamper-evident)而非「防篡改」(tamper-proof)的系統:它提高了門檻、記錄了來源,但無法保證在對抗性編輯後仍能偵測到。

C2PA 檔案詮釋資料面臨一個相關且眾所周知的限制:任何重新匯出檔案而不保留詮釋資料的工具(截圖、透過中介應用程式重新儲存,或單純剝離類似 EXIF 的資料)都可以輕易將其移除。C2PA 自身的規範也承認這一點;該標準依賴一條信任鏈,一旦中介者不配合,這條鏈就斷裂了。

偵測難題與誰能取得存取權

浮水印只有在有人能讀取時才有意義。Anthropic 已確認偵測是機器可讀的,但「誰能取得偵測工具——以及以何種條件」這個問題仍部分未解。該公司尚未公開承諾第三方偵測器的發布日期或存取模式。從歷史上看,AI 實驗室都嚴格限制浮水印偵測的存取權,以防範對手將偵測器本身當作預言機(oracle),用來反覆迭代剝離浮水印。預期 Anthropic 會透過經過審查的合作夥伴——查核組織、平台安全團隊、學術研究者——提供偵測,而非開放公開工具。

這種存取模式具有政治意涵。如果偵測權保持受限,浮水印服務的對象更多是機構行為者(平台、監管機構、法院),而非個人使用者。一位檢查學生作文的老師,或一位審核自由撰稿人投稿的編輯,必須依賴 Anthropic 選擇開放的那個偵測介面。

更廣的競爭格局

Anthropic 的此舉對 OpenAI、Google 和 Meta 構成了隱性壓力。這幾家公司都曾探索浮水印技術——OpenAI 數年前就發表過 GPT 模型的文字浮水印研究,並在 DALL-E 圖片上提供 C2PA 詮釋資料——但沒有一家承諾標記其旗艦模型的所有文字輸出。《歐盟 AI 法案》對它們一視同仁。如果 8 月 2 日的期限正在被執行,合規就不是可選項;問題僅在於哪家實驗室先推出,以及推出得多麼穩健。

Anthropic 的先行之舉還有一個二階效益:在企業採購團隊正建立 AI 治理框架的關鍵時刻,它將公司定位為負責任、順應法規的供應商。一個能撐過複製貼上、並以密碼學來源詮釋資料為後盾的浮水印,是合規官員在審計時可以指出的具體憑證。

對使用者的意義

對大多數 Claude 使用者而言,這項改變在兩個意義上都是不可見的。浮水印不會改變輸出品質、速度或成本。建立在 Anthropic API 上的開發者不需要修改整合程式碼。實際影響集中在下游:

  • 接收使用者提交 Claude 文字的平台,原則上現在可以標記它——前提是它們擁有偵測存取權。
  • 試圖將 Claude 輸出冒充為人類撰寫的對抗性使用者面臨新障礙,但並非無法克服。改寫仍然是逃生艙。
  • 正當使用者——用 Claude 做研究協助的學生、用它生成程式碼的開發者、用它腦力激盪的作家——不會直接獲益,但最終可能受益於圍繞 AI 輔助工作所形成的更清晰規範,因為來源軌跡讓歸因變得更容易處理。

誠實的總結是:Anthropic 畫下了一條可信的第一線。浮水印並非牢不可破,偵測存取權尚未普及,舊版 Claude 模型(8 月 2 日前推出的)仍然未標記。但這是頭一遭,有前沿 AI 實驗室在模型層級、於全球範圍內預設標記其輸出,以直接回應有約束力的法律。競爭對手是否跟進,以及偵測工具是否廣泛可用,將決定這究竟是成為一項行業標準,還是只是一個孤立的合規憑證。


本文封面圖由 AI 生成。參考來源列於上方 frontmatter 中。