Anthropic 開放 Claude 浮水印偵測 API:監管機構、媒體與事實查核者率先取得鑰匙
Anthropic 的 Claude 浮水印偵測 API 進入私人預覽階段,監管機關、執法單位、媒體、事實查核組織與合規企業首度能以第一方工具驗證文字是否出自 Claude 之手。
2026 年 9 月 1 日,Anthropic 悄然上線了浮水印策略的後半部:Claude 浮水印偵測 API(watermark detection API)進入私人預覽(private preview),首次讓經過篩選的外部組織有能力驗證一段文字是否帶有 Claude 的隱形統計浮水印。監管機關、執法單位、媒體、事實查核組織、獨立研究人員、教育機構與歐盟公民社會團體,現在都可以申請存取權;因自身合規義務而需要驗證浮水印的企業,同樣可以提出申請。
這次上線補完了一個月前啟動的機制。自 2026 年 8 月 2 日起,所有在歐盟推出的 Claude 模型——首先是 Fable 5.1 與 Mythos 5.1——都會在生成文字時嵌入難以察覺的浮水印。如今,外部世界終於有了官方認可的查驗管道。
為什麼重要
過去一年,「AI 偵測」幾乎成了髒字。Pangram、GPTZero 等第三方統計偵測器靠文風特徵推斷文字是否為 AI 所寫,但錯誤率始終居高不下,在教育場域尤其惡名昭彰——誤指學生用 AI 作弊的爭議一再上演。Anthropic 的偵測 API 建立在完全不同的原理上:它不是從風格猜測,而是檢查文字中是否帶有以密鑰刻意植入的類密碼學花紋。
這個差異正是整個故事的核心。該公司表示,這套浮水印是 Google DeepMind 於 2024 年發表在《Nature》的 SynthID-Text 技術的版本,可承受部分編輯與複製貼上——因為它存在於模型的選詞本身,而不是那段一搬家就會被剝掉的詮釋資料(metadata)。如果偵測層如宣稱般運作,收到匿名爆料文件的事實查核員、審查爭議行銷文案的監管者,第一次有了一個可以直接查詢的第一方預言機(oracle),而不是必須盲目信任的啟發式工具。
誰能進場——誰還不能
私人預覽的範圍刻意收窄。Anthropic 的文件列出符合資格的類別:監管機關、執法單位、媒體組織、事實查核者、獨立研究人員、教育機構,以及歐盟公民社會團體——正是歐盟透明化法規實質要求必須能夠查驗標記的那幾類組織。肩負自身 Article 50 合規義務的企業,也可以透過 Claude 浮水印偵測器存取申請表(Claude Watermark Detector Access Request Form)提出申請。Anthropic 表示「計畫逐步擴大偵測 API 的存取範圍」,但未公布全面開放的時間表。
值得注意的是不在名單上的人:一般個人用戶。懷疑學生繳交 AI 作業的老師、想檢查特約撰稿人稿子的編輯,都無法把文字貼進某個公開工具裡查驗。這個限制應是有意為之。浮水印只能回答「這段文字有多大可能是 Claude 部分寫的?」——它無法證明文字是人寫的,也無法辨識其他 AI 模型的輸出,對短文效果尤其差。若貿然全面開放,只會重演統計偵測器已經示範過的高風險濫用:一旦出錯,代價是指控與懲處。
兩條驗證路徑,兩種訊號
偵測 API 其實是 Anthropic 架設的第二套驗證工具。針對生成的檔案——PNG、JPG、SVG 等支援格式——Claude 會在檔案詮釋資料中附加簽署過的 C2PA 內容憑證(Content Credential),這是相機製造商與照片編輯軟體也在使用的開放產業標準。任何人都可以透過免費的 Claude Content Checker 查驗這些憑證,不需要特殊權限,因為簽章本身可被任何支援 C2PA 的工具以密碼學方式驗證。
純文字更難處理。一段散文沒有詮釋資料通道可言,浮水印因此必須織進文字本身。這也造就了將決定後續發展的不對稱:檔案來源證明在設計上就公開可驗,文字驗證卻被擋在 Anthropic 的審批流程與密鑰之後。Hacker News 上的批評者已點出隱私疑慮——檢查任何文字,都必須把整段文字送交 Anthropic。
但細節但書很重要
Anthropic 自己的文件對「偵測結果證明了什麼」異常坦白。偵測到標記,代表內容「可能經過 Claude 處理」——不代表是 Claude 寫的。有人用 Claude 對人寫的文件進行校對、翻譯、摘要或格式轉換,輸出照樣帶標記;浮水印無法區分「Claude 寫的」與「Claude 大幅改寫的」。由 Claude 完成的翻譯會帶浮水印,即使 underlying 的想法與內容完全是別人的。
反過來說,沒有偵測到標記也證明不了什麼。8 月 2 日前推出的舊模型輸出沒有浮水印——Anthropic 仍在透過至 2026 年 12 月 2 日止的過渡期補上;被大幅改寫的文字可能失去標記;極短的段落可能湊不出足夠的選詞訊號;而事實性或程式碼密集的文字,浮水印在設計上就稀疏——因為這技術只會在多個選詞同樣可行時出手。
法律產業刊物《Artificial Lawyer》也點出了專屬於該領域的透明化疑慮:可偵測的 AI 指紋,在合約禁止使用 AI 的爭議中、或在律師費談判中被對方主張「這不是原創」時,可能變成呈堂證據。在事實查核語境下是透明化功能的東西,在法律語境下是自認風險。
布魯塞爾效應,正式運轉
更深遠的意義在於這揭示了 AI 監管實際落地的方式。歐盟 AI 法案 Article 50 的透明化義務自 2026 年 8 月 2 日生效,違者最高可處 2,000 萬歐元或全球年營業額 4% 的罰鍰。Anthropic 與另外約 190 個組織於 2026 年 7 月簽署了歐盟《AI 生成內容透明化實務守則》,並選擇全球一致套用浮水印,而不是嘗試按地區切割。偵測 API 沿用同一套邏輯:一個為歐盟法律設計的合規機制,正在成為全球媒體與公民社會使用的基礎設施。
一個月下來,浮水印實驗已經上演了反彈支線——開源移除工具、退訂潮、8 月中旬達到高峰的用戶抗議。偵測 API 的上線是那個反作用的平衡重量:它讓浮水印對社會變得有用,而不只是對用戶造成負擔。這筆交易成不成立,取決於 Anthropic 如何擴大存取範圍,也取決於其他主要供應商——同為守則簽署者的 OpenAI 與 Google——是否跟進推出相容的驗證機制。
此刻,門開了,但只開了一半。最需要驗證 AI 作者身分的組織——新聞編輯室、監管機關、研究人員——終於有了第一方工具。其他人,繼續等。
Sources
- [1] https://the-decoder.com/anthropic-opens-claude-ai-text-detection-to-regulators-media-fact-checkers-and-others/
- [2] https://www.anthropic.com/news/claude-text-watermark
- [3] https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content
- [4] https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/
- [5] https://www.cnet.com/tech/services-and-software/anthropics-claude-will-add-watermarks-to-ai-generated-text-and-files-2/